Gradient Accumulation
تجميع التدرجات الحسابية
تراكم وجدولة متجهات الميل عبر دفعات متعددة صغيرة قبل اتخاذ خطوة التحديث الفعلي للأوزان لتوفير الذاكرة.
Gradient Accumulation
Also translated asالتراكم المتوالي لمتجهات الميل، دمج التحديثات قبل تعديل الأوزان
First appears in this corpus in: Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism (2019)
Appears in these papers
- Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism2019in the sky ✦
- RoBERTa: A Robustly Optimized BERT Pretraining Approach2019in the sky ✦
- RoBERTa: A Robustly Optimized BERT Pretraining Approach2019in the sky ✦
- ZeRO: Memory Optimizations Toward Training Trillion Parameter Models2019in the sky ✦