Fully Sharded Data Parallelism
توازي البيانات المُجزَّأ بالكامل
استراتيجية تدريب موزّع تُجزّئ ليس فقط البيانات بل أيضاً حالات المُحسِّن والتدرّجات والمعاملات عبر وحدات المعالجة، مما يُقلّص الذاكرة المطلوبة لكل وحدة بشكل كبير.
A distributed training strategy that shards not just data but also optimizer states, gradients, and parameters across GPUs, dramatically reducing per-GPU memory requirements.
Also translated asFSDP، التوازي المُجزَّأ
First appears in this corpus in: ZeRO: Memory Optimizations Toward Training Trillion Parameter Models (2019)
Appears in these papers