توازي البيانات المُجزَّأ بالكامل
Fully Sharded Data Parallelism
استراتيجية تدريب موزّع تُجزّئ ليس فقط البيانات بل أيضاً حالات المُحسِّن والتدرّجات والمعاملات عبر وحدات المعالجة، مما يُقلّص الذاكرة المطلوبة لكل وحدة بشكل كبير.
A distributed training strategy that shards not just data but also optimizer states, gradients, and parameters across GPUs, dramatically reducing per-GPU memory requirements.
تُرجم أيضاًFSDP، التوازي المُجزَّأ
أول ظهور في هذه المجموعة: ZeRO: تحسينات الذاكرة نحو تدريب نماذج بتريليون معامل (2019)
يظهر في هذه الأوراق