Fully Sharded Data Parallel (FSDP)
التوازي الموزَّع كامل التجزئة
تقنية تدريب موزَّع تُقسّم معاملات النموذج وحالات المُحسِّن والتدرّجات عبر عدة وحدات معالجة رسومية، بحيث تحتفظ كل وحدة بجزء فقط من البيانات في ذاكرتها بدلاً من نسخة كاملة. يُتيح هذا تدريب نماذج أكبر بكثير مما تتحمّله ذاكرة وحدة واحدة.
A distributed training technique that shards model parameters, optimizer states, and gradients across multiple GPUs, so each device holds only a fraction of the data rather than a full replica. This enables training models far larger than a single GPU's memory could accommodate.
Also translated asالتوازي البياني كامل التجزئة، FSDP