المعجم

التوازي الموزَّع كامل التجزئة

Fully Sharded Data Parallel (FSDP)

تقنية تدريب موزَّع تُقسّم معاملات النموذج وحالات المُحسِّن والتدرّجات عبر عدة وحدات معالجة رسومية، بحيث تحتفظ كل وحدة بجزء فقط من البيانات في ذاكرتها بدلاً من نسخة كاملة. يُتيح هذا تدريب نماذج أكبر بكثير مما تتحمّله ذاكرة وحدة واحدة.

A distributed training technique that shards model parameters, optimizer states, and gradients across multiple GPUs, so each device holds only a fraction of the data rather than a full replica. This enables training models far larger than a single GPU's memory could accommodate.

تُرجم أيضاًالتوازي البياني كامل التجزئة، FSDP