ZeRO
ZeRO
مجموعة تحسينات لتقليل استهلاك الذاكرة في التدريب الموزّع بتوزيع حالات المُحسِّن والمتدرجات والمعاملات على عدة وحدات بدلاً من تخزين نسخ كاملة في كل واحدة. ZeRO-1 يوزّع حالات المُحسِّن فقط.
A set of memory optimizations for distributed training that partitions optimizer states, gradients, and parameters across GPUs instead of replicating them. ZeRO-1 partitions only optimizer states.
Also translated asتحسين التكرار الصفري
First appears in this corpus in: The Falcon Series of Open Language Models (2023)
Appears in these papers