توازي النموذج
Model Parallelism
استراتيجية تدريب تُقسِّم طبقات النموذج أو معاملاته على عدة وحدات معالجة رسومية لأن النموذج أكبر من أن يسع ذاكرة وحدة واحدة. النموذج ذو الـ65 مليار في LLaMA تدرّب على 2048 وحدة A100.
A training strategy that splits model layers or parameters across multiple GPUs because the model is too large for a single device's memory. LLaMA-65B trained on 2048 A100 GPUs.
تُرجم أيضاًالتوازي في النموذج، التوزيع الهيكلي للأوزان حوسبياً، تقسيم النموذج، تقسيم طبقات الشبكة عبر معالجات متعددة
أول ظهور في هذه المجموعة: نظام الترجمة الآلية العصبية من جوجل: ردم الفجوة بين الترجمة البشرية والآلية (2016)
يظهر في هذه الأوراق
- Gemma: نماذج مفتوحة الأوزان مبنية على أبحاث وتقنيات Gemini2024في السماء ✦
- نظام الترجمة الآلية العصبية من جوجل: ردم الفجوة بين الترجمة البشرية والآلية2016في السماء ✦
- توسيع نطاق النماذج اللغوية: أساليب وتحليلات ورؤى من تدريب Gopher2022في السماء ✦
- LLaMA: نماذج أساسية مفتوحة وعالية الكفاءة للغة2023في السماء ✦
- Megatron-LM: تدريب نماذج لغوية بمليارات المعاملات باستخدام التوازي على مستوى النموذج2019في السماء ✦
- PaLM: توسيع نمذجة اللغة عبر نظام Pathways2022في السماء ✦
- المحوِّلات التبديلية: التوسّع إلى تريليون معامل بتناثر بسيط وفعّال2022في السماء ✦
- ZeRO: تحسينات الذاكرة نحو تدريب نماذج بتريليون معامل2019في السماء ✦