المعجم

توازي النموذج

Model Parallelism

استراتيجية تدريب تُقسِّم طبقات النموذج أو معاملاته على عدة وحدات معالجة رسومية لأن النموذج أكبر من أن يسع ذاكرة وحدة واحدة. النموذج ذو الـ65 مليار في LLaMA تدرّب على 2048 وحدة A100.

A training strategy that splits model layers or parameters across multiple GPUs because the model is too large for a single device's memory. LLaMA-65B trained on 2048 A100 GPUs.

تُرجم أيضاًالتوازي في النموذج، التوزيع الهيكلي للأوزان حوسبياً، تقسيم النموذج، تقسيم طبقات الشبكة عبر معالجات متعددة

أول ظهور في هذه المجموعة: نظام الترجمة الآلية العصبية من جوجل: ردم الفجوة بين الترجمة البشرية والآلية (2016)

يظهر في هذه الأوراق