Glossary

Data Parallelism

توازي البيانات

استراتيجية تدريب تُوزّع دُفعات البيانات على عدة وحدات معالجة رسومية، كل منها تحتفظ بنسخة من النموذج وتُجمع التدرجات بعد كل خطوة. تُستخدم مع توازي النموذج في تدريب LLaMA.

A training strategy that distributes data batches across multiple GPUs, each holding a copy of the model and aggregating gradients after each step. Used alongside model parallelism in LLaMA training.

Also translated asالتوازي في البيانات، توزيع مصفوفات البيانات عبر المعالجات، معالجة البيانات بالتوازي، معالجة حزم المدخلات المختلفة بالتزامن

First appears in this corpus in: Deep Speech 2: End-to-End Speech Recognition in English and Mandarin (2015)

Appears in these papers