توازي البيانات
Data Parallelism
استراتيجية تدريب تُوزّع دُفعات البيانات على عدة وحدات معالجة رسومية، كل منها تحتفظ بنسخة من النموذج وتُجمع التدرجات بعد كل خطوة. تُستخدم مع توازي النموذج في تدريب LLaMA.
A training strategy that distributes data batches across multiple GPUs, each holding a copy of the model and aggregating gradients after each step. Used alongside model parallelism in LLaMA training.
تُرجم أيضاًالتوازي في البيانات، توزيع مصفوفات البيانات عبر المعالجات، معالجة البيانات بالتوازي، معالجة حزم المدخلات المختلفة بالتزامن
أول ظهور في هذه المجموعة: Deep Speech 2: التعرّف الشامل على الكلام في الإنجليزية والصينية (2015)
يظهر في هذه الأوراق
- BLOOM: نموذج لغوي متعدد اللغات مفتوح الوصول بـ 176 مليار معامل2022في السماء ✦
- Deep Speech 2: التعرّف الشامل على الكلام في الإنجليزية والصينية2015في السماء ✦
- التقرير التقني لـ DeepSeek-V32024في السماء ✦
- سلسلة Falcon من النماذج اللغوية المفتوحة2023في السماء ✦
- FlashAttention-2: انتباه أسرع بتوازٍ أفضل وتوزيع عمل أذكى2023في السماء ✦
- Gemma: نماذج مفتوحة الأوزان مبنية على أبحاث وتقنيات Gemini2024في السماء ✦
- نظام الترجمة الآلية العصبية من جوجل: ردم الفجوة بين الترجمة البشرية والآلية2016في السماء ✦
- توسيع نطاق النماذج اللغوية: أساليب وتحليلات ورؤى من تدريب Gopher2022في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- النزول التدريجي العشوائي بدفعات كبيرة ودقيقة: تدريب ImageNet في ساعة واحدة2017في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- LLaMA: نماذج أساسية مفتوحة وعالية الكفاءة للغة2023في السماء ✦
- Megatron-LM: تدريب نماذج لغوية بمليارات المعاملات باستخدام التوازي على مستوى النموذج2019في السماء ✦
- OPT: نماذج لغوية مفتوحة مُدرَّبة مسبقاً بمعمارية المُحوِّل2022في السماء ✦
- PaLM: توسيع نمذجة اللغة عبر نظام Pathways2022في السماء ✦
- المحوِّلات التبديلية: التوسّع إلى تريليون معامل بتناثر بسيط وفعّال2022في السماء ✦
- التعرّف على الكلام بمتانة عالية من خلال إشراف ضعيف على نطاق واسع2022في السماء ✦
- ZeRO: تحسينات الذاكرة نحو تدريب نماذج بتريليون معامل2019في السماء ✦