مزيج الخبراء
Mixture of Experts
بنية نموذج تحتوي على عدد كبير من المعاملات لكن تُفعّل جزءاً صغيراً منها فقط لكل رمز عبر آلية توجيه، مما يُتيح طاقة استيعابية ضخمة بتكلفة حوسبة معقولة.
A model architecture containing a large number of parameters but activating only a small fraction per token via a routing mechanism, enabling massive capacity at reasonable compute cost.
تُرجم أيضاًMoE، الطبقات متعددة التخصصات الموجهة، شبكات تفعيل الخبراء الحوسبية، نموذج مزيج الخبراء
أول ظهور في هذه المجموعة: المحوِّلات التبديلية: التوسّع إلى تريليون معامل بتناثر بسيط وفعّال (2022)
يظهر في هذه الأوراق
- DeepSeek-R1: تحفيز قدرات الاستدلال في النماذج اللغوية الكبيرة عبر التعلم المعزز2025في السماء ✦
- التقرير التقني لـ DeepSeek-V32024في السماء ✦
- Gemini: عائلة نماذج فائقة القدرات تجمع بين وسائط متعددة2023في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- Mistral 7B2023في السماء ✦
- Mixtral: مزيج الخبراء2024في السماء ✦
- π₀: نموذج تدفُّقي للرؤية واللغة والفعل للتحكم العام بالروبوتات2024في السماء ✦
- المحوِّلات التبديلية: التوسّع إلى تريليون معامل بتناثر بسيط وفعّال2022في السماء ✦