نماذج اللغة2024متوسط11 دقيقة قراءة
Mixtral: مزيج الخبراء
Mixtral of Experts
Jiang, A. Q. · Sablayrolles, A. · Roux, A. · Mensch, A. · Savary, B. · Bamford, C. · Chaplot, D. S. · de las Casas, D. · Bou Hanna, E. · Bressand, F. · Lengyel, G. · Bour, G. · Lample, G. · Renard Lavaud, L. · Saulnier, L. · Lachaux, M.-A. · Stock, P. · Subramanian, S. · Yang, S. · Antoniak, S. · Le Scao, T. · Gervet, T. · Lavril, T. · Wang, T. · Lacroix, T. · El Sayed, W. — arXiv
المشكلة
حتى أواخر 2023، كان تكبير النماذج اللغوية يعني تشغيل جميع المعاملات لكل رمز بلا استثناء — طريقة مباشرة لكنها مُكلفة، لأن تكلفة الحوسبة تنمو طردياً مع حجم النموذج. Llama 2 70B مثلاً يقدّم أداءً ممتازاً، لكنه يُنشّط 70 مليار معامل عند كل رمز، فيصبح ثقيلاً وبطيئاً. السؤال المحوري: هل يمكننا بناء نموذج يستفيد من مخزون معرفي ضخم لكنه لا يدفع إلا تكلفة حوسبة نموذج أصغر بكثير عند كل رمز؟
الإسهام
قدّمت هذه الورقة Mixtral 8x7B: نموذج لغوي يعتمد مزيج خبراء متناثراً، يستبدل كل كتلة تغذية أمامية في بنية Mistral 7B بثماني شبكات خبيرة من نوع وموجِّه مُتعلَّم يختار خبيرين لكل رمز. الحصيلة نموذج يضمّ 47 مليار معامل إجمالاً لكنه لا يُنشّط إلا 13 ملياراً لكل رمز. مع نافذة سياق بطول 32 ألف رمز وأوزان مفتوحة بترخيص Apache 2.0، يوازي Mixtral أداء Llama 2 70B وGPT-3.5 أو يتفوّق عليهما في معظم المقاييس المرجعية، ويتقدّم بفارق كبير في الرياضيات وتوليد الشيفرة والمهام متعددة اللغات. أما النسخة المضبوطة على التعليمات (Mixtral Instruct) فتتفوّق على GPT-3.5 Turbo وClaude-2.1 وGemini Pro في التقييم البشري.
الأثر
أثبت Mixtral أن المتناثر بنية ناضجة وجاهزة للاستخدام الفعلي في النماذج اللغوية مفتوحة الأوزان. بيّن أن توجيه الرموز إلى مجموعة فرعية من الخبراء يمكن أن يضاهي أداء نماذج كثيفة تفوقه حجماً بخمس مرات من حيث المعاملات النشطة، ما أعاد تشكيل معادلة التكلفة مقابل الأداء. أثّر Mixtral مباشرةً في تصميم DeepSeek-V3 وفي انتشار بنية مزيج الخبراء بين النماذج الحدودية، ورسّخ مكانة Mistral AI منافساً رئيسياً في ساحة المصادر المفتوحة. وترخيص Apache 2.0 أتاح هذه البنية لمجتمع الباحثين والمطوّرين بأكمله لأول مرة على هذا النطاق.
تخيّل مكتب محاماة يضمّ 8 محامين متخصصين — واحد في الضرائب، وآخر في براءات الاختراع، وثالث في العقود، وهكذا. حين تصل قضية جديدة، يطّلع عليها الشريك المدير ويُحيلها إلى المحاميَيْن الأنسب لطبيعتها. المكتب يستفيد من خبرة 8 محامين مجتمعين، لكن ساعات العمل المحتسبة على كل قضية هي ساعات اثنين فقط.
تخيّل الآن أن كل قضية تختلف عن سابقتها، فالشريك قد ينتقي ثنائياً مختلفاً كلياً في كل مرة. خبير الضرائب قد يعمل على قضية، ثم لا يُستدعى في ثلاث قضايا متتالية، ثم يعود للعمل — التوزيع متغيِّر وليس ثابتاً.
Mixtral يعمل تماماً كهذا المكتب. كل طبقة فيه تحتوي على 8 شبكات «خبيرة»، و**** خفيف يختار اثنتين منها لكل . النموذج يصل إلى 47 مليار معامل من المعرفة، لكن أي رمز لا يُشغّل إلا 13 ملياراً منها — تكلفة نموذج صغير، بسعة نموذج كبير.
البنية: استبدال الطبقات الكثيفة بلجنة من الخبراء
ينطلق Mixtral من بنية نفسها المستخدمة في Mistral 7B — مع ، و، و (RoPE) — لكنه يُدخل تعديلاً جوهرياً واحداً: يستبدل كل شبكة تغذية أمامية بطبقة مزيج خبراء.
في التقليدي، شبكة التغذية الأمامية كتلة واحدة ضخمة يمرّ عبرها كل رمز بلا استثناء. تخيّلها كممرّ وحيد على طريق سريع: مهما اختلفت المركبات، الكل يسلك الممرّ ذاته. في Mixtral يُستبدل هذا الممرّ الواحد بـ8 ممرات متوازية (خبراء)، ومنظِّم مرور (الموجِّه) يوجّه كل مركبة (رمز) إلى الممرَّين الأنسب لها.
كل خبير هو شبكة SwiGLU للتغذية الأمامية — البنية ذاتها داخل Mistral 7B — لكن بمجموعة أوزان مستقلة تماماً. الفكرة المحورية هنا أن النموذج يضمّ 8 خبراء في كل طبقة (بإجمالي نحو 47 مليار معامل)، لكن أي رمز مفرد لا يُنشّط إلا خبيرين اثنين (نحو 13 مليار ). لهذا تُوصف المقاربة بأنها متناثرة: الجزء الأكبر من النموذج يبقى خاملاً عند معالجة أي رمز بعينه.
الموجِّه: كيف يُقرَّر أيُّ الخبراء يُستشارون
الموجِّه (ويُسمى أيضاً ) هو العقل المدبّر لطبقة مزيج الخبراء. مهمته بسيطة في صياغتها: لكل رمز يصل إليه، عليه أن يجيب عن سؤال واحد — «أيّ خبيرين من الثمانية ينبغي أن يتوليا معالجة هذا الرمز؟»
من الناحية الحسابية، الموجِّه مجرد طبقة خطية تعقبها عملية اختيار Top-K ثم دالة . للرمز الوارد تُضرب في مصفوفة أوزان فتُنتج 8 درجات (واحدة لكل خبير). تُبقي العملية على أعلى درجتين فقط وتُعيّن البقية إلى . بعد ذلك تُحوّل Softmax الدرجتين الباقيتين إلى أوزان بوابة — هذه الأوزان تُحدّد في الوقت نفسه مَن من الخبراء يُنشَّط وبأيّ نسبة يُسهم مخرج كل منهما في النتيجة النهائية.
ما يميّز هذا التصميم هو بساطته المدهشة. الموجِّه بلا ذاكرة، بلا تكرار، وبلا حيل خاصة — مجرد ضرب مصفوفي واحد وخطوة اختيار. ومع ذلك يتعلّم أثناء كيف يُرسل كل رمز إلى الخبراء المناسبين بناءً على محتواه.
المتناثر مقابل الكثيف: إنجاز الأكثر بموارد أقل
الفكرة الأساسية التي يطرحها Mixtral واضحة: نموذج متناثر يضمّ 47 مليار إجمالاً لكنه لا يُنشّط إلا 13 ملياراً لكل رمز، يستطيع أن يوازي أداء نموذج كثيف بـ70 مليار معامل تعمل جميعها عند كل رمز — بل قد يتفوّق عليه.
التمييز بين العدد الإجمالي للمعاملات وعدد المعاملات النشطة لكل رمز مبدأ جوهري لفهم هذه البنية. تخيّل مكتبة ضخمة تحوي آلاف الكتب، لكنك حين تبحث عن موضوع بعينه لا تسحب من الرف إلا كتابين أو ثلاثة. المكتبة واسعة، لكن تكلفة قراءتك الفعلية محدودة.
من الناحية العملية، تكلفة الاستدلال في Mixtral تتناسب مع معاملاته النشطة (13 مليار) وليس الإجمالية (47 مليار). يعني ذلك أنه يعالج الرموز بسرعة تقارب سرعة نموذج كثيف بحجم 13 مليار معامل، بينما يغرف من سعة معرفية أكبر بكثير. المقايضة الوحيدة هي الذاكرة: يجب تخزين جميع المعاملات (47 ملياراً)، لكن ذلك يبقى أقل مما يتطلّبه Llama 2 70B.
النتائج: أداء يفوق فئته الحجمية
قُيّم Mixtral على طيف واسع من التي تشمل الاستدلال بالمنطق السليم والمعرفة العامة والفهم القرائي والرياضيات وتوليد الشيفرة والفهم متعدد اللغات.
النتيجة اللافتة: بـ13 مليار معامل نشط فقط، يوازي Mixtral أداء Llama 2 70B — الذي يستخدم خمسة أضعاف هذا العدد من المعاملات النشطة — أو يتفوّق عليه في كل المعايير تقريباً. في الرياضيات (GSM-8K: %74.4 مقابل %69.6) وتوليد الشيفرة (HumanEval: %40.2 مقابل %29.3؛ MBPP: %60.7 مقابل %49.8) الفارق ضخم.
أما مقارنةً بـ GPT-3.5، فيقدّم Mixtral أداءً مكافئاً في MMLU (%70.6 مقابل %70.0) ويتقدّم عليه في الشيفرة (MBPP: %60.7 مقابل %52.2). النسخة المضبوطة على التعليمات (Mixtral Instruct) حققت 8.30 على مقياس MT-Bench — متجاوزةً GPT-3.5 Turbo وClaude-2.1 وGemini Pro في التقييم البشري عبر حلبة LMSys.
القوة متعددة اللغات: ما وراء الإنجليزية
دُرِّب Mixtral في مرحلة على نسبة أعلى بكثير من البيانات متعددة اللغات مقارنةً بـ Mistral 7B. السعة الإضافية التي يوفرها وجود ثمانية خبراء تمنح النموذج مساحة لاستيعاب معرفة لغوية متنوعة دون أن يتراجع أداؤه في الإنجليزية.
النتائج على معايير الفرنسية والألمانية والإسبانية والإيطالية مبهرة بشكل خاص. في MMLU بالفرنسية يسجّل Mixtral نسبة %70.9 مقابل %64.3 لـ Llama 2 70B. وفي MMLU بالألمانية يحقق %71.5 مقابل %64.2. النمط يتكرر في اللغات الأربع وعبر أنواع المعايير الثلاثة (ARC-Challenge وHellaSwag وMMLU)، مع تفوّق مستمر لـ Mixtral على نموذج يستخدم خمسة أضعاف حوسبته النشطة.
التفسير المرجّح أن السعة الإضافية للخبراء توفّر «مساحة تخزينية» لمعرفة خاصة بكل لغة في خبراء متخصصين، بينما تلتقط خبراء أخرى — يُنشَّطون عبر لغات عدة — البنية اللغوية المشتركة بين هذه اللغات.
تحليل التوجيه: فيمَ يتخصص الخبراء؟
سؤال طبيعي يتبادر إلى الذهن: هل يتخصص كل خبير بمجال معيّن — أحدهم يعالج الرياضيات وآخر يتولى الأحياء مثلاً؟ للإجابة، قاس المؤلفون توزيع اختيار الخبراء على أقسام مختلفة من مجموعة بيانات The Pile: مقالات ArXiv، ورياضيات DM، وشيفرات GitHub، ونصوص Gutenberg، وأوراق PhilPapers، وملخصات PubMed، وStackExchange، وويكيبيديا.
الإجابة المفاجئة هي لا — لا يوجد تخصّص واضح على أساس الموضوع. توزيعات تعيين الخبراء تبدو متشابهة بشكل لافت سواء كانت البيانات أوراقاً علمية من ArXiv أو ملخصات طبية من PubMed أو نصوصاً فلسفية من PhilPapers. المجموعة الوحيدة التي أظهرت نمطاً مختلفاً قليلاً هي رياضيات DM، على الأرجح لأنها مجموعة مُولَّدة تصنيعياً ذات تنوّع لغوي محدود.
بدلاً من التخصص الموضوعي، يُظهر الموجِّه سلوكاً تركيبياً (نحوياً). حين نتتبّع التوجيه على مستوى الرموز في شيفرة Python ونصوص رياضية وإنجليزية، نجد أن الأنماط تتبع التركيب لا المعنى: الكلمة المفتاحية self في Python تُرسَل دائماً للخبير نفسه، ورموز المسافات البادئة تتجمّع معاً، والرموز المتتالية ضمن وحدة تركيبية واحدة تتشارك غالباً في الخبراء. هذا «التجاور الموضعي» يبرز خاصةً في الطبقات الوسطى والأخيرة من النموذج.
Mixtral Instruct: من نموذج أساسي إلى مساعد ذكي
نموذج Mixtral الأساسي في جوهره متنبّئ بالرمز التالي. لتحويله إلى مساعد يستجيب للتعليمات، طبّق المؤلفون وصفة ضبط من مرحلتين: أولاً (SFT) على مجموعة بيانات تعليمات، ثم (DPO) على مجموعة بيانات ملاحظات مزدوجة.
تُعدّ DPO بديلاً أبسط من : فبدلاً من تدريب منفصل ثم تشغيل حلقة تعلّم معزَّز، تُحسّن DPO مباشرةً على أزواج من (استجابة مفضّلة، استجابة مرفوضة). النتيجة نموذج متوافق مع تفضيلات البشر دون تعقيدات خوارزمية PPO.
حقّق Mixtral Instruct درجة 8.30 على مقياس MT-Bench وبلغ تقييم Elo مقداره 1121 على حلبة LMSys (حتى ديسمبر 2023) — متقدّماً على Claude-2.1 وجميع إصدارات GPT-3.5 Turbo وGemini Pro وLlama 2 70B Chat. كان آنذاك أعلى نموذج مفتوح الأوزان ترتيباً.
قاس المؤلفون أيضاً التحيزات عبر معياريّ BBQ وBOLD. أظهر Mixtral دقة أعلى على BBQ (%56.0 مقابل %51.5 لـ Llama 2 70B) ما يدلّ على تحيزات اجتماعية أقل، مع مشاعر أكثر إيجابية وتباين مماثل على BOLD.
السياق الطويل: 32 ألف رمز مع استرجاع كامل
دُرِّب Mixtral بـ طولها 32,768 رمزاً، ويدعم كثيفاً كاملاً على النافذة بأسرها. لاختبار ما إذا كان النموذج يستطيع فعلاً توظيف كل هذا السياق، أجرى المؤلفون اختبار استرجاع المفتاح السري: يُزرَع مفتاح عشوائي في موضع عشوائي من نص طويل، ويُطلب من النموذج إيجاده.
حقّق Mixtral دقة استرجاع بنسبة 100% بصرف النظر عن موضع المفتاح أو طول النص. هذا يؤكّد أن النموذج لا يعاني من مشكلة «الضياع في المنتصف» التي تصيب بعض نماذج السياق الطويل.
فضلاً عن ذلك، تنخفض على مجموعة بيانات proof-pile انخفاضاً رتيباً كلما زاد طول السياق — دليل عملي على أن النموذج يستفيد حقاً من السياق الأطول بدلاً من تجاهل الرموز البعيدة.
البنية بنظرة سريعة
مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.
# إعدادات بنية Mixtral 8x7B
config = {
"dim": 4096, # البُعد الخفي
"n_layers": 32, # عدد طبقات المحوِّل
"head_dim": 128, # بُعد كل رأس
"hidden_dim": 14336, # الحجم الوسيط للتغذية الأمامية (لكل خبير)
"n_heads": 32, # عدد رؤوس الانتباه
"n_kv_heads": 8, # رؤوس KV (الانتباه بالاستعلامات المجمَّعة)
"context_len": 32768, # نافذة سياق 32 ألف رمز
"vocab_size": 32000, # حجم المفردات
"num_experts": 8, # خبراء في كل طبقة MoE
"top_k_experts": 2, # خبراء نشطون لكل رمز
}
# المعاملات الإجمالية: ~47 مليار (متناثرة)
# المعاملات النشطة: ~13 مليار (لكل رمز)
سلسلة مزيج الخبراء: من الفكرة إلى Mixtral
1991
مزيج الخبراء (جاكوبس وآخرون)
المفهوم الأصلي لمزيج الخبراء: فرِّق تَسُد، حيث تتعلّم شبكة بوابات كيف تقسّم فضاء المدخلات بين وحدات خبيرة متخصصة.
2017
MoE ببوابات متناثرة (شازير وآخرون)
وسّع مزيج الخبراء إلى مليارات المعاملات باستخدام طبقة بوابات متناثرة توجّه كل رمز إلى عدد محدود من الخبراء. أثبت أن التوجيه المتناثر يتيح بناء نماذج ضخمة بتكلفة حوسبة معقولة.
2022
محوِّل التبديل (فيدس وآخرون)
بسّط التوجيه ليختار خبيراً واحداً فقط لكل رمز (K=1)، ووصل بالنموذج إلى تريليونات المعاملات. أثبت أن توجيهاً أبسط يمكن أن ينجح حتى في أحجام قصوى.
2023
Mistral 7B
نموذج كثيف بسبعة مليارات معامل يعتمد الانتباه بالاستعلامات المجمَّعة والنافذة المنزلقة. تفوّق على Llama 2 13B وشكّل الأساس المعماري الذي بُني عليه Mixtral.
2024
Mixtral 8x7B
استبدل كل شبكة تغذية أمامية في Mistral 7B بثمانية خبراء SwiGLU وموجِّه يختار أعلى اثنين. 47 مليار إجمالاً، 13 مليار نشط. ضاهى أداء Llama 2 70B بخُمس المعاملات النشطة. أوزان مفتوحة بترخيص Apache 2.0.
إسهام Mixtral الحقيقي ليس في تقنية بعينها — مزيج الخبراء كان موجوداً من قبل، وSwiGLU كانت معروفة، وتوجيه Top-K ليس جديداً. الإسهام هو البرهان الهندسي على أن هذه الأفكار، حين تُدمج بعناية في نموذج مفتوح الأوزان، تُنتج منظومة تُعيد رسم معادلة التكلفة مقابل الأداء. أثبت Mixtral للمجتمع أن النماذج المتناثرة ليست مجرد تجربة بحثية بل مسار عملي لنشر نماذج لغوية قوية بتكلفة أقل.
والخط الممتد من Mixtral إلى DeepSeek-V3 — الذي وسّع بنية مزيج الخبراء إلى نطاق أكبر — يؤكّد أن هذا لم يكن طريقاً مسدوداً بل بداية نموذج معماري جديد للنماذج اللغوية الحدودية.
المرجعJiang, Sablayrolles, Roux, Mensch, Savary, Bamford, Chaplot, de las Casas, Bou Hanna, Bressand, Lengyel, Bour, Lample, Renard Lavaud, Saulnier, Lachaux, Stock, Subramanian, Yang, Antoniak, Le Scao, Gervet, Lavril, Wang, Lacroix, El Sayed. Mixtral of Experts. arXiv, 2024.
مصطلحات هذه الورقة
- مزيج الخبراءMixture of Experts
- التنشيط المتفرّقSparse Activation
- آلية البواباتGating Mechanism
- موجِّهRouter
- SwiGLUSwiGLU
- معاينة أعلى الـ (K) احتمالاتTop-k Sampling
- الشبكة العصبية الأماميةFeedforward Neural Network
- نافذة السياقContext Window
- معدل التدفق والإنتاجيةThroughput
- الاستدلالInference
- التحسين المباشر للتفضيلاتDirect Preference Optimization
- انتباه الاستعلام المُجمَّعGrouped Query Attention
- انتباه النافذة المتحركةSliding Window Attention
- المعيار المرجعيBenchmark
- وحدة لغوية (رمز)Token