نماذج اللغة2024متقدم13 دقيقة قراءة

قطيع نماذج Llama 3

The Llama 3 Herd of Models

Grattafiori, A. · Dubey, A. · Jauhri, A. · Pandey, A. · Kadian, A. · et al. — arXiv

المشكلة

بحلول منتصف 2024، كانت أقوى النماذج اللغوية — GPT-4 وGemini وClaude — مغلقة المصدر بالكامل. الباحثون والمطوّرون لم يستطيعوا استخدامها إلا عبر واجهات برمجية محدودة التحكّم، دون رؤية لبيانات أو المنهجيات، ودون إمكانية للضبط الدقيق أو النشر محلّياً. كانت هناك بدائل مفتوحة الأوزان كـ Llama 2 لكنها متأخّرة بفارق واضح عن نماذج الصدارة في والبرمجة والقدرات متعددة اللغات وفهم السياقات الطويلة. ببساطة، لم يكن هناك نموذج مفتوح يُنافس فعلاً أفضل الأنظمة المغلقة على مختلف المحاور.

الإسهام

تُقدّم هذه الورقة Llama 3: عائلة من نماذج الكثيفة بأحجام 8 و70 و405 مليار معامل، جميعها مفتوحة الأوزان. النموذج الرئيسي (405B) دُرِّب على 15.6 تريليون رمز بنافذة سياق تصل إلى 128 ألف رمز، ويستخدم الموضع الدوراني (RoPE) وتنشيط وتسوية RMSNorm. مرحلة ما بعد التدريب تمرّ بجولات متعددة من الضبط الدقيق الموجَّه وأخذ العيّنات بالرفض والتحسين المباشر بالتفضيل. النتيجة: نموذج مفتوح يُنافس GPT-4 عبر المعايير المرجعية، بما فيها MMLU بنسبة 88.6% وHumanEval بنسبة 89.0% وMGSM متعدد اللغات بنسبة 91.6%. النماذج الأصغر دُرِّبت لفترة تتجاوز الحدّ الأمثل حسابياً لرفع الجودة النهائية، فيما يوفّر Llama Guard 3 تصفية أمان للمدخلات والمخرجات.

الأثر

أثبت Llama 3 أن النماذج المفتوحة الأوزان قادرة على مجاراة أداء النماذج المغلقة الرائدة، فأعاد رسم تصوّرات الصناعة حول جدوى الانفتاح. نموذج 405B أصبح لحظة إطلاقه أقوى نموذج لغوي مفتوح متاح، ومكّن الباحثين من دراسة نماذج بمستوى الصدارة وضبطها ونشرها محلّياً. وصفته التدريبية — رفع جودة البيانات، وتدريب النماذج الأصغر لفترة أطول، وما بعد التدريب التكراري — تحوّلت إلى نموذج يُحتذى به على نطاق واسع. Llama 3 سرّع المنظومة المفتوحة وأثّر في نماذج لاحقة كـ DeepSeek-V3، وأكّد أن التوسيع المدروس مع بيانات عالية الجودة أهمّ من الابتكار في البنية المعمارية.

تخيّل أسطولاً من سفن الشحن: زورق سريع (8 مليارات معامل)، وسفينة شحن (70 ملياراً)، وناقلة عملاقة (405 مليارات). التحدّي الحقيقي هو بناء الناقلة — تحتاج أجود الفولاذ (جودة البيانات)، وأضخم حوض بناء سفن (16,000 وحدة معالجة رسومية)، وكمّية هائلة من الوقود (15 تريليون رمز). لكن حالما تُبحر الناقلة، يمكنك أن تُعلّم السفن الأصغر مساراتها عبر المراقبة والتقليد — وهو ما يُعرف بـ.

لم تكتفِ Meta ببناء السفن فحسب، بل نشرت المخططات وفتحت حوض البناء لأيّ شخص يريد الإبحار. هذا هو جوهر Llama 3: قدرات بمستوى الصدارة، مفتوحة بالكامل.

الفلسفة: ثلاث رافعات لا واحدة

الاتجاه السائد في مختبرات الذكاء الاصطناعي الكبرى هو السعي وراء بنىً جديدة — وأنماط مبتكرة وغيرها. لكنّ Meta راهنت على العكس تماماً: استخدِم محوِّلاً كثيفاً قياسياً، وركِّز كلّ الجهد على ثلاث رافعات:

  1. جودة البيانات — 15 تريليون رمز، مُنقَّحة ومُزالة التكرارات بصرامة. خطّ التنقيح وحده يجمع بين مصنِّفات قائمة على قواعد، ومحدِّدات لغة fastText، ومصنِّفات جودة مبنيّة على نماذج دُرِّبت باستخدام Llama 2 نفسه.

  2. الحجم — 405 مليارات معامل دُرِّبت بقدرة حوسبية تبلغ 3.8 × 10²⁵ عملية عبر 16,000 وحدة معالجة H100. وفق الخاصة بالفريق، هذا يقترب من الحجم الأمثل لميزانية التدريب المتاحة.

  3. إدارة التعقيد — حين تبقى البنية بسيطة، يستطيع الفريق التكرار بسرعة على وصفات البيانات واستقرار التدريب ومراحل ما بعد التدريب، دون أن يُضيع وقتاً في تصحيح أخطاء مكوّنات معمارية جديدة.

الفلسفة باختصار: لا تُعقِّد ما يعمل. وسِّع الوصفة، لا البنية.

افتح في المختبر
استكشف أحجام Llama 3 الثلاثة ومواصفاتها الرئيسية.
تستيقظ التجربة عند وصولك…

البيانات: الجودة قبل الكمّ (لكن الكمّ أيضاً)

حجم بيانات تدريب Llama 3 يبلغ 15 تريليون رمز — أي أكثر من 8 أضعاف ما استُخدم في Llama 2 (1.8 تريليون). لكنّ الحجم وحده نصف القصة فقط؛ الفريق بنى خطّ متعدد المراحل يُشبه مصفاة متدرّجة:

المرحلة الأولى: إزالة التكرارات. تُحذف النسخ المتشابهة على مستوى الرابط والمستند والسطر. خوارزمية MinHash تتولّى كشف التشابه التقريبي بين المستندات.

المرحلة الثانية: التصفية بالقواعد. قواعد بسيطة تستبعد المستندات التي تحوي ألفاظاً غير لائقة أو رموزاً خاصة مفرطة أو عدد كلمات منخفض بشكل غير طبيعي.

المرحلة الثالثة: تقييم الجودة بالنماذج. مصنِّف fastText دُرِّب على صفحات عالية الجودة (كمراجع ويكيبيديا) ليمنح كلّ مستند درجة جودة. ما يتجاوز العتبة يمرّ، وما دونها يُستبعد.

المرحلة الرابعة: خطوط متخصصة بالمجال. خطوط منفصلة للكود البرمجي (فحص البنية وإزالة التلوّث)، وللرياضيات (استخراج LaTeX وتصفية المسائل)، وللبيانات متعددة اللغات (مصنِّف جودة مُخصَّص لكل لغة).

مزيج البيانات نفسه مضبوط بعناية: نحو 50% بيانات ويب إنجليزية، و25% كود برمجي، و25% خليط من بيانات متعددة اللغات ورياضيات ومصادر معرفية مُنتقاة. هذا المزيج يتغيّر أثناء التدريب — ففي مرحلة الأخيرة يُرفع نصيب المصادر الأعلى جودة.

افتح في المختبر
تتبّع مستنداً من الويب عبر خط أنابيب تنقيح البيانات متعدد المراحل في Llama 3.
تستيقظ التجربة عند وصولك…

البنية: محوِّل قياسي باختيارات ذكية

Llama 3 هو . البنية تتجنّب عمداً الإضافات الرائجة كـمزيج الخبراء — فالبساطة هنا قرار واعٍ وليست قصوراً. مع ذلك، هناك تعديلات مدروسة تجعل النموذج كفؤاً عند أحجام ضخمة:

انتباه الاستعلام المُجمَّع (GQA): في الانتباه متعدد الرؤوس التقليدي، كلّ رأس استعلام يملك زوج مفتاح-قيمة خاصّاً. الفكرة في GQA هي مشاركة 8 رؤوس مفتاح-قيمة فقط بين 128 رأس استعلام (في نموذج 405B). تخيّل قاعة اجتماعات: بدل أن يكون لكلّ مشارك مدوّن ملاحظات خاص، يكفي 8 مدوّنين مشتركين يخدمون الجميع. النتيجة: تقليص هائل في حجم ذاكرة KV أثناء الاستدلال بلا أثر يُذكر على الجودة.

(RoPE): بدل ترقيم المواضع بأعداد صحيحة، يُدوَّر كلّ متجه استعلام ومفتاح في مستوى ثنائي الأبعاد بزاوية تتناسب مع موقعه. التردد الأساسي ضُبط على 500,000 مما يُتيح مستقرة تصل إلى 128 ألف رمز. عملياً، يبدأ بسياق 8 آلاف رمز ثم يُمدَّد إلى 128 ألفاً في مرحلة تدريب مخصّصة.

تنشيط SwiGLU: شبكة تستخدم SwiGLU — دالة بوّابية تضرب إسقاطين متوازيين أحدهما يمرّ عبر Swish. هذه الآلية تتفوّق عملياً وباستمرار على ReLU وGELU.

تسوية المُسبَقة: قبل كلّ طبقة فرعية تُطبَّق تسوية RMS بدلاً من التقليدية. الفرق أنها أبسط حسابياً وأصبحت المعيار الفعلي في التدريب واسع النطاق.

افتح في المختبر
انقر على كل مكوّن لفهم دوره في كتلة المحوِّل في Llama 3.
تستيقظ التجربة عند وصولك…
GQA:Attention(Q,K,V)=softmax ⁣(QKdk)Vwith nkvnheads\text{GQA:}\quad \text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{Q K^\top}{\sqrt{d_k}}\right) V \quad\text{with } n_{\text{kv}} \ll n_{\text{heads}}
انتباه الاستعلام المُجمَّع — رؤوس مفتاح-قيمة مشتركةفي الانتباه متعدد الرؤوس التقليدي، كلّ رأس يملك إسقاطات K وV مستقلة. الاستعلام المُجمَّع يُشارك عدداً أصغر من رؤوس K وV عبر رؤوس استعلام متعددة. في Llama 3 بحجم 405B مثلاً: 128 رأس استعلام تتشارك في 8 رؤوس KV فقط، فتنخفض الذاكرة المطلوبة لتخزين KV بمقدار 16 ضعفاً.
RoPE:f(xm,m)=xmeimθwhere θj=15000002j/d\text{RoPE:}\quad f(x_m, m) = x_m \, e^{im\theta} \quad\text{where } \theta_j = \frac{1}{500000^{2j/d}}
تضمين الموضع الدورانييُرمِّز RoPE الموضع بتدوير متجهات الاستعلام والمفتاح. رفع التردد الأساسي إلى 500,000 (بدلاً من 10,000 في النسخة الأصلية) يُوسّع نافذة السياق الفعّالة إلى 128 ألف رمز. الميزة الأساسية أن التدوير يُرمِّز المسافة النسبية تلقائياً: الجداء النقطي بين متجهين مُدوَّرين يعتمد فقط على البُعد بينهما لا على موقعيهما المطلقين.

التوسيع: 16,000 وحدة معالجة وفنّ تجنّب الانهيار

تدريب نموذج بـ 405 مليار معامل على هذا النطاق إنجاز هندسي بحدّ ذاته. البنية التحتية ضمّت 16,384 وحدة معالجة NVIDIA H100، كلّ واحدة تُقدّم نحو 400 TFLOPS بدقّة . ولتسخير هذه القدرة، جمع الفريق ثلاث استراتيجيات توازٍ تعمل معاً:

(TP): مصفوفات الأوزان في كلّ طبقة تُقسَّم على 8 وحدات داخل العقدة الواحدة. تخيّل ثمانية أشخاص كلّ منهم يحمل عموداً من جدول بيانات — يُنجز جزءه ثم يُمرِّر النتيجة.

(PP): الطبقات الـ 126 تُوزَّع على 16 مرحلة، فتعالج وحدات مختلفة طبقات مختلفة في الوقت نفسه — تماماً كمحطات على خطّ تجميع.

(DP/FSDP): الدُّفعة الواحدة تُقسَّم على نُسَخ متعدّدة. ومع التوازي المُجزَّأ بالكامل تُوزَّع أيضاً حالات المُحسِّن والتدرّجات، فينخفض استهلاك الذاكرة لكلّ وحدة بشكل كبير.

الحوسبة الإجمالية بلغت نحو 3.8 × 10²⁵ عملية. لوضع الرقم في سياقه: لو اشتغلت وحدة H100 واحدة دون توقّف، لاحتاجت أكثر من 30 مليون سنة لإتمام التدريب نفسه. الفريق حقّق 38–43% من كفاءة استغلال العمليات (MFU)، أي أنه استخلص قرابة نصف الطاقة النظرية لوحدات المعالجة — وهي نتيجة ممتازة عند هذا الحجم. خلال التدريب وقع 466 انقطاعاً منها 47 مُخطَّطاً، وهذا يُوضح لماذا تُعدّ آليات حفظ والاسترداد التلقائي ضرورة لا رفاهية.

افتح في المختبر
شاهد كيف تتعاون استراتيجيات التوازي الشدّي والأنبوبي وتوازي البيانات في تدريب Llama 3 405B.
تستيقظ التجربة عند وصولك…

ما بعد التدريب: من نموذج خام إلى مساعد مفيد

التدريب المسبق يُخرج نموذجاً يُجيد التنبؤ بالرمز التالي فحسب. مهمّة ما بعد التدريب هي تحويله إلى مساعد يفهم التعليمات ويستدلّ بعناية ويرفض الطلبات الضارة. في Llama 3 تتمّ هذه المرحلة عبر حلقة تكرارية من ثلاث خطوات:

1. : يُولّد النموذج الحالي عدّة إجابات مرشّحة لكلّ سؤال، ثم يُقيّمها ولا يُبقي إلا الأفضل. بهذه الطريقة تُنتَج بيانات تدريب اصطناعية عالية الجودة ترفع السقف إلى ما يتجاوز الأمثلة المكتوبة بشرياً.

2. (SFT): يُضبط النموذج على مزيج مُنتقى من العروض التوضيحية البشرية والاصطناعية، يشمل الحوار والبرمجة والاستدلال الرياضي و والتفاعل متعدد اللغات ومهام السياق الطويل.

3. (DPO): بدل تدريب نموذج مكافأة منفصل ثم تشغيل PPO كما في Llama 2، يُحسِّن DPO سياسة النموذج مباشرةً بالمقارنة بين أزواج إجابات (مختارة مقابل مرفوضة). هذا أبسط وأكثر استقراراً، ووجد الفريق أن أداءه يُضاهي PPO أو يتفوّق عليه.

تدور هذه الحلقة عدّة جولات — في كلّ جولة يُستخدم النموذج المُحسَّن لتوليد عيّنات رفض أجود للجولة التالية، فتنشأ دورة تحسين ذاتي. الملاحظة اللافتة: في الجولات المتأخرة يصير النموذج قادراً على توليد بيانات تدريب تتجاوز ما يستطيع المُعلِّقون البشريون إنتاجه في مهام معقّدة كالبرمجة والرياضيات.

افتح في المختبر
تابع خطوات حلقة ما بعد التدريب: أخذ العيّنات بالرفض ← الضبط الدقيق الموجَّه ← التحسين المباشر بالتفضيل، وتُكرَّر عبر عدّة جولات.
تستيقظ التجربة عند وصولك…

المُرمِّز: مفردات من 128 ألف وحدة للعالم

يعتمد Llama 3 على بـ تضمّ 128,256 رمزاً — أي 4 أضعاف Llama 2 البالغة 32 ألفاً. المفردات الأكبر تعني ضغطاً أفضل: 3.94 حرف لكلّ بدلاً من نحو 4.5 سابقاً. عملياً، النص نفسه يُمثَّل برموز أقل فيستطيع النموذج معالجة نصوص أطول ضمن نافذة السياق ذاتها.

الأهمّ من ذلك أن 28,000 رمز أُضيفت خصيصاً للغات غير الإنجليزية. هذا حسّن الضغط بشكل ملحوظ للغات مثل العربية والهندية والتايلاندية التي كانت تعاني من تمثيل ضعيف بالمفردات الأصغر. ضغط أفضل يعني أن النموذج يستوعب مقاطع أطول بهذه اللغات ويتدرّب عليها بكفاءة أعلى.

الأمان: Llama Guard وخط أنابيب السلامة

السلامة مُدمَجة في كلّ مرحلة وليست طبقة تُضاف في النهاية. بيانات ما بعد التدريب تتضمّن مطالبات خصومية مع ردود رفض آمنة، وأمثلة في المنطقة الرمادية ينبغي فيها التجاوب لا الرفض الأعمى، وبيانات من جلسات لمعالجة الحالات الحدّية.

Llama Guard 3 مصنِّف مستقل يعمل كمرشِّح على المدخلات والمخرجات. يفحص مطالبات المستخدم وردود النموذج وفق تصنيف لفئات المحتوى الضار (عنف، محتوى جنسي، نصائح إجرامية وغيرها)، ويمكنه حظر المحتوى أو تمييزه. تصميمه الوحداتي يُتيح للمطوّرين ضبط عتبات الأمان دون إعادة تدريب النموذج الأساسي.

الفريق يُشير إلى تحقيق توازن أفضل بكثير بين الفائدة وعدم الإضرار مقارنةً بـ Llama 2 الذي انتُقد لإفراطه في الرفض. عملياً، ركّزوا على تقليل حالات الرفض الخاطئ مع الحفاظ على مستوى السلامة.

النتائج: المفتوح يلتقي بالصدارة

Llama 3 بحجم 405B يُعادل GPT-4 أو يقترب منه في أبرز :

  • MMLU (المعرفة العامة): 88.6% — منافس لأداء GPT-4 البالغ نحو 86.4%
  • HumanEval (): 89.0% — على مستوى نماذج البرمجة الرائدة
  • GSM8K (الاستدلال الرياضي): 96.8% — أداء يقترب من السقف
  • MGSM (رياضيات متعددة اللغات): 91.6% — أداء قوي عبر 8 لغات
  • MATH (رياضيات أولمبياد): 73.8% — قفزة كبيرة مقارنة بـ Llama 2

النماذج الأصغر مُبهرة بالقدر نفسه ضمن فئتها. نموذج 8B يتفوّق على Mistral 7B وGemma 7B في أغلب المهام، ونموذج 70B ينافس نماذج أكبر منه بكثير مثل Mixtral 8x22B. السبب أن هذه النماذج دُرِّبت عمداً لفترة تتجاوز الحدّ الأمثل حسابياً — أي على رموز أكثر ممّا توصي به قوانين التحجيم — مع التضحية بكفاءة التدريب مقابل جودة نهائية أعلى.

افتح في المختبر
قارن Llama 3 405B مع GPT-4 ونماذج رائدة أخرى عبر المعايير الرئيسية.
تستيقظ التجربة عند وصولك…

تجارب متعددة الوسائط: صور وفيديو وكلام

تعرض الورقة أيضاً نتائج تجريبية لتوسيع Llama 3 ليشمل وسائط متعدّدة، وذلك بـنهج تركيبي: ترتبط متخصصة بالنموذج اللغوي عبر طبقات دون المساس ببنية المُحوِّل الأصلية.

الرؤية: من طراز ViT-H/14 (630 مليون معامل) يُنتج تضمينات لرُقَع الصورة تُحقَن في النموذج النصّي عبر طبقات انتباه مُتقاطع كلّ أربع كتل. يُضيف ذلك نحو 100 مليار معامل فوق نموذج 405B.

الفيديو: تُرمَّز الإطارات بالمُحوِّل البصري نفسه، ثم يدمج مُجمِّع زمني (Perceiver Resampler) كلّ 32 إطاراً في تمثيلات مُلخَّصة.

الكلام: مُرمِّز Conformer بمليار معامل يُعالج أطياف الصوت، وتُدمَج مخرجاته عبر بنية المُحوِّل ذاتها.

هذه النسخ متعدّدة الوسائط حقّقت نتائج تنافسية مع أحدث النماذج، لكنها لم تُطلَق للعموم لأنها كانت لا تزال قيد التطوير عند نشر الورقة.

الفكرة في الكود

كتلة المحوِّل في Llama 3 — GQA + RoPE + SwiGLU + RMSNormpython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

import torch
import torch.nn as nn
import torch.nn.functional as F

class RMSNorm(nn.Module):
    """تسوية RMS — أبسط وأسرع من تسوية الطبقة."""
    def __init__(self, dim, eps=1e-6):
        super().__init__()
        self.weight = nn.Parameter(torch.ones(dim))
        self.eps = eps

    def forward(self, x):
        rms = torch.sqrt(x.pow(2).mean(-1, keepdim=True) + self.eps)
        return x / rms * self.weight

class SwiGLU(nn.Module):
    """SwiGLU: البوابة = swish(W1·x)، المخرج = البوابة ⊙ (W2·x)."""
    def __init__(self, dim, ffn_dim):
        super().__init__()
        self.w1 = nn.Linear(dim, ffn_dim, bias=False)   # إسقاط البوابة
        self.w2 = nn.Linear(dim, ffn_dim, bias=False)   # إسقاط القيمة
        self.w3 = nn.Linear(ffn_dim, dim, bias=False)   # الإسقاط التنازلي

    def forward(self, x):
        return self.w3(F.silu(self.w1(x)) * self.w2(x))

class GroupedQueryAttention(nn.Module):
    """GQA: 128 رأس استعلام تتشارك 8 رؤوس KV ← ذاكرة KV أصغر 16 مرة."""
    def __init__(self, dim, n_heads=128, n_kv_heads=8):
        super().__init__()
        self.n_heads = n_heads
        self.n_kv_heads = n_kv_heads
        self.head_dim = dim // n_heads
        self.repeats = n_heads // n_kv_heads  # كم رأس استعلام لكل رأس KV

        self.wq = nn.Linear(dim, n_heads * self.head_dim, bias=False)
        self.wk = nn.Linear(dim, n_kv_heads * self.head_dim, bias=False)
        self.wv = nn.Linear(dim, n_kv_heads * self.head_dim, bias=False)
        self.wo = nn.Linear(n_heads * self.head_dim, dim, bias=False)

    def forward(self, x):
        B, L, _ = x.shape
        q = self.wq(x).view(B, L, self.n_heads, self.head_dim)
        k = self.wk(x).view(B, L, self.n_kv_heads, self.head_dim)
        v = self.wv(x).view(B, L, self.n_kv_heads, self.head_dim)

        # كرّر رؤوس KV لتُطابق عدد رؤوس الاستعلام
        k = k.repeat_interleave(self.repeats, dim=2)
        v = v.repeat_interleave(self.repeats, dim=2)

        # طبّق RoPE هنا (محذوف للاختصار)
        # انتباه النقطة المُقيَّسة المعياري
        q, k, v = [t.transpose(1, 2) for t in (q, k, v)]
        attn = F.scaled_dot_product_attention(q, k, v, is_causal=True)
        return self.wo(attn.transpose(1, 2).reshape(B, L, -1))

# كتلة Llama 3 الكاملة: تسوية مُسبَقة ← GQA ← اتصال متبقٍّ ← تسوية ← SwiGLU ← اتصال متبقٍّ
# 405B: 126 كتلة، البُعد=16384، 128 رأس Q، 8 رؤوس KV، ffn=53248

قوانين التحجيم: التنبؤ بالمستقبل من تجارب صغيرة

من أكثر إسهامات هذه الورقة أثراً عملياً هو نهجها في قوانين التحجيم. قبل أن يستثمر الفريق مليارات الساعات الحوسبية، درّب مئات النماذج الصغيرة (من 40 مليون إلى 16 مليار معامل) واستخدمها للتنبؤ بأداء نموذج 405B.

الاكتشاف المحوري: المعروف بـ Chinchilla (الذي يُحدّد الحجم الأمثل حسابياً) يعمل جيداً لتحديد حجم النموذج الرئيسي، لكنّ النماذج الأصغر تستفيد كثيراً من التدريب لفترة تتجاوز هذا الحدّ الأمثل. نموذج 8B مثلاً دُرِّب على رموز تفوق ما يوصي به Chinchilla بكثير. السبب بسيط: تكلفة الاستدلال تعتمد على حجم النموذج لا على عدد رموز التدريب. بالتالي، نموذج أصغر مُدرَّب مدّة أطول يكون أرخص في النشر من نموذج أكبر مُحسَّن حسابياً.

طوّر الفريق أيضاً قانون تحجيم من مرحلتين للتنبؤ بأداء المعايير المرجعية: أولاً يُتنبَّأ بقيمة انطلاقاً من كمّية الحوسبة، ثم يُتنبَّأ بدرجة المعيار انطلاقاً من الخسارة. هذا الأسلوب تنبّأ بدقة لافتة بنتائج نموذج 405B اعتماداً على تجارب صغيرة النطاق فقط.

افتح في المختبر
اسحب شريط الحوسبة لترى كيف تتنبّأ قوانين التحجيم بأداء النموذج قبل التدريب الكامل.
تستيقظ التجربة عند وصولك…

سلسلة نماذج Llama

  1. 2023

    Llama 1

    أول نموذج لغوي مفتوح الأوزان من Meta. أحجام من 7 إلى 65 مليار معامل، دُرِّبت على 1.4 تريليون رمز. أثبت أن النماذج المفتوحة مع بيانات كافية قادرة على منافسة الأنظمة المغلقة.

  2. 2023

    Llama 2

    وسّع التدريب إلى 2 تريليون رمز. قدّم انتباه الاستعلام المُجمَّع لكفاءة الاستدلال وتعلّم التعزيز من الملاحظات البشرية مع أخذ العيّنات بالرفض وPPO. أول نموذج مفتوح بنسخة محادثة مخصصة.

  3. 2024

    Llama 3 / 3.1

    النموذج الرئيسي بـ 405 مليار معامل مُدرَّب على 15 تريليون رمز. سياق 128 ألف رمز، DPO يحلّ محل PPO، مفردات 128 ألف، Llama Guard 3 للأمان. أول نموذج مفتوح يُطابق جودة GPT-4.

  4. 2024

    DeepSeek-V3

    بناءً على دروس من وصفة Llama، قدّم DeepSeek-V3 بنية مزيج الخبراء مع كفاءة تدريب مبتكرة، ليصبح أقوى نموذج مفتوح بعد Llama 3 بفترة وجيزة.

المرجعGrattafiori, Dubey, Jauhri, Pandey, Kadian, et al. (530+ authors). The Llama 3 Herd of Models. arXiv, 2024.

مصطلحات هذه الورقة