نماذج اللغة2022متوسط10 دقيقة قراءة
تدريب النماذج اللغوية الكبيرة بالكفاءة الحوسبية المُثلى
Training Compute-Optimal Large Language Models
Hoffmann, J. · Borgeaud, S. · Mensch, A. · Buchatskaya, E. · Cai, T. · Rutherford, E. · de Las Casas, D. · Hendricks, L. A. · Welbl, J. · Clark, A. · Rae, J. W. — NeurIPS
المشكلة
بحلول 2022 كانت الوصفة السائدة لتحسين النماذج اللغوية واضحة: كبِّر عدد المعاملات. GPT-3 وصل إلى 175 مليار معامل، وGopher إلى 280 ملياراً، وMegatron-Turing NLG إلى 530 ملياراً. لكن اللافت أن جميعها تدرّبت على نحو 300 مليار رمز فقط. لم يطرح أحد السؤال الجوهري بشكل منهجي: لو كانت لديك ميزانية حوسبية ثابتة، كيف توزّعها بين حجم النموذج وكمّ البيانات؟ كان المجال ينفق مبالغ هائلة على قرار لا يستند إلى أساس تجريبي واضح.
الإسهام
درّب المؤلفون أكثر من 400 نموذج (من 70 مليون إلى 16 مليار معامل، على 5 إلى 500 مليار رمز)، وخلصوا إلى نتيجة واضحة: يتطلّب تكبير النموذج والبيانات بالتساوي، أي أن مضاعفة النموذج تستلزم مضاعفة البيانات. لإثبات ذلك عملياً، درّبوا Chinchilla — نموذج بـ 70 مليار معامل على 1.4 تريليون رمز — بنفس التي استُخدمت لتدريب Gopher البالغ 280 ملياراً. تفوّق Chinchilla على Gopher وGPT-3 وJurassic-1 وMegatron-Turing NLG في كل المقاييس تقريباً، منها قفزة بنسبة 7% على معيار MMLU. وصاغوا L(N,D) = A/N^α + B/D^β + E الذي يصف العلاقة بين حجم النموذج وكمّ البيانات ودالة .
الأثر
غيّرت Chinchilla قواعد اللعبة في تدريب النماذج اللغوية الكبيرة. بيّنت أن معظم النماذج القائمة كانت ناقصة التدريب بفارق كبير، وأن نموذجاً أصغر مُشبعاً بالبيانات يتفوّق على نماذج عملاقة بتكلفة أقل بكثير. النماذج اللاحقة مثل LLaMA وMistral سارت على وصفة Chinchilla: نماذج أصغر على بيانات أكثر بكثير. وكشفت الورقة أيضاً عن أزمة تلوح في الأفق — اقتراب نفاد النصوص عالية الجودة المتاحة — مما رسم ملامح البحث في هذا المجال لسنوات.
تخيّل أنك تحضّر وليمة بـميزانية محدودة. الطهاة قبلك أنفقوا معظم الميزانية على أفران ضخمة (نماذج أكبر) واكتفوا بكيس مكونات صغير (بيانات التدريب). النتيجة؟ أفران فاخرة تعمل بنصف طاقتها.
جاءت Chinchilla وسألت: ماذا لو اشترينا فرناً جيداً وأنفقنا الباقي على المكونات؟
الجواب كان مذهلاً: فرن متوسط ممتلئ بالمكونات (70 مليار ، 1.4 تريليون ) أنتج وجبة أفضل من فرن فاخر بمخزن شبه فارغ (280 مليار معامل، 300 مليار رمز) — بنفس الفاتورة تماماً.
المشكلة: نماذج أكبر، بيانات ثابتة
بين 2020 و2022 كان السباق محتدماً على بناء أكبر ممكن. GPT-3 وصل إلى 175 مليار معامل، وGopher من DeepMind بلغ 280 ملياراً، وMegatron-Turing NLG قفز إلى 530 ملياراً. كل جيل يتجاوز سابقه في الحجم.
لكن هناك تفصيل غاب عن الجميع: بيانات التدريب ظلت ثابتة تقريباً. جميع هذه النماذج تدرّبت على نحو 300 مليار رمز. الخلل واضح — GPT-3 رأى نحو رمزين فقط لكل معامل، بينما النسبة المُثلى (كما ستكشف هذه الورقة) تقارب 20 رمزاً لكل معامل.
هذا يطرح سؤالاً جوهرياً: لو كانت لديك ميزانية حوسبية ثابتة ، كيف توزّعها بين حجم النموذج وعدد رموز التدريب ؟ أعمال Kaplan وزملائه السابقة اقترحت تكبير النماذج بقوة مع إبقاء البيانات محدودة. Chinchilla جاءت لتنقض هذا الاستنتاج.
ثلاث طرق، إجابة واحدة
لم يكتفِ المؤلفون بتجربة واحدة، بل هاجموا السؤال من ثلاث زوايا مستقلة، ودرّبوا أكثر من 400 نموذج. كل طريقة تنظر إلى البيانات بشكل مختلف، لكن الثلاث وصلت إلى النتيجة ذاتها: حجم النموذج والبيانات ينبغي أن يكبرا بالتساوي.
الطريقة الأولى — ثبِّت النموذج وغيِّر البيانات. لكل حجم نموذج (من 70 مليون إلى 16 مليار)، درِّبه على كميات مختلفة من البيانات وتتبَّع أين تصل دالة الفقد إلى أدنى مستوياتها عند كل ميزانية حوسبية. الحجم الأمثل لكل ميزانية يرسم حدّاً أمامياً.
الطريقة الثانية — ثبِّت الحوسبة وغيِّر التوزيع. حدِّد 9 ميزانيات حوسبية مختلفة (). لكل ميزانية، درِّب نماذج بأحجام مختلفة (كل نموذج يحصل على عدد مختلف من الرموز ليبقى ضمن الميزانية). عندما ترسم دالة الفقد مقابل حجم النموذج، تظهر لك نقطة دنيا في كل منحنى — هذه هي النقطة المُثلى حوسبياً.
الطريقة الثالثة — صياغة قانون تحجيم بارامتري. طابِق جميع التجارب بمعادلة واحدة تتنبأ بدالة الفقد انطلاقاً من حجم النموذج والبيانات معاً، ثم استخرِج التوزيع الأمثل تحليلياً.
قانون التحجيم: التنبؤ بدالة الفقد من الحجم والبيانات
البارامتري (الطريقة الثالثة) يصوغ العلاقة بين حجم النموذج وبيانات التدريب ودالة الفقد في معادلة واحدة مُحكمة. لكن قبل الدخول في الرياضيات، لنبنِ الحدس أولاً:
تخيّل أن دالة الفقد هي مجموع ثلاثة «أثمان» يدفعها النموذج. الأول ثمن محدودية حجم النموذج — لا يستطيع تمثيل كل شيء. الثاني ثمن محدودية بيانات التدريب — لم يرَ أمثلة كافية ليتعلّم جيداً. الثالث هو — حتى نموذج مثالي بلا حدود في الحجم والبيانات لن يتنبأ باللغة بدقة كاملة، لأن اللغة البشرية تتضمّن عشوائية حقيقية لا يمكن إزالتها.
تكبير النموذج يقلّل الثمن الأول. زيادة البيانات تقلّل الثاني. أما الثالث فلا يختفي أبداً.
لإيجاد التوزيع الأمثل، نبحث عن القيم التي تصغّر تحت القيد . باستخدام مضروبات لاغرانج، نجد أن الحجم الأمثل وكمّ البيانات الأمثل يتدرّجان كالتالي:
و
حيث و . وبما أن ، فإن كلاً من و ينبغي أن ينمو بنسبة الجذر التربيعي من الميزانية الحوسبية — وهذا يؤكد قاعدة التدرّج المتساوي.
الإثبات: Chinchilla في مواجهة العمالقة
للتحقّق من قانون التحجيم، راهن المؤلفون رهاناً جريئاً. أخذوا الميزانية الحوسبية نفسها التي دُرِّب بها Gopher (280 مليار معامل على 300 مليار رمز) وسألوا: ماذا يقول قانوننا عن النموذج الأمثل لهذه الميزانية؟
الجواب: 70 مليار معامل مدرَّبة على 1.4 تريليون رمز — نموذج أصغر بأربع مرات لكنه يتدرّب على بيانات أكثر بأربع مرات. سمّوه Chinchilla.
النتيجة جاءت حاسمة. Chinchilla لم يكتفِ بمضاهاة النماذج الأكبر — بل تفوّق عليها جميعاً في طيف واسع من المقاييس. نموذج بـ 70 مليار معامل تغلّب على نموذج بـ 530 ملياراً. على معيار MMLU (اختبار المعرفة العامة) سجّل Chinchilla نسبة 67.5% — بقفزة 7% فوق Gopher عند 60.0%. وعلى BIG-Bench رفع متوسط الدقة من 54.4% إلى 65.1%.
الحدّ الأمثل للحوسبة
لكل ميزانية حوسبية هناك زوج أمثل واحد بالضبط من (N, D). عندما ترسم هذه الأزواج عبر ميزانيات مختلفة تحصل على ما يُعرف بـ****. النماذج فوق هذا الحدّ أكبر مما ينبغي لبياناتها، والنماذج تحته أصغر من أن تستغلّ بياناتها. معظم النماذج الكبرى في تلك الحقبة وقعت فوق هذا الحدّ — ناقصة التدريب وضخمة الحجم.
القاعدة بسيطة: عندما تتضاعف الحوسبة، ينبغي أن يكبر كلٌّ من و الأمثلين بنحو ≈ 1.41 مرة. أي أن مضاعفة الحوسبة تعني تكبير النموذج بنحو 40% وزيادة البيانات بنحو 40% — لا مضاعفة حجم النموذج مع إبقاء البيانات كما هي.
قانون التحجيم في الكود
مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.
import numpy as np
from scipy.optimize import minimize_scalar
# الثوابت المُلاءَمة من الورقة (الطريقة الثالثة)
A = 406.4 # معامل حجم النموذج
B = 410.7 # معامل البيانات
alpha = 0.34 # أُسّ حجم النموذج
beta = 0.28 # أُسّ البيانات
E = 1.69 # الفقد غير القابل للاختزال
def chinchilla_loss(N, D):
"""تنبؤ بفقد الإنتروبيا التقاطعية لـ N من المعاملات و D من الرموز."""
return A / N**alpha + B / D**beta + E
def optimal_allocation(C):
"""لميزانية حوسبية C (بالعمليات)، أوجد N و D الأمثلين.
القيد: C ≈ 6 * N * D، إذن D = C / (6 * N).
"""
def loss_for_N(log_N):
N = np.exp(log_N)
D = C / (6 * N)
if D < 1:
return 1e10
return chinchilla_loss(N, D)
# ابحث عن أحجام النماذج من 10 مليون إلى تريليون
result = minimize_scalar(loss_for_N, bounds=(np.log(1e7), np.log(1e12)),
method='bounded')
N_opt = np.exp(result.x)
D_opt = C / (6 * N_opt)
return int(N_opt), int(D_opt), result.fun
# مثال: ميزانية Gopher الحوسبية (≈ 5.76e23 عملية)
C_gopher = 6 * 280e9 * 300e9
N_opt, D_opt, loss = optimal_allocation(C_gopher)
print(f"الأمثل: {N_opt/1e9:.1f} مليار معامل، {D_opt/1e9:.0f} مليار رمز")
print(f"الفقد المُتنبَّأ: {loss:.3f}")
# ← الأمثل: ~67 مليار معامل، ~1400 مليار رمز (قريب من Chinchilla!)لماذا كانت مهمة: الأثر والتبعات
أثر Chinchilla امتدّ عبر المجال بأكمله. ثلاث نتائج غيّرت طريقة بناء النماذج اللغوية الكبيرة:
1. نماذج أصغر مُشبعة بالبيانات حلّت محل العمالقة. نموذج LLaMA من Meta (2023) دُرِّب بـ 65 مليار معامل على 1.4 تريليون رمز — تطبيقاً مباشراً لوصفة Chinchilla — وحقّق أداء GPT-3 بجزء صغير من حجمه. Mistral وGemma وPhi ساروا على النهج ذاته.
2. البيانات أصبحت عنق الزجاجة. إذا كان التدريب الأمثل يتطلب نحو 20 رمزاً لكل معامل، فإن نموذجاً بتريليون معامل يحتاج إلى 20 تريليون رمز من نصوص عالية الجودة. لكن المحتوى المتاح على الإنترنت محدود. هذا فتح الباب لأبحاث مكثفة في وتنقية البيانات وإعادة تدويرها.
3. انخفضت . نموذج بـ 70 مليار معامل يخدم الاستعلامات أسرع بأربع مرات وأرخص بأربع مرات من نموذج بـ 280 ملياراً. التدريب الأمثل حوسبياً جعل نشر النماذج ممكناً لعدد أكبر بكثير من المؤسسات.
2020
Kaplan وزملاؤه — أول قوانين تحجيم
نشرت OpenAI أوّل دراسة منهجية عن قوانين التحجيم للنماذج اللغوية، واقترحت أن تكبير النموذج ينبغي أن يسبق زيادة البيانات. أصبحت هذه هي القناعة السائدة التي ستنقضها Chinchilla لاحقاً.
2020
GPT-3 — 175 مليار معامل، نحو 300 مليار رمز
نموذج OpenAI البارز الذي أظهر قدرات ناشئة مفاجئة، لكنه كان ناقص التدريب بشدة وفق تحليل Chinchilla اللاحق — نحو رمزين فقط لكل معامل.
2021
Gopher — 280 مليار معامل، 300 مليار رمز
نموذج DeepMind الكبير. أداؤه كان قوياً، لكن Chinchilla ستُظهر لاحقاً أن الميزانية الحوسبية نفسها تعطي نتائج أفضل بنموذج أصغر بأربع مرات يتدرّب على بيانات أكثر بأربع مرات.
2022
Chinchilla — 70 مليار معامل، 1.4 تريليون رمز
النموذج الأمثل حوسبياً الذي تفوّق على جميع النماذج العملاقة. نفس ميزانية Gopher الحوسبية، لكنه أصغر بأربع مرات ومدرَّب على بيانات أكثر بأربع مرات — وأفضل أداءً على كل المقاييس تقريباً.
2023
LLaMA — وصفة Chinchilla تصبح مفتوحة المصدر
درّبت Meta نموذج LLaMA وفق نسب Chinchilla المُثلى وأتاحته للجميع. نموذج بـ 65 مليار معامل على 1.4 تريليون رمز ضاهى أداء GPT-3. وسّع الوصول إلى نماذج لغوية قوية خارج نطاق الشركات الكبرى.
2024
ما بعد Chinchilla — تحجيم يراعي الاستدلال
وسّع الباحثون إطار Chinchilla ليشمل تكلفة الاستدلال أيضاً. عندما يخدم النموذج مليارات الاستعلامات، فإن تدريب نموذج أصغر قليلاً على بيانات أكثر يقلّل التكلفة الإجمالية طوال عمره — مما يرفع النسبة المُثلى إلى ما يتجاوز 20 رمزاً لكل معامل.
الأثر الأعمق لـ Chinchilla هو تغيير طريقة التفكير. قبلها كان شعار «الأكبر هو الأفضل» مُسلَّمة لا تُناقش. بعدها أصبح السؤال: «أكبر بأي نسبة؟» الجواب — كبِّر المحورين معاً بالتساوي — يبدو بديهياً بأثر رجعي، لكنه احتاج إلى تدريب 400 نموذج لإثباته، وغيّر طريقة توزيع كل مختبر كبير لأغلى موارده: الميزانية الحوسبية.
المرجعHoffmann, Borgeaud, Mensch, Buchatskaya, Cai, Rutherford, de Las Casas, Hendricks, Welbl, Clark, Rae et al.. Training Compute-Optimal Large Language Models. NeurIPS, 2022.
مصطلحات هذه الورقة
- قانون التحجيمScaling Law
- الميزانية الحوسبيةCompute Budget
- الأمثل حوسبياًCompute-Optimal
- الفقد غير القابل للاختزالIrreducible Loss
- رموز لكل معاملTokens Per Parameter
- ناقص التدريبUndertrained
- منحنى متساوي العمليات الحسابيةIsoFLOP Curve
- قانون التحجيم البارامتريParametric Scaling Law
- الحدّ الأمثل للحوسبةCompute-Optimal Frontier