نماذج اللغة2022متوسط11 دقيقة قراءة

OPT: نماذج لغوية مفتوحة مُدرَّبة مسبقاً بمعمارية المُحوِّل

OPT: Open Pre-Trained Transformer Language Models

Zhang, S. · Roller, S. · Goyal, N. · Artetxe, M. · Chen, M. · Chen, S. · Dewan, C. · Diab, M. · Li, X. · Lin, X. V. · Mihaylov, T. · Ott, M. · Shleifer, S. · Shuster, K. · Simig, D. · Koura, P. S. · Sridhar, A. · Wang, T. · Zettlemoyer, L. — arXiv

المشكلة

بحلول عام 2022، أثبتت نماذج لغوية كبيرة مثل GPT-3 قدرات لافتة في التعامل مع مهام جديدة بدون أمثلة أو بأمثلة قليلة، لكنها ظلّت محصورة خلف واجهات برمجية مغلقة تتحكّم فيها الشركات. لم يكن بإمكان أي فريق خارج المختبر الأصلي الاطلاع على الأوزان أو إعادة إنتاج أو إجراء تدقيق أمني مستقل. تكلفة تدريب نموذج بـ175 مليار معامل تصل إلى ملايين الدولارات، وهذا أقصى الجامعات والمؤسسات الأصغر تماماً عن الخط الأمامي لأبحاث النماذج اللغوية. المجال كان بحاجة إلى بديل مفتوح فعلاً — لا أوزان مفتوحة فحسب، بل شيفرة تدريب ووصفات بيانات وتوثيق صريح لما يحدث حقاً حين تُدرِّب نموذجاً بهذا الحجم.

الإسهام

سلسلة نماذج OPT (المُحوِّلات المفتوحة المُدرَّبة مسبقاً): مجموعة من النماذج اللغوية التي تعمل بفكّ الترميز فقط، تتراوح أحجامها بين 125 مليون و175 مليار معامل. أُطلقت بالكامل مع الأوزان وشيفرة التدريب وسجلّ تدريب تفصيلي غير مسبوق. يُحقّق OPT-175B أداءً يُضاهي GPT-3 على المعايير القياسية بسُبع فقط. يُوثّق السجلّ كل عطل في العتاد وكل تعديل في معدل التعلّم وكل انحراف في الخسارة على مدار شهرين من التدريب على 992 وحدة A100 — ما يفتح أول نافذة حقيقية على الواقع الفوضوي لتدريب نماذج بهذا الحجم.

الأثر

كسر OPT العُرف السائد بأن نماذج اللغة المتقدمة لا بدّ أن تبقى مغلقة. بنشره الأوزان والشيفرة وسجلات التدريب، أطلق شرارة حركة النماذج مفتوحة المصدر التي خرج منها LLaMA وBLOOM وFalcon وعشرات النماذج المجتمعية. السجلّ أسّس سابقة في شفافية التدريب، وتحسينات الكفاءة — استغلال أفضل للمعالجات الرسومية بنسبة 17% مقارنة بمعايير NVIDIA — أصبحت متاحة للجميع للبناء عليها.

تخيّل أن شركة أدوية اكتشفت دواءً مُنقذاً للحياة، لكنها لم تنشر إلا نتائج التجارب السريرية — بلا تركيبة، بلا تفاصيل تصنيع، بلا دفتر مختبر يُسجّل التجارب الفاشلة وكل تعديل في درجات الحرارة. العلماء الآخرون يرون أن الدواء يعمل، لكنهم لا يستطيعون فهم كيف يعمل ولا تحسينه ولا اكتشاف آثاره الجانبية المخفية.

OPT يشبه مختبراً آخر قرّر أن يُصنّع الدواء نفسه، ويُثبت فعاليته، ثم يفتح كل شيء للعلن: التركيبة الجُزيئية، وخطوات التصنيع بالتفصيل، ومُذكّرة مختبر صريحة تُوثّق كل دُفعة فاسدة وكل عطل في الأجهزة وكل «إعادة تشغيل في الثانية صباحاً». النتيجة: المجتمع العلمي بأكمله يستطيع الآن استنساخ العمل وتدقيقه وتحسينه.

المشكلة: نماذج الصدارة خلف أبواب مغلقة

في عام 2020، أظهر GPT-3 أن نموذجاً لغوياً واحداً بـ175 مليار قادر على أداء عشرات المهام — ترجمة وإجابة عن أسئلة وحساب وتوليد شيفرات — بمجرد تقديم نصّ توجيهي مناسب، سواء أو . النتائج كانت استثنائية، لكن النموذج لم يكن متاحاً إلا عبر واجهة برمجية مدفوعة: الأوزان لم تُنشر، وبيانات التدريب وُصفت دون مشاركتها، وعملية التدريب لُخِّصت في فقرات معدودة.

هذا الوضع أنتج مجتمعاً بحثياً من طبقتين. المختبرات التي تملك مئات الملايين تستطيع تدريب نماذج الصدارة ودراستها من الداخل، أما البقية فمحكومون بالمراقبة من الخارج والتخمين حول التفاصيل المعمارية، دون قدرة على إجراء أو تدقيقات أمنية أو تقييمات عدالة على الأوزان الحقيقية. بعبارة أخرى، قابلية الاستنساخ — حجر الزاوية في أي عمل علمي — كانت مستحيلة.

هنا جاء دور OPT كردّ من فريق Meta AI: إعادة إنتاج قدرة GPT-3 عند حجم 175 مليار معامل، ثم نشر كل شيء — أوزان النموذج بثمانية أحجام (من 125 مليون حتى 175 مليار)، وشيفرة التدريب الكاملة، وسجلّ تفصيلي يومي لعملية التدريب. الهدف لم يكن التفوّق على أحدث النتائج، بل فتح الباب أمام الجميع للوصول إليها.

افتح في المختبر
انقر على أي حجم لاستعراض تفاصيل بنيته — عدد الطبقات، رؤوس الانتباه، أبعاد التضمين، والحوسبة المطلوبة.
تستيقظ التجربة عند وصولك…

البنية المعمارية: نسخ مخطط GPT-3 عمداً

اختار فريق OPT أن يُحاكي بنية GPT-3 عمداً لتكون المقارنة عادلة. كل نموذج في السلسلة هو يعمل بمعمارية فكّ الترميز فقط — أي سلسلة طبقات يرى فيها كل الرموز التي سبقته فقط عبر . هذا التصميم يعني أن النموذج يُولّد النص رمزاً تلو الآخر، وكل تنبّؤ يعتمد على كل ما جاء قبله.

التفاصيل المعمارية تتبع GPT-3 بشكل وثيق مع فروقات محدودة: يستخدم OPT ReLU بدلاً من GeLU، ويعتمد من مكتبة Megatron-LM. جميع النماذج تعمل بطول تسلسل 2048 رمزاً ومُرمَّزة بمُرمِّز من GPT-2. أما فيتراوح بين 0.5 مليون و4 ملايين رمز حسب حجم النموذج.

بيانات التدريب جاءت من مزيج من مصادر متاحة للعموم: المتون النصية التي استُخدمت في تدريب RoBERTa (مثل BookCorpus وCCNews وCC-Stories)، ومجموعة فرعية مُنقَّحة من The Pile (تشمل CommonCrawl وOpenWebText2 وويكيبيديا ومصادر أخرى)، إضافة إلى محادثات Reddit من PushShift.io. بعد إزالة التكرارات — التي حذفت نحو 66% من The Pile — وصل حجم المتن النهائي إلى حوالي 180 مليار رمز (نحو 800 غيغابايت من النصوص). جميع البيانات رُمِّزت بمُرمِّز ترميز أزواج البايت من GPT-2 لضمان التوافق مع النماذج اللغوية المفتوحة السابقة.

التدريب على نطاق واسع: أعطال العتاد وقفزات الخسارة والتوثيق الصادق

تدريب OPT-175B احتاج 992 وحدة NVIDIA A100 (بسعة 80 غيغابايت لكل منها)، نُظِّمت باستخدام كامل التجزئة (FSDP) مع من مكتبة Megatron-LM. هذا المزيج وصل إلى 147 تيرا عملية في الثانية لكل وحدة — بتحسّن 17% عن أرقام NVIDIA المنشورة سابقاً. على صعيد التحسين، استُخدم مع حالات بدقة FP32 وأوزان بدقة FP16، مع وتحجيم ديناميكي للخسارة للحفاظ على الاستقرار العددي.

لكن الإسهام الحقيقي لا يكمن في وصفة البنية التحتية — بل في السجلّ. على مدار شهرين كاملين، وثّق الفريق كل حدث جوهري: 35 إعادة تشغيل يدوية على الأقل، وأكثر من 100 خادم استُبدلت بسبب أعطال في العتاد، وعدة انحرافات في فرضت تخفيض والعودة إلى سابقة.

افتح في المختبر
استعرض الجدول الزمني لتدريب OPT-175B: أعطال العتاد، تخفيضات معدل التعلّم، وقفزات الخسارة خلال شهرين من التدريب.
تستيقظ التجربة عند وصولك…

يكشف السجلّ نمطاً واضحاً في كيفية رصد المشاكل والتعامل معها: كان الفريق يُراقب مُعامل التحجيم الديناميكي، فإذا هوى إلى الصفر مع ارتفاع مفاجئ في مقياس L2 لتنشيطات الطبقة الأخيرة، فهذه علامة على انحراف الخسارة. عندها يعود الفريق إلى نقطة حفظ يكون فيها مُعامل التحجيم سليماً (≥1.0)، ويُخفّض معدَّل التعلُّم، ويستأنف التدريب. هذا الإجراء لم يحصل مرة واحدة — بل تكرّر مراراً طوال فترة التدريب.

هذا المستوى من الشفافية لم يكن له سابقة. قبل OPT، كان كل ما يُنشر عن تدريب نموذج بـ175 مليار معامل لا يتجاوز عبارة «درّبناه وعمل». السجلّ أثبت أن التدريب على هذا النطاق عملية هشّة تحتاج تدخلاً بشرياً مستمراً — حقيقة كانت الأوراق المُنمَّقة تتجاهلها.

الكفاءة: سُبع البصمة الكربونية

من أبرز نتائج الورقة أن تطوير OPT-175B استهلك ما يقارب سُبع البصمة الكربونية لـGPT-3. هذا التقدير محسوب على أساس الحوسبة في جولة التدريب الناجحة فقط. لكن المؤلفين ينبّهون إلى نقطة مهمة: معظم أرقام البصمة الكربونية المنشورة تتجاهل مراحل التجريب — الجولات الفاشلة والبحث عن المعاملات الفائقة وتجارب التنقيح — وهذه المراحل قد تتجاوز تكلفة التدريب النهائي بأضعاف. سجلّ OPT على الأقل يكشف جزءاً من هذه التكلفة المخفية.

مصدر هذه الكفاءة هو الجمع بين التوازي الموزَّع كامل التجزئة والتوازي الموتِّري من Megatron-LM، ما أعطى استغلالاً أفضل للمعالجات الرسومية بنسبة 17% عن الأرقام المنشورة سابقاً. النقطة الجوهرية: هذه التحسينات أُطلقت مع النموذج، أي أن المجتمع بأكمله يستفيد من الاستثمار الهندسي لـMeta — وليس Meta وحدها.

افتح في المختبر
قارن بين البصمة الكربونية المُقدَّرة وتكلفة الحوسبة لـOPT-175B مقابل GPT-3.
تستيقظ التجربة عند وصولك…

التقييم: مُضاهٍ لـGPT-3 لكن ليس مُطابقاً

قيّم المؤلفون OPT على 16 في معالجة اللغة الطبيعية، في إعدادات بدون أمثلة وبأمثلة قليلة، وفق بروتوكول تقييم GPT-3 نفسه. النتائج تُظهر أن أداء OPT-175B يُقارب أداء GPT-3 Davinci في المتوسط: في بعض المهام يتقدّم OPT قليلاً، وفي أخرى يتأخر قليلاً.

لكن هناك ملاحظة مهمة: OPT يتأخّر بشكل منتظم عن GPT-3 في مجموعة فرعية من المهام. يرى المؤلفون أن السبب قد يعود إلى فروقات دقيقة في إعداد التقييم — طريقة تنسيق النصّ التوجيهي، واختيار الأمثلة، وتفاصيل . هذه الملاحظة تكشف مشكلة أعمق في تقييم النماذج اللغوية الكبيرة: تغيير بسيط في صياغة النصّ التوجيهي قد يُحدث فرقاً ملموساً في النتائج.

افتح في المختبر
قارن أداء OPT-175B مع GPT-3 Davinci عبر فئات المعايير القياسية. بدّل بين التقييم بدون أمثلة وبأمثلة قليلة.
تستيقظ التجربة عند وصولك…

اختُبر OPT أيضاً على مهام الحوار عبر خمس مجموعات بيانات: ConvAI2 وWizard of Wikipedia وEmpathetic Dialogues وBlended Skill Talk وWizard of the Internet. المفاجأة أنه في إعداد غير مُشرَف بالكامل — بدون على بيانات حوار — حقّق OPT-175B أداءً تنافسياً أمام نماذج دُرِّبت بإشراف كامل على هذه المهام. هذا يدلّ على أن على نصوص متنوعة وبحجم كبير — خاصة حين تشمل محادثات حقيقية مثل Reddit — يُكسب النموذج قدرة حوارية ناشئة ملحوظة.

التحيّز والسُّمّية: ثمن البيانات المفتوحة

أجرى المؤلفون تقييمات مسؤولة باستخدام ثلاثة معايير راسخة. في كشف خطاب الكراهية (مجموعة بيانات ETHOS)، تفوّق OPT-175B بوضوح على GPT-3 Davinci في جميع الإعدادات — من التقييم بدون أمثلة إلى التقييم بأمثلة قليلة — وهذه نقطة قوة حقيقية.

لكن الصورة تختلف في CrowS-Pairs الذي يقيس النمطية عبر تسع فئات (الجنس، العرق، الدين، الوضع الاجتماعي-الاقتصادي... إلخ). هنا كان أداء OPT-175B أسوأ من GPT-3 في أغلب الفئات (الدرجة الأقل أفضل لأنها تعني تحيّزاً أقل). الدرجة الإجمالية بلغت 69.5% لـOPT مقابل 67.2% لـGPT-3. السبب المرجّح — كما يراه المؤلفون — هو متن PushShift.io Reddit الذي يحتوي بطبيعته على نسبة أعلى من النصوص النمطية والتمييزية.

أما في StereoSet الذي يقيس الوعي بالقوالب النمطية عبر المهن والجنس والدين والعرق، فكان أداء OPT-175B وGPT-3 متقارباً. المؤلفون صريحون بشأن هذه القيود، ويرون أن إتاحة النموذج تُمكّن المجتمع من دراسة هذه التحيّزات ومعالجتها — وهذا مستحيل مع نموذج مغلق.

افتح في المختبر
قارن درجات التحيّز في CrowS-Pairs بين OPT-175B وGPT-3 Davinci عبر الفئات المختلفة. الدرجة الأقل تعني تحيّزاً أقل.
تستيقظ التجربة عند وصولك…

هدف التدريب: التنبّؤ بالرمز التالي

مثل GPT-3، يُدرَّب OPT على مهمة واحدة بسيطة في جوهرها: . الفكرة أن النموذج يقرأ النصّ رمزاً تلو الآخر من اليسار إلى اليمين، وعند كل موضع يُحاول تخمين الرمز التالي بناءً على كل ما سبقه. عملياً، يُنتج النموذج توزيعاً احتمالياً على كامل ، والتدريب يسعى إلى تعظيم احتمال الرمز الصحيح عبر المتن بأكمله.

L(θ)=t=1TlogPθ(xtx1,x2,,xt1)\mathcal{L}(\theta) = -\sum_{t=1}^{T} \log P_\theta(x_t \mid x_1, x_2, \ldots, x_{t-1})
خسارة نمذجة اللغة السببية — قلب تدريب نماذج GPTعند كل موضع tt، يتنبّأ النموذج باحتمال الرمز xtx_t بناءً على جميع الرموز التي سبقته x1,,xt1x_1, \ldots, x_{t-1}. التدريب يُقلّل اللوغاريتم السالب للأرجحية على التسلسل بأكمله. هذا الهدف نفسه المُستخدم في GPT-2 وGPT-3 — ما غيّره OPT ليس هدف التدريب، بل ما يُشاركه مع العالم بعد انتهاء التدريب.

استخدام OPT: من التحميل إلى التوليد

تحميل واستخدام OPT عبر مكتبة Hugging Face Transformerspython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

from transformers import AutoModelForCausalLM, AutoTokenizer

# تحميل OPT-1.3B (يعمل على وحدة معالجة رسومية استهلاكية واحدة)
model_name = "facebook/opt-1.3b"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)

# توليد النص بشكل انحداري تلقائي
prompt = "The future of open-source AI is"
inputs = tokenizer(prompt, return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=50)

print(tokenizer.decode(outputs[0], skip_special_tokens=True))

الأثر: حركة النماذج اللغوية مفتوحة المصدر

  1. 2020

    GPT-3 — حدود مغلقة

    175 مليار معامل وقدرات مذهلة في التعلّم بأمثلة قليلة، لكن الأوزان لم تُنشر. الوصول محصور بواجهة برمجية مدفوعة.

  2. 2022

    OPT — كسر الحاجز

    من 125 مليون إلى 175 مليار معامل، مع أوزان وشيفرة وسجلّ تدريب كلها مفتوحة. ضاهى GPT-3 بسُبع البصمة الكربونية.

  3. 2022

    BLOOM — نموذج مفتوح بُني بجهد مجتمعي

    نموذج متعدد اللغات بـ176 مليار معامل درّبه تجمّع BigScience. أول نموذج لغوي كبير متقدّم بُني بجهد مجتمعي حقيقي.

  4. 2023

    LLaMA — نماذج مفتوحة فعّالة

    خطوة Meta التالية: نماذج أصغر وأكفأ حسابياً (من 7 إلى 65 مليار معامل) تُنافس نماذج أكبر بكثير. أشعلت منظومة مفتوحة ضخمة.

  5. 2023

    LLaMA 2 — مفتوح للاستخدام التجاري

    صدر برخصة تجارية مع نسخ مضبوطة للحوار. لحظة تحوّل: النماذج المفتوحة أصبحت جاهزة للاستخدام الإنتاجي.

الإرث الأعمق لـOPT ليس في أرقام المعايير — بل في العُرف الذي أرساه. قبل OPT، كان الخيار الافتراضي للنماذج اللغوية المتقدمة هو السرية. بعده، صار الانفتاح ميزة تنافسية وتوقعاً بحثياً. Meta نفسها أتبعت OPT بـLLaMA الذي دفع حدود الكفاءة أبعد. وأطلق تجمّع BigScience نموذج BLOOM — نموذج متعدد اللغات بـ176 مليار معامل ساهم في تدريبه أكثر من ألف باحث. ثم توالت Falcon وMistral وعشرات النماذج الأخرى.

تقليد نشر سجلات التدريب ترسّخ هو الآخر. المشاريع المفتوحة اللاحقة بدأت تنشر تفاصيل أكثر عن ديناميكيات التدريب وقفزات الخسارة وتحديات البنية التحتية. تدريب نموذج كبير لم يعد يُقدَّم كمسألة محسومة، بل كتحدٍّ هندسي حيّ — وOPT هي الورقة التي فرضت هذه الصراحة على المجال.

المرجعZhang, Roller, Goyal, Artetxe, Chen, Chen, Dewan, Diab, Li, Lin, Mihaylov, Ott, Shleifer, Shuster, Simig, Koura, Sridhar, Wang, Zettlemoyer. OPT: Open Pre-trained Transformer Language Models. arXiv, 2022.

مصطلحات هذه الورقة