نماذج اللغة2024متوسط12 دقيقة قراءة
Gemma: نماذج مفتوحة الأوزان مبنية على أبحاث وتقنيات Gemini
Gemma: Open Models Based on Gemini Research and Technology
Gemma Team · Mesnard, T. · Hardin, C. · Dadashi, R. · Sifre, L. · Rivière, M. · Kale, M. S. — arXiv
المشكلة
مع بداية 2024، كانت النماذج اللغوية الكبرى مثل GPT-4 وGemini وClaude تحقّق نتائج مبهرة، لكنها بقيت محصورة خلف واجهات برمجية مغلقة لا يملك أحد الاطّلاع على أوزانها أو بياناتها. في المقابل، قدّم المجتمع المفتوح نماذج جيدة مثل LLaMA-2 وMistral، لكنها لم تصل إلى مستوى النماذج المغلقة من حيث جودة البيانات ومنهجية وصرامة تقييم الأمان. كان هناك حاجة حقيقية لنماذج مفتوحة الأوزان تجمع بين أداء متقدّم بحجم صغير، وممارسات أمان مسؤولة، وشفافية في التطوير.
الإسهام
قدّمت الورقة Gemma: عائلة من النماذج خفيفة الوزن ومفتوحة الأوزان بحجمين — 2 مليار و7 مليارات معامل — مبنية على نفس الأبحاث والتقنيات التي تقف خلف Gemini. توفّر Gemma نقاط حفظ مُدرَّبة مسبقاً وأخرى مضبوطة بالتعليمات، وتعتمد بنية مُفكِّك ترميز محوِّلي محسَّنة بانتباه متعدد الاستعلامات موضعي دوراني (RoPE) وتنشيطات GeGLU وتسوية RMSNorm. دُرِّبت على ما يصل إلى 6 تريليونات رمز، وتفوّقت Gemma 7B على النماذج المفتوحة المماثلة في الحجم في 11 من أصل 18 معياراً مرجعياً، بنسبة 64.3% على MMLU و46.4% على GSM8K. كما تقدّم الورقة تقييمات شاملة للأمان وتحليلات للحفظ.
الأثر
أثبتت Gemma أنه يمكن تطبيق منهجيات التدريب المتقدّمة لإنتاج نماذج مفتوحة بأداء ممتاز حتى بأحجام صغيرة. ووضعت معياراً جديداً لكيفية إصدار النماذج المفتوحة بمسؤولية، من خلال الجمع بين الأداء وتقييمات الأمان وتحليل الحفظ. أدّت Gemma إلى ظهور Gemma 2 وCodeGemma، وأوضحت للقطاع أن النماذج المفتوحة الأوزان مع ممارسات أمان مدروسة يمكنها توسيع الوصول إلى ذكاء اصطناعي قوي دون التنازل عن المسؤولية.
تخيّل مطعماً عالمياً قضى سنوات في تطوير قائمة طعام استثنائية — أجود المكوّنات، وأرقى التقنيات، وأعلى معايير سلامة الغذاء. ثم تخيّل أن رئيس الطهاة يفتتح مدرسة طبخ ويعطي كل طالب نسخة مُصغَّرة من تلك القائمة: نفس التقنيات، ونفس جودة المكوّنات، ونفس معايير السلامة — لكن بمقادير تناسب مطبخاً منزلياً بدلاً من قاعة حفلات.
هذا ما فعلته جوجل مع Gemma. أخذت البنية وجودة بيانات التدريب والصرامة في تقييم الأمان التي تقف خلف نماذج Gemini الرائدة، وضغطتها في نموذجين صغيرين مفتوحَي الأوزان يستطيع أي شخص تحميلهما وضبطهما ونشرهما — على GPU أو أو حتى معالج حاسوب محمول.
الصورة الكبرى: لماذا تهمّ النماذج المفتوحة الأوزان
مع بداية 2024، كانت أقوى النماذج اللغوية مغلقة المصدر: لا يمكن الوصول إليها إلا عبر واجهات برمجية، ولا أحد يستطيع رؤية أو بيانات تدريبها أو آليات تقييم أمانها. في المقابل، قدّمت البدائل المفتوحة مثل LLaMA-2 (بأحجام 7 و13 و70 مليار معامل) وMistral 7B أداءً قوياً، لكنها افتقرت إلى البنية التحتية للتدريب وجودة تنقية البيانات والتقييم المنهجي للأمان — وهي السمات التي تميّز المختبرات المتقدّمة.
ردّ جوجل كان Gemma — وهو ليس مجرد نموذج مفتوح آخر، بل محاولة مقصودة لنقل المنهجيات المتقدّمة إلى المنظومة المفتوحة. نماذج Gemma مبنية على نفس المنظومة البحثية التي أنتجت Gemini: نفس عائلة البنية، ومعالجة بيانات مشابهة، ونفس إطار تقييم الأمان. الهدف هو تمكين الباحثين والمطوّرين من الحصول على نماذج تجمع بين الأداء العالي، والحجم الصغير الذي يسمح بالتشغيل محلياً، والتقييم الصارم للأمان.
اسم «Gemma» مشتقّ من اللاتينية ويعني «جوهرة» — حجر صغير ونفيس. أُطلق حجمان: نموذج بـ7 مليارات معامل للنشر على GPU وTPU، ونموذج بـ2 مليار معامل مصمَّم للعمل على المعالجات المركزية والأجهزة المحمولة. كلا الحجمين متاح كنقاط حفظ ونُسخ مضبوطة بالتعليمات.
البنية المعمارية: مُفكِّك ترميز المحوِّل بتحسينات حديثة
يعتمد Gemma على بنية بوضع مُفكِّك الترميز فقط — نفس البنية الأساسية التي تقف خلف GPT وGemini. لكن المحوِّل الأصلي الذي ظهر عام 2017 أُضيفت إليه أربعة تحسينات جوهرية طوّرها المجتمع البحثي خلال السنوات التالية. فكّر في الأمر كترقية لمحرّك سيارة أثبتت جدارتها: الهيكل الأساسي لم يتغيّر، لكن كل مكوّن داخلي صُقل ليعمل بكفاءة وأداء أعلى.
1. انتباه متعدد الاستعلامات (MQA) مقابل (MHA). في متعدد الرؤوس التقليدي، يحتفظ كل رأس بإسقاطات مستقلة للمفتاح والقيمة. الفكرة في الانتباه متعدد الاستعلامات أبسط: جميع الرؤوس تتشارك زوجاً واحداً من المفتاح والقيمة، وهذا يخفّض استهلاك الذاكرة أثناء بشكل كبير. يستخدم Gemma 2B هذا الأسلوب (رأس KV واحد)، بينما يستخدم Gemma 7B الانتباه متعدد الرؤوس الكامل (16 رأس KV). السبب في هذا الاختيار أن أظهرت أن كل أسلوب يقدّم أفضل أداء عند حجمه المناسب.
2. التضمين الموضعي الدوراني (RoPE). بدلاً من إضافة أرقام موضع ثابتة إلى الرموز، يُعبّر RoPE عن الموضع عن طريق تدوير متجهات الاستعلام والمفتاح بزاوية تتناسب مع ترتيب الرمز في التسلسل. النتيجة أن النموذج يكتسب إحساساً طبيعياً بالمسافة: الرموز القريبة من بعضها تكون دوراناتها متشابهة، والبعيدة تتباعد. الميزة الإضافية أن RoPE يتعامل بشكل أفضل مع أطوال تسلسلات لم يتعرّض لها أثناء التدريب.
3. تنشيطات GeGLU. بدلاً من التقليدية ReLU التي تعمل كمفتاح تشغيل/إيقاف (تمرّر القيم الموجبة وتحجب السالبة)، يستخدم Gemma تنشيط GeGLU — وهو نسخة مُحسَّنة من GELU تتضمّن بوابة مُتعلَّمة. تخيّل الفرق كصمّام ذكي: بدلاً من الفتح الكامل أو الإغلاق الكامل، تتعلّم الشبكة ضبط الكمّية التي تمرّرها من المعلومات، مما يعطيها تحكّماً أدقّ بكثير.
4. تسوية RMSNorm. بدلاً من تسوية الطبقة (LayerNorm) التي تُجري عمليتين — مَركَزة ثم قياس — يكتفي Gemma بتسوية RMSNorm التي تستخدم جذر متوسط المربعات فقط دون مَركَزة. هذا أخفّ حسابياً وأظهرت التجارب أنه يعمل بنفس الفعالية مع بنى المحوِّلات. يُطبَّق على مدخل كل طبقة فرعية من الانتباه والتغذية الأمامية.
حجمان، وصفة واحدة
يتشارك نموذجا Gemma نفس المخطط المعماري ويختلفان فقط في الحجم. النموذج 7B يتكوّن من 28 طبقة محوِّل ببُعد نموذج 3072 و16 رأس انتباه. النموذج 2B يتكوّن من 18 طبقة ببُعد نموذج 2048 و8 رؤوس انتباه. كلاهما يستخدم حجم رأس 256 وقاموساً مشتركاً من 256,128 رمزاً عبر SentencePiece الموروث من Gemini.
بُعد الطبقة المخفية في شبكة التغذية الأمامية كبير عمداً مقارنةً ببُعد النموذج — يبلغ 49,152 في النموذج 7B و32,768 في النموذج 2B — والسبب أن تنشيطات GeGLU تقسم هذا البُعد داخلياً إلى نصفين: نصف للبوابة ونصف للقيمة، فيكون العرض الفعلي نصف الرقم المُعلَن. كذلك يتشارك كلا النموذجين تضمينات المدخلات والمخرجات لتقليل العدد الإجمالي للمعاملات.
التدريب: البنية التحتية والبيانات والعملية
دُرِّبت نماذج Gemma على عتاد TPUv5e من جوجل. النموذج 7B يُدرَّب عبر 16 مجموعة عنقودية (4,096 شريحة TPUv5e إجمالاً) باستخدام بمعامل 16 و بمعامل 16 داخل كل مجموعة، مع توزيع حالة المُحسِّن بأسلوب مشابه لـ ZeRO-3. أما النموذج 2B فيستخدم مجموعتين عنقوديتين فقط (512 شريحة) مع نسخ بيانات بسيط بمعامل 256. التنسيق بين المجموعات يتمّ عبر نظام Pathways.
بيانات التدريب إنجليزية في الأساس، مصدرها صفحات الويب ونصوص رياضية وشفرات برمجية. النموذج 2B دُرِّب على 2 تريليون ، والنموذج 7B على 6 تريليونات رمز. ومن الجدير بالذكر أن Gemma لا يتعامل مع عدة وسائط — فعلى عكس Gemini، هو يعالج النصوص فقط.
تنقية البيانات كانت شاملة: تُزال المحتويات الضارة أو منخفضة الجودة باستخدام قواعد استكشافية ومصنِّفات مبنية على نماذج، وتُحذف المعلومات الشخصية، وتُستبعد مجموعات التقييم من بيانات التدريب لمنع التلوّث. بالإضافة إلى ذلك، يُعدَّل مزيج البيانات تدريجياً أثناء التدريب بحيث تزداد نسبة البيانات عالية الجودة كلما اقترب التدريب من نهايته — وهي تقنية مشتركة مع Gemini.
الضبط بالتعليمات: من نموذج خام إلى مساعد ذكي
النموذج اللغوي بعد التدريب المسبق يستطيع إكمال النصوص، لكنه لا يعرف كيف يتّبع تعليمات أو يُجري محادثة. نُسخ Gemma المضبوطة بالتعليمات (IT) تمرّ بمرحلتين من المواءمة.
المرحلة الأولى: (SFT). يُدرَّب النموذج على مجموعة منتقاة من أزواج الأسئلة والإجابات النصية بالإنجليزية — بعضها من إعداد بشري وبعضها مولَّد آلياً. عملية انتقاء البيانات تعتمد على مقارنات جنبًا إلى جنب يجريها نموذج لغوي قوي يعمل كحَكَم: يُعرض عليه سؤال محجوز ويقارن بين إجابة النموذج المرشَّح وإجابة مرجعية، ثم يختار الأفضل. هذا الأسلوب ينتقي البيانات التي تعزّز الإفادة والدقة والإبداع والأمان في آنٍ واحد.
المرحلة الثانية: التعلم المعزَّز من التغذية الراجعة البشرية (RLHF). يقارن مقيّمون بشريون بين أزواج من إجابات النموذج ويحدّدون أيها أفضل. يُدرَّب وفق إطار برادلي-تيري ليتنبأ بالإجابة التي يفضّلها البشر. بعد ذلك، تُحسَّن سياسة النموذج باستخدام متغيّر من خوارزمية REINFORCE مع قيد تنظيمي يعتمد على تباعُد KL عن نموذج SFT — والغرض من هذا القيد منع النموذج من الانحراف بعيداً عن سلوكه المُشرَف عليه، مع الاستمرار في تعظيم إشارة المكافأة.
يعتمد Gemma أيضاً تنسيقاً خاصاً للمحادثة باستخدام رموز تحكّم. كل رسالة من المستخدم تُحاط برمزَي <start_of_turn>user و<end_of_turn>، وكل ردّ من النموذج يُحاط برمزَي <start_of_turn>model و<end_of_turn>. هذا التنسيق ضروري عند الاستدلال — فمن الممكن تقنياً التوليد بدونه، لكن النتائج تكون أضعف لأن النموذج يعمل خارج التوزيع الذي تدرّب عليه.
مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.
<start_of_turn>user
# دور المستخدم: يُفتَتح ويُختَتم برموز التحكم
What is the capital of France?<end_of_turn>
<start_of_turn>model
# دور النموذج: نفس الإطار
The capital of France is Paris.<end_of_turn>
<start_of_turn>user
Tell me more about it.<end_of_turn>
<start_of_turn>model
Paris is the most populous city in France...<end_of_turn>
المعايير المرجعية: أين يقف Gemma من المنافسين
قُيِّم Gemma على 18 أكاديمياً تغطي الاستدلال والمعرفة العامة والرياضيات والبرمجة والأمان. النتيجة الأبرز: تفوّق Gemma 7B على النماذج المفتوحة المماثلة في الحجم في 11 من 18 مهمة، بل تجاوز حتى LLaMA-2 13B الأكبر حجماً في عدة معايير.
على MMLU (المعرفة العامة)، سجّل Gemma 7B نسبة 64.3% — متقدّماً على Mistral 7B الذي حقّق 62.5%، ومتفوّقاً بفارق كبير على LLaMA-2 7B بنسبة 45.3%. في GSM8K (مسائل رياضية بمستوى المرحلة الابتدائية)، حقّق Gemma 7B نسبة 46.4% متجاوزاً Mistral 7B (35.4%) بأكثر من 10 نقاط. وعلى HumanEval (توليد الشفرة البرمجية)، سجّل Gemma 7B نسبة 32.3% — متفوّقاً حتى على CodeLLaMA 7B المتخصّص في البرمجة، الذي سجّل 41.4% على MBPP بينما حقّق Gemma فيه 44.4%.
النموذج 2B بدوره يقدّم أداءً جيداً عند حجمه، إذ سجّل 42.3% على MMLU و22.0% على HumanEval — وهي أرقام تنافسية لنموذج صُمّم أصلاً للعمل على المعالجات المركزية والأجهزة المحمولة.
في تقييمات التفضيل البشري مقابل Mistral 7B v0.2 Instruct، حقّق Gemma 7B IT معدل تفضيل 51.7% في اتّباع التعليمات و58% في الأمان. حتى Gemma 2B IT — رغم صغر حجمه — حقّق معدل تفضيل 56.5% في الأمان مقابل Mistral 7B الأكبر بكثير. هذا يوضّح أن مستوى الأمان لا يتحدّد بحجم النموذج فقط.
الأمان: أبعد من المعايير المرجعية
في Gemma ليس ملحقاً أُضيف في النهاية — بل هو جزء أساسي مُدمَج في كل مرحلة. تعرض الورقة تقييمات على 10 معايير أمان تشمل RealToxicity (قياس توليد نصوص سامّة)، وBOLD وCrowS-Pairs (التحيّز الاجتماعي)، وBBQ (أسئلة التحيّز الغامضة)، وWinogender وWinobias (التحيّز المبني على الجنس)، وTruthfulQA (الدقة الوقائعية)، وToxigen (اختبارات سمّية عدائية).
يعمل الأمان في Gemma عبر ثلاث طبقات دفاعية. الأولى: تنقية البيانات — تُنظَّف بيانات التدريب باستخدام قواعد استكشافية ومصنِّفات مبنية على نماذج لإزالة المحتوى الضار والسامّ والشخصي. الثانية: الضبط بالتعليمات من أجل الأمان — مرحلتا SFT وRLHF تُحسِّنان سلوك النموذج نحو الأمان إلى جانب الإفادة، مع بيانات تشجّع النموذج على التحفّظ والرفض وذكر المصادر عند الحاجة. الثالثة: تقييم الحفظ — تختبر الورقة قدرة النموذج على استرجاع بيانات التدريب حرفياً، وتفحص الحفظ الدقيق والتقريبي، وتقيس تحديداً مدى تسرّب المعلومات الشخصية والحسّاسة.
الحفظ: هل يخزّن النموذج بيانات التدريب؟
من أهم المخاوف الأمنية في أي نموذج لغوي: هل يحفظ بيانات التدريب ويستطيع إعادة إنتاجها حرفياً؟ خصوصاً المعلومات الشخصية. لاختبار ذلك، سحب فريق Gemma عيّنة من 10,000 مستند، واستخدم أول 50 رمزاً من كل مستند كموجّه، ثم فحص ما إذا كان النموذج يولّد الرموز الخمسين التالية بشكل مطابق للأصل.
أبرز النتائج: معدّلات الحفظ في Gemma مماثلة لنماذج PaLM بأحجام قريبة. لم يُعثر على أي بيانات شخصية حسّاسة محفوظة. رُصدت بعض البيانات التي قد تكون شخصية، لكن أدوات الكشف الآلي المستخدمة (Google Cloud Sensitive Data Protection) معروفة بكثرة نتائجها الإيجابية الخاطئة، مما يعني أن الكمية الفعلية أقل على الأرجح. أما الحفظ التقريبي (بعتبة مسافة تحرير 10%) فأظهر أن البيانات المحفوظة تقريبياً تزيد بنحو 50% عن المحفوظة حرفياً — وهو نمط ثابت عبر جميع فئات البيانات.
السياق: مشهد النماذج المفتوحة الأوزان
2023
LLaMA (ميتا)
أصدرت ميتا LLaMA، وهي عائلة نماذج أساسية تتراوح بين 7 و65 مليار معامل أظهرت أداءً تنافسياً أمام النماذج المغلقة. كانت متاحة للباحثين فقط في البداية، ثم فُتح الوصول لاحقاً بشكل أوسع.
2023
LLaMA-2 (ميتا)
وسّعت LLaMA-2 النطاق إلى 70 مليار معامل وأضافت نُسخاً مضبوطة للمحادثة، مع ترخيص أكثر سماحة يسمح بالاستخدام التجاري.
2023
Mistral 7B
حقّق Mistral 7B أداءً يوازي LLaMA-2 13B بنصف عدد المعاملات، مقدّماً تقنية انتباه النافذة المنزلقة وراسماً معياراً جديداً في كفاءة النماذج المفتوحة.
2024
Gemma (جوجل ديب مايند)
أصدرت جوجل Gemma — نماذج مفتوحة الأوزان بحجمَي 2 و7 مليارات معامل، مبنية على تقنيات Gemini. تفوّقت على جميع النماذج المفتوحة المماثلة في الحجم على معظم المعايير، مع تقييمات أمان شاملة وتحليل للحفظ.
2024
Gemma 2 وCodeGemma
تبعت جوجل ذلك بإصدار Gemma 2 (بأحجام موسّعة تصل إلى 27 مليار) وCodeGemma (نُسخ متخصّصة في البرمجة)، مواصلةً نهج نقل الأبحاث المتقدّمة إلى نماذج مفتوحة.
الإسهام الأهم لـ Gemma لا يتوقف عند أرقام الأداء — بل يكمن في إثبات أن إصدار نماذج مفتوحة بشكل مسؤول أمر ممكن حتى عند أعلى مستويات التقنية. من خلال الجمع بين تنقية بيانات عالية الجودة، وتحسينات معمارية حديثة، وتقييم أمان منهجي، واختبارات للحفظ، أوضحت جوجل أن «مفتوح» و«مسؤول» لا يتناقضان. الوصفة الآن متاحة للجميع، والمجتمع هو من يقرّر كيف يستخدمها.
المرجعGemma Team, Mesnard, Hardin, Dadashi, Sifre, Rivière, Kale, et al.. Gemma: Open Models Based on Gemini Research and Technology. arXiv, 2024.
مصطلحات هذه الورقة
- الأوزان المفتوحةOpen Weights
- نموذج فكّ الترميز فقطDecoder-Only Model
- الانتباه المتعدد المساراتMulti-Head Attention
- التضمين الموضعي الدوارRotary Position Embedding (RoPE)
- تسوية الجذر التربيعي للمتوسطRMSNorm
- وحدة الخطأ الخطية الغاوسية (GELU)GELU
- الضبط التعليميInstruction Tuning
- التعلم بالتعزيز القائم على التقييم البشريReinforcement Learning from Human Feedback
- الضبط الدقيق الخاضع للإشرافSupervised Fine-Tuning
- تقطير المعرفةKnowledge Distillation
- التدريب المسبقPre-training
- الضبط الدقيقFine-Tuning
- المعيار المرجعيBenchmark
- سلامة الذكاء الاصطناعيAI Safety
- نموذج المكافأةReward Model