نماذج اللغة2023متوسط12 دقيقة قراءة

سلسلة Falcon من النماذج اللغوية المفتوحة

The Falcon Series of Open Language Models

Almazrouei, E. · Alobeidli, H. · Alshamsi, A. · Cappelli, A. · Cojocaru, R. · Debbah, M. · Goffinet, E. · Hesslow, D. · Launay, J. · Malartic, Q. · Mazzotta, D. · Noune, B. · Pannier, B. · Penedo, G. — arXiv

المشكلة

بحلول عام 2023، كان بناء النماذج اللغوية المتقدمة يتطلب مجموعات بيانات ضخمة مُنسَّقة يدوياً تجمع بين زحف الويب ومصادر مختارة بعناية كالكتب والأوراق البحثية ومستودعات الشيفرة. هذه العملية مكلفة وتواجه تعقيدات قانونية ويصعب توسيعها لتتجاوز تريليوناً أو اثنين من الرموز. في الوقت نفسه، كانت النماذج تنمو لتصل إلى مئات المليارات من المعاملات، مما يستلزم تدريباً موزّعاً على آلاف وحدات المعالجة الرسومية — غالباً على عناقيد حواسيب فائقة ذات شبكات اتصال عالية النطاق الترددي. لم يكن هناك نموذج مفتوح موثّق يتبع قوانين التحجيم من Chinchilla عند حجم 180 مليار معامل، وكانت الفجوة بين النماذج المفتوحة والمغلقة تتسع.

الإسهام

تتكوّن سلسلة Falcon من ثلاثة نماذج سببية قائمة على فكّ الترميز فقط بأحجام 7 و40 و180 مليار معامل، دُرِّبت بشكل أساسي على مجموعة بيانات RefinedWeb — وهي مجموعة مُستخلَصة من الويب تضم 5 تريليونات رمز بعد تصفية دقيقة وإزالة شاملة للتكرار. دُرِّب Falcon-180B على 3.5 تريليون رمز عبر 4,096 وحدة A100 على سحابة AWS بنطاق اتصال 50 غيغابت/ثانية فقط، مما يجعله أكبر عملية مفتوحة وموثّقة تتبع قوانين التحجيم المثلى من Chinchilla. أثبت الفريق أن بيانات الويب المُصفّاة بصرامة وحدها تكافئ المجموعات المُنسَّقة يدوياً أو تتفوّق عليها، وقدّم آلية انتباه الاستعلام المجمّع لتحسين كفاءة ، ثم أتاح النماذج ومقتطفاً من 600 مليار رمز تحت تراخيص مفتوحة.

الأثر

تحدّت سلسلة Falcon الاعتقاد السائد بأن البيانات المُنسَّقة يدوياً ضرورية للوصول إلى أعلى أداء، فأثبتت أن توسيع بيانات الويب مع تصفيتها بجودة عالية بديلٌ فعّال. عند إصداره أصبح Falcon-180B أحد أقوى النماذج المفتوحة الأوزان، مقترباً من أداء PaLM-2 Large مع كونه موثّقاً بالكامل وقابلاً لإعادة الإنتاج. أثّرت مجموعة بيانات RefinedWeb وخط المعالجة الخاص بها في الجهود اللاحقة المُركِّزة على البيانات، وسرّعت هذه السلسلة منظومة النماذج اللغوية الكبيرة المفتوحة جنباً إلى جنب مع LLaMA.

تخيّل أنك تريد بناء مكتبة تُعلِّم طالباً كل شيء عن العالم. المنهج المعتاد يشبه أن توظّف فريقاً من أمناء المكتبات ليختاروا يدوياً أفضل الكتب والمجلات والموسوعات — عملية بطيئة ومكلفة، ومحدودة بما يستطيع هؤلاء الأمناء الوصول إليه.

Falcon يقلب الفكرة: بدل الانتقاء اليدوي، يجمع كل مطبوعة من كل مكتبة في العالم، ثم يُمرِّر كل صفحة عبر مصفاة جودة دقيقة — يحذف النُّسخ المكرّرة، ويتخلّص من المحتوى الرديء، ويفحص جودة اللغة. النتيجة؟ مكتبة ضخمة ونظيفة لدرجة أن طالباً تعلَّم منها وحدها يتفوّق على من اقتصر على المجموعة المنتقاة يدوياً.

عائلة Falcon: ثلاثة أحجام وفلسفة واحدة

سلسلة Falcon هي ثلاثة نماذج من بنية تعتمد على فقط، طوّرها معهد الابتكار التكنولوجي (TII) في أبوظبي. الفلسفة المشتركة بين النماذج الثلاثة بسيطة وواضحة: وسِّع بيانات الويب عالية الجودة بدل أن تنتقي يدوياً من مصادر متفرّقة.

من حيث الحجم، دُرِّب Falcon-7B على 1,500 مليار باستخدام 384 وحدة A100. أما Falcon-40B فاستهلك ألف مليار رمز بالعدد ذاته من الوحدات. النموذج الأكبر Falcon-180B دُرِّب على 3,500 مليار رمز عبر 4,096 وحدة A100 بسعة 40 غيغابايت، وكان حينها أكبر عملية مفتوحة وموثّقة. ومن الناحية العملية يمكن تشغيل Falcon-7B على جهاز شخصي بشريحة Apple M2، بينما يحتاج Falcon-180B عادةً إلى 8 وحدات A100 بسعة 80 غيغابايت عند الاستدلال.

تقوم فلسفة التصميم على ثلاث ركائز: قابلية تحجيم الأداء أي اتّباع المثلى من Chinchilla بحيث تترجم زيادة الحوسبة إلى تحسُّن متوقَّع، وقابلية تحجيم البيانات أي بناء خط معالجة ينتج تريليونات الرموز الفريدة فلا يحتاج النموذج لتكرار أي بيانات، وقابلية تحجيم العتاد أي تصميم نظام تدريب موزَّع يعمل بكفاءة حتى على بنية سحابية محدودة النطاق الترددي.

افتح في المختبر
قارن نماذج Falcon الثلاثة من حيث عدد المعاملات وحجم بيانات التدريب والموارد الحوسبية المستخدمة.
تستيقظ التجربة عند وصولك…

البيانات: الويب هو كل ما تحتاجه (إن نظّفته جيداً)

في عام 2023 كانت القناعة الراسخة في المجال واضحة: لا يمكن بناء نموذج لغوي متقدّم بدون انتقاء يدوي للبيانات. GPT-3 مثلاً مزج بيانات الويب مع الكتب وويكيبيديا، ومجموعة The Pile جمعت 22 مصدراً متنوّعاً تشمل الأوراق البحثية وشيفرة GitHub وكتب مشروع غوتنبرغ، وخصّص PaLM نصف بياناته لمحادثات من وسائل التواصل الاجتماعي.

فريق Falcon تحدّى هذا الافتراض مباشرةً. بنوا خط معالجة اسمه Macrodata Refinement يأخذ بيانات CommonCrawl الخام ويحوّلها إلى مجموعة تدريب عالية الجودة عبر ثلاث مراحل متتابعة: أولاً استخراج النص وتحديد اللغة، ثم تصفية بقواعد إرشادية تحذف القوالب النمطية والوثائق القصيرة والنصوص الرديئة، وأخيراً إزالة تكرار صارمة بالمطابقة التامّة والتقريبية معاً للتخلّص من أي محتوى مكرّر.

المحصّلة هي RefinedWeb — مجموعة تضم 5 تريليونات رمز إنجليزي، وكانت حينها أكبر مجموعة بيانات ويب موثّقة علنياً. في تجارب مضبوطة، تفوّقت نماذج صغيرة دُرِّبت على RefinedWeb وحدها على نماذج دُرِّبت على The Pile — رغم أنها مجموعة مُنتقاة بعناية — وذلك على اللغة الطبيعية. والأغرب من ذلك أن إضافة بيانات منتقاة يدوياً فوق قاعدة ويب قوية لم تُحسِّن الأداء بشكل ثابت، بل أضعفته في بعض الحالات، على الأرجح لأن التنوّع الطبيعي للويب يتراجع.

افتح في المختبر
تتبّع مسار البيانات من CommonCrawl الخام وصولاً إلى مجموعة RefinedWeb النهائية.
تستيقظ التجربة عند وصولك…

في صيغتها النهائية، تتكوّن بيانات تدريب Falcon من نحو 84% بيانات ويب مصدرها RefinedWeb، مع نسب صغيرة من بيانات تقنية منتقاة (2%) وكتب (6%) وشيفرة برمجية (3%) ومحادثات (5%). النقطة الجوهرية هنا أنه لم يتكرّر أي رمز — كل رمز مرّ على النموذج مرة واحدة فقط خلال التدريب. هذا يختلف عن نماذج مثل LLaMA التي أعادت المرور على بياناتها 1.7 مرة. وحين اختبر الفريق تأثير إضافة 5% شيفرة و10% بيانات أوروبية متعددة اللغات، وجدوا أن التراجع في أداء الاختبار الصفري بالإنجليزية كان طفيفاً لا يُذكر — أي أن هذه الوصفة آمنة لتوسيع قدرات النموذج دون التضحية بجودته الأساسية.

افتح في المختبر
استكشف تأثير تغيير نسب خلطة البيانات — ويب مقابل منتقاة — على أداء النموذج.
تستيقظ التجربة عند وصولك…

البنية: وصفات مُثبَتة مع تعديلات صديقة للاستدلال

بنية Falcon مستوحاة من PaLM، لكن الفريق لم يتبنَّ أي قرار تصميمي دون التحقّق منه بتجارب مصغّرة مستقلة. المبدأ التوجيهي واضح: قابلية التحجيم وكفاءة الاستدلال أهم من مكاسب دقّة هامشية — لأن تحسين البيانات يُعطي عائداً أكبر من تعديل البنية في معظم الأحيان.

أبرز القرارات المعمارية:

و. في متعدد الرؤوس التقليدي، يحتفظ كل رأس بأزواج مفتاح-قيمة خاصة به — وهذا يُثقل ذاكرة KV Cache أثناء التوليد . الفكرة في انتباه الاستعلام الأحادي (Shazeer, 2019) أن جميع رؤوس الاستعلام تتشارك رأس مفتاح-قيمة واحداً، فتنكمش ذاكرة KV Cache بمعامل يساوي عدد الرؤوس. Falcon-7B وFalcon-40B يعتمدان هذا النمط الصرف. أما Falcon-180B فيستخدم صيغة وسطى — انتباه الاستعلام المُجمَّع — بثمانية رؤوس KV، رأس واحد لكل شريحة في . السبب عملي بحت: حين يُوزَّع النموذج على 8 وحدات، لا بدّ أن تمتلك كل شريحة رأس KV خاصاً بها وإلا ستحتاج عمليات مكلفة بين الوحدات.

ترميز الموضع. Falcon-7B وFalcon-40B يستخدمان تضمينات الموضع الدورانية (RoPE)، بينما Falcon-180B يستخدم (تحيّزات خطية في الانتباه). في التجارب تفوّق RoPE بفارق طفيف فقط، لكن الفريق فضّل ALiBi للنموذج الأكبر لأنه كان مُتحقَّقاً منه مسبقاً في بنيتهم التحتية حين انطلق تدريب Falcon-180B.

حساب الانتباه والتغذية الأمامية بالتوازي. المعتاد أن تُحسَب طبقة الانتباه أولاً ثم تُمرَّر نتيجتها إلى شبكة التغذية الأمامية. Falcon يكسر هذا التتابع: يحسبهما معاً بالتوازي داخل كل كتلة مُحوِّل ويجمع المخرجات. الفائدة أن هذا يختصر جولات التزامن بين الوحدات ويرفع قليلاً.

حذف حدود من الطبقات الخطية. إزالة الانحياز تُقلّل حجم البيانات التي يجب مزامنتها بين شرائح التوازي المصفوفي، دون أي تأثير قابل للقياس على الجودة.

افتح في المختبر
قارن بين أنماط الانتباه الثلاثة — متعدد الرؤوس، أحادي الاستعلام، ومُجمَّع الاستعلام — وتأثير كلٍّ منها على حجم ذاكرة KV Cache.
تستيقظ التجربة عند وصولك…

التدريب على نطاق واسع: 4,096 وحدة على السحابة

تدريب نموذج بحجم Falcon-180B فرض تحديات هندسية لم تواجهها أغلب المشاريع المفتوحة من قبل. لحلّها بنى الفريق Gigatron — منظومة تدريب موزَّع مخصّصة تجمع ثلاث استراتيجيات متكاملة:

التوازي ثلاثي الأبعاد يمزج بين ثلاث طبقات: حيث تعالج كل وحدة دفعة صغيرة مختلفة، والتوازي المصفوفي حيث تُقسَم الطبقة الواحدة على عدة وحدات (ثماني وحدات في حالة Falcon-180B)، و حيث تتوزّع الطبقات المختلفة على وحدات مختلفة وتتدفّق الدفعات الصغيرة عبرها بالتتابع. هذا المزيج يمنح تحكّماً دقيقاً في توزيع الذاكرة وتقليل الاتصال.

تجزئة المُحسِّن عبر -1 توزّع حالات المُحسِّن — أي الزخم في — على وحدات التوازي البياني، فتنكمش الذاكرة المطلوبة لكل وحدة بنحو ثلاثة أضعاف. هذا كان ضرورياً لتشغيل Falcon-180B على وحدات A100 بسعة 40 غيغابايت بدل الاضطرار لاستخدام بطاقات 80 غيغابايت الأغلى ثمناً.

نوى Triton المخصّصة تدمج عدة عمليات في نواة GPU واحدة — مثلاً الانتباه و والقناع معاً — مما يُقلّل الرحلات المتكررة إلى الذاكرة ويرفع الإنتاجية.

جرى التدريب بالكامل بدقّة — بما في ذلك حالات المُحسِّن. وجد الفريق أن الدقة المختلطة مع أوزان رئيسية بدقة FP32 ليست ضرورية في إعدادهم، واستخدام BF16 الصرف بسّط المنظومة ووفّر الذاكرة.

النقطة اللافتة أن النظام بأكمله عمل على بنية AWS السحابية بنطاق اتصال 50 غيغابت/ثانية فقط لكل وحدة — بينما الحواسيب الفائقة المخصّصة مثل عناقيد NVIDIA DGX توفّر 400 إلى 800 غيغابت/ثانية. لتحقيق كفاءة عالية تحت هذا القيد الشديد، صمّم الفريق النظام ليتداخل الحساب والاتصال بعناية، واختار قرارات معمارية — كحساب الانتباه والتغذية الأمامية بالتوازي وحذف حدود الانحياز — تقلّل المزامنة بين الوحدات إلى أدنى حدّ.

افتح في المختبر
كيف يوزّع Falcon العمل عبر 4,096 وحدة بدمج ثلاثة أنواع من التوازي — البيانات والمصفوفي وخط الأنابيب.
تستيقظ التجربة عند وصولك…
شيفرة توضيحية: انتباه وتغذية أمامية متوازيان في Falcon (مبسّطة)python

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

# الصيغة المتوازية داخل كل كتلة محوِّل في Falcon
# بدلاً من التتابعية:  y = FFN(Attn(x))
# يحسب Falcon:  y = x + Attn(x) + FFN(x)  (بالتوازي)

def falcon_block(x, layer_norm, attn, ffn):
    # تطبيع طبقة واحد يُطبَّق مرة واحدة
    h = layer_norm(x)

    # الانتباه والتغذية الأمامية يُحسَبان بالتوازي (ليس بالتتابع)
    attn_out = attn(h)        # استعلام أحادي أو مُجمَّع
    ffn_out  = ffn(h)         # تغذية أمامية GeLU قياسية، بلا بوابة

    # جمع كلا المخرجين مع الاتصال المتبقي
    return x + attn_out + ffn_out

النتائج: منافسة الأفضل

اختبر فريق Falcon نماذجهم على طيف واسع من مهام اللغة الطبيعية عبر أداة EleutherAI للتقييم، إلى جانب مهام مختارة من مجموعتَي تقييم PaLM وGPT-3. النتائج ترسم صورة واضحة عن تحسُّن مطّرد مع التحجيم:

Falcon-7B حقّق درجة إجمالية في الاختبار الصفري بلغت 60.8 متجاوزاً نماذج من الحجم نفسه. Falcon-40B وصل إلى 67.1 منافساً Chinchilla الأصلي رغم أنه يملك 70 مليار معامل. أما Falcon-180B فسجّل 70.3 متفوّقاً على PaLM (540 مليار) وLLaMA 2 (70 مليار)، ومقترباً من أداء PaLM-2 Large — ما وضعه ضمن أفضل ثلاثة نماذج لغوية في تلك المرحلة إلى جانب GPT-4 وPaLM-2 Large.

على مستوى المعايير الفردية، أظهر Falcon-180B أداءً قوياً في الاستدلال بالحسّ العام (HellaSwag, PIQA, Winogrande) والإجابة عن الأسئلة (ARC, OpenBookQA) وفهم القراءة (LAMBADA, RACE). المكاسب كانت متّسقة عبر الأحجام الثلاثة، وهذا يؤكّد أن المنهج المرتكز على جودة البيانات يُؤتي ثماره.

نقطة مهمة: الفريق نبّه إلى صعوبة المقارنات المباشرة بين النماذج، لأن كل ورقة تستخدم محفّزات مختلفة واختيارات مهام مختلفة وأدوات تقييم مختلفة. لذلك بنوا مقاييس إجمالية مخصّصة لتجاربهم، وأبلغوا عن النتائج مع تقديرات التباين لضمان الشفافية.

افتح في المختبر
أداء Falcon-180B على المعايير مقارنةً بـ PaLM وLLaMA 2 وGPT-3.5.
تستيقظ التجربة عند وصولك…

وصفة التدريب: التفاصيل المهمة

يعتمد Falcon على مُحسِّن مع جدولة بدالة جيب التمام مسبوقة بمرحلة خطي. وقد تحقّق الفريق من كل خيار عبر تجارب مصغّرة:

تنظيم z-loss يُضيف عقوبة صغيرة على مربع لوغاريتم دالة التجزئة في سوفتماكس. الغرض منه تثبيت التدريب عند الأحجام الكبيرة ومنع القيم من الانجراف، وهي تقنية مأخوذة من PaLM لا تؤثّر على الأداء النهائي.

بقيمة 0.1 كان الأنسب في التجارب. رفع القيمة أضعف الأداء، وخفضها لم يضف فائدة.

معدَّل التعلُّم بُحث عنه بعناية لكل حجم على حدة. القواعد التجريبية المعتادة — كتناسب المعدل عكسياً مع حجم النموذج — تعمل كنقطة انطلاق جيدة، لكنها احتاجت ضبطاً إضافياً لإعدادات Falcon تحديداً.

على صعيد المفردات، يستخدم Falcon من نوع يضم 65,024 مُدخلاً، دُرِّب على عيّنة ممثّلة من بيانات التدريب المسبق. في Falcon-180B تُربط مصفوفتا للمدخلات والمخرجات بأوزان مشتركة ()، مما يُوفّر عدداً كبيراً من المعاملات دون خسارة ملموسة في الجودة.

القيود والأسئلة المفتوحة

كان الفريق صريحاً بشأن حدود عملهم. تجاربهم المصغّرة أُجريت على نماذج صغيرة نسبياً (1-3 مليار معامل، 30-60 مليار رمز)، وهذا لا يضمن أن النتائج تنطبق حرفياً على الأحجام الأكبر — فبعض الظواهر لا تظهر إلا عند أحجام معيّنة، كالسمات الشاذة التي تُعقّد عند حجم 6 مليار معامل، أو أنماط الحفظ التي تتفاقم في النماذج الأكبر.

التقييم اقتصر على مهام اللغة الطبيعية بالإنجليزية. والنماذج المُدرَّبة أساساً على بيانات الويب قد تتراجع في مجالات متخصّصة كتوليد الشيفرة البرمجية أو الاستدلال العلمي مقارنةً بنماذج تمتلك بيانات منتقاة خصّيصاً لتلك المجالات.

نقطة جوهرية أخرى: Falcon نموذج أساسي بدون على التعليمات أو . بدون تقنيات مثل التعلّم المعزَّز من التغذية الراجعة البشرية، قد يُنتج النموذج محتوى ضارّاً أو متحيّزاً أو غير دقيق. الورقة تركّز على التدريب المسبق وتترك المحاذاة كعمل مستقبلي.

وأخيراً، النقاش حول جودة البيانات لم يُحسم. منهج RefinedWeb القائم على الويب فقط يعمل جيداً على المعايير الإجمالية، لكن من المحتمل أن مهامّ بعينها — كتوليد الشيفرة أو الاستدلال الرياضي — تستفيد من انتقاء مستهدَف عند الأحجام الكبيرة، وهي فرضية لا تستطيع التجارب المصغّرة حسمها.

مسيرة Falcon وإرثه

  1. 2022

    خط بيانات RefinedWeb

    بدء تطوير خط أنابيب تنقية البيانات الكبرى. الهدف: استخراج تريليونات الرموز عالية الجودة من CommonCrawl عبر تصفية وإزالة تكرار صارمة.

  2. 2022

    بدء التدريب

    بدء التدريب المسبق في ديسمبر 2022 باستخدام قاعدة Gigatron المخصصة على بنية AWS السحابية بوحدات A100 بسعة 40 غيغابايت.

  3. 2023

    إصدار Falcon-7B وFalcon-40B

    إصدار كلا النموذجين تحت ترخيص Apache 2.0. تصدّر Falcon-40B لفترة قائمة HuggingFace للنماذج اللغوية الكبيرة المفتوحة، مؤكداً نجاح منهج الويب أولاً.

  4. 2023

    إصدار Falcon-180B

    إصدار النموذج الرئيسي مع ترخيص الاستخدام المسؤول. بتدريبه على 3.5 تريليون رمز أصبح أكبر عملية تدريب مسبق مفتوحة موثّقة وأفضل نموذج مفتوح في ذلك الوقت.

  5. 2024

    Falcon-2 متعدد الوسائط

    الجيل الثاني يقدّم Falcon-2 بحجم 11 مليار مع قدرات فهم الصور واللغة، بانياً منظومة متعددة الوسائط على الأسس التي وضعها الجيل الأول.

الإسهام الأعمق لـ Falcon ليس في البنية ولا في حجم النموذج، بل في المنهج: أثبت أن هندسة البيانات — من إزالة التكرار إلى التصفية ومراقبة الجودة على نطاق صناعي — يمكن أن تُغني عن الانتقاء اليدوي المكلف. هذه الرؤية أثّرت في النماذج ومجموعات البيانات التي جاءت بعده، وساعدت في جعل بيانات التدريب عالية الجودة متاحة لشريحة أوسع من الباحثين.

الدرس الثاني لا يقلّ أهمية: التدريب على نطاق واسع لا يتطلّب بالضرورة حواسيب فائقة بمليارات الدولارات. بتصميم منظومة البرمجيات للعمل مع شبكات سحابية عادية، أثبت فريق Falcon أن نظاماً موزَّعاً مُهندَساً بعناية يمكنه تقليص الفجوة بين العناقيد الأكاديمية والحواسيب الفائقة المخصّصة للذكاء الاصطناعي.

المرجعAlmazrouei, Alobeidli, Alshamsi, Cappelli, Cojocaru, Debbah, Goffinet, Hesslow, Launay, Malartic, Mazzotta, Noune, Pannier, Penedo. The Falcon Series of Open Language Models. arXiv, 2023.

مصطلحات هذه الورقة