نماذج اللغة2022متقدم13 دقيقة قراءة

PaLM: توسيع نمذجة اللغة عبر نظام Pathways

PaLM: Scaling Language Modeling with Pathways

Chowdhery, A. · Narang, S. · Devlin, J. · Bosma, M. · Mishra, G. · Roberts, A. · Barham, P. · Chung, H.W. · Sutton, C. · Gehrmann, S. — JMLR

المشكلة

بحلول مطلع 2022، كانت تجارب توسيع النماذج اللغوية إلى مئات المليارات من المعاملات قد أعطت نتائج مُبشِّرة — GPT-3 بحجم 175 مليار، وGopher بحجم 280 مليار، وMegatron-Turing NLG بحجم 530 مليار — لكنّ أسئلة جوهرية ظلّت بلا إجابة. هل ستستمرّ مكاسب الأداء مع زيادة الحجم أم أنّها بلغت سقفها؟ هل يستطيع نموذج واحد عامّ الغرض أن ينافس نماذج متخصّصة مضبوطة بعناية من دون أيّ إضافي؟ والأهمّ: البنية التحتية المتاحة آنذاك كانت تفرض تقسيم النموذج إلى مراحل متتالية وهندسة معقّدة تحدّ من الكفاءة، ولم يكن أيّ نظام قد نجح في تدريب نموذج بهذا الحجم عبر عدّة وحدات TPU Pods في وقت واحد.

الإسهام

قدّمت الورقة PaLM: محوِّل كثيف يعمل بفاكّ الترميز فقط بحجم 540 مليار معامل، دُرِّب على 780 مليار رمز باستخدام نظام Pathways. كان أوّل نظام يُوسِّع التدريب إلى 6144 شريحة TPU v4 موزّعة على وحدتي Pod، وحقّق رقماً قياسياً في استغلال العتاد بنسبة 57.8%. تصدّر PaLM نتائج عبر مئات المعايير المرجعية، وتغلّب على نماذج مضبوطة بعناية في مهام الاستدلال متعدّد الخطوات، وتجاوز متوسّط الأداء البشري على معيار BIG-bench. كذلك أدخلت الورقة تعديلات معمارية مؤثّرة: تنشيط ، وتشغيل الانتباه والشبكة الأمامية بالتوازي (تسريع 15%)، ، وتضمينات الموضع الدورانية RoPE.

الأثر

أثبت PaLM أنّ مكاسب التوسيع لم تبلغ حدّها — النماذج الأكبر مع بيانات أكثر ظلّت تفتح قدرات جديدة، بما فيها قفزات مفاجئة «ناشئة» في مهام الاستدلال. وأرسى البنية التحتية Pathways التي شغّلت لاحقاً نماذج Gemini. خياراته المعمارية — SwiGLU، والطبقات المتوازية، وانتباه الاستعلام المتعدّد، وتضمينات RoPE — صارت الوصفة المعتمدة في الجيل التالي من النماذج الكبيرة. ودفعت نتائجه في الاستدلال بأمثلة قليلة أبحاث التفكير التسلسلي إلى الأمام، بينما أظهر متغيّره المضبوط بالتعليمات (Flan-PaLM) ما يحدث حين يجتمع الحجم الكبير مع تنوّع المهام.

تخيّل أنّك تبني برجاً شاهقاً لدرجة أنّ أساساً واحداً لا يكفيه. من سبقوك إمّا اكتفوا بأساس واحد فاصطدموا بسقف الارتفاع، أو ربطوا مبانيَ منفصلة بوصلات غير مستقرّة — وهذا يشبه ما يفعله . نظام Pathways من Google أشبه بأن تصبّ أساسين ضخمين جنباً إلى جنب وتربطهما بنفق تحت الأرض: كلّ أساس يحمل نصف البناء، والأحمال تتوزّع بينهما عبر النفق، فيرتفع البرج كلّه كقطعة واحدة. هذا البرج هو PaLM — بارتفاع 540 مليار ، وأوّل مبنى يقوم على نظام الأساسين.

التحدّي: التدريب خارج حدود وحدة Pod واحدة

بحلول 2022، كانت النماذج اللغوية الكبرى قد وصلت إلى حائط سدّ في البنية التحتية. وحدة TPU v3 Pod الواحدة تضمّ 2048 شريحة كحدّ أقصى — يكفي لتدريب نماذج مثل LaMDA وGLaM، لكنّ 540 مليار معامل كثيف تحتاج أكثر من ذلك بكثير. نموذج Megatron-Turing NLG بحجم 530 مليار استخدم 2240 وحدة معالجة رسومية مع التوازي الأنبوبي، أي أنّ النموذج يُقسَّم إلى مراحل متتالية على أجهزة مختلفة. المشكلة هنا أنّ كلّ مرحلة تنتظر السابقة، فتنشأ فترات خمول تُسمّى «فقاعات أنبوبية» تأكل من الكفاءة الحسابية.

PaLM سلك طريقاً مختلفاً تماماً: بدل تقسيم النموذج إلى مراحل متسلسلة، اعتمد على نظام Pathways لتنسيق التدريب عبر 6144 شريحة TPU v4 موزّعة على وحدتي Pod كاملتين، مستخدماً فقط بين الوحدتين، و المعتاد داخل كلّ وحدة. لا توازٍ أنبوبي على الإطلاق.

افتح في المختبر
شاهد كيف يُنسّق نظام Pathways التدريب عبر وحدتي Pod — الحوسبة الأمامية والخلفية تجري داخل كلّ وحدة، ثمّ تُنقل التدرّجات عبر شبكة مركز البيانات.
تستيقظ التجربة عند وصولك…

البنية: محوِّل معدَّل يعمل بفاكّ الترميز فقط

PaLM هو كثيف يعمل بـ فقط — ينتمي إلى العائلة ذاتها التي ينتمي إليها GPT-3 — لكنّه يتضمّن ستّة تعديلات هندسية رفعت الجودة والسرعة معاً:

1. تنشيط SwiGLU: بدلاً من دوال التنشيط المعتادة كـReLU أو GELU في ، يستخدم PaLM تنشيط SwiGLU القائم على : Swish(xW₁) ⊙ (xW₃). يحتاج ذلك ثلاث عمليات ضرب مصفوفات بدل اثنتين، لكنّ التحسّن في الجودة يعوّض التكلفة الحسابية الإضافية.

2. الطبقات المتوازية: في المحوِّل المعتاد، يعمل والشبكة الأمامية بالتتابع (x + Attention(LayerNorm(x)) ثمّ + FFN(LayerNorm(...))). أمّا في PaLM فيعملان بالتوازي: x + Attention(LayerNorm(x)) + FFN(LayerNorm(x)). هذا يمنح تسريعاً قدره 15% تقريباً عند الأحجام الكبيرة من دون أيّ خسارة في الجودة.

3. انتباه الاستعلام المتعدّد: في المعتاد، ينتج كلّ رأس إسقاطات منفصلة للمفتاح والقيمة. انتباه الاستعلام المتعدّد يتشارك إسقاطاً واحداً للمفتاح وآخر للقيمة عبر جميع الرؤوس، فيخفّض استهلاك الذاكرة والحوسبة بشكل ملحوظ أثناء .

4. تضمينات : تُرمّز الموضع عبر مصفوفات دوران تُطبَّق على متّجهات الاستعلام والمفتاح، وتُعمّم على تسلسلات أطول بكفاءة أعلى من المطلق أو المُتعلَّم.

5. تضمينات مشتركة للمدخلات والمخرجات: تُستخدم مصفوفة نفسها لتحويل الرموز عند الدخول ولإسقاط عند الخروج، ممّا يوفّر عدداً كبيراً من المعاملات.

6. بلا حدود انحياز: جميع الطبقات الكثيفة وطبقات تحذف حدّ ، وهو ما يُحسّن استقرار التدريب عند الأحجام الكبيرة.

افتح في المختبر
انقر على كلّ تعديل معماري لترى كيف يُغيّر بنية المحوِّل المعتادة.
تستيقظ التجربة عند وصولك…

دُرِّب PaLM على ثلاثة أحجام لدراسة كيف يتغيّر السلوك مع التوسيع:

  • PaLM 8B: 32 طبقة، 16 رأساً، بُعد خفي 4096 — خطّ الأساس لـ.
  • PaLM 62B: 64 طبقة، 32 رأساً، بُعد خفي 8192 — يُنافس Chinchilla ذا الـ 70 مليار.
  • PaLM 540B: 118 طبقة، 48 رأساً، بُعد خفي 18432 — النموذج الرئيسي. بُعد كلّ رأس 256، وحجم الطبقة الأمامية الوسيطة 73728 (أربعة أضعاف البُعد الخفي).

الأحجام الثلاثة دُرِّبت على 780 مليار من مزيج يضمّ صفحات ويب مُصفّاة، وكتباً، ومقالات ويكيبيديا، ومقالات إخبارية، وشيفرة مصدرية من GitHub، ومحادثات من منصّات التواصل الاجتماعي، تغطّي 124 لغة. المفردات مبنيّة بمُقسِّم SentencePiece بحجم 256,000 رمز.

الفكرة المحورية: الطبقات المتوازية

في كتلة المحوِّل المعتادة، يعمل الانتباه والشبكة الأمامية بالتتابع: مخرج الانتباه يدخل إلى الشبكة الأمامية، ثمّ يُضاف الناتج إلى . هذا يخلق سلسلة اعتماد — لأنّ الشبكة الأمامية لا تستطيع البدء قبل أن ينتهي الانتباه.

PaLM يقلب المعادلة ويجعلها متوازية: كلا المكوّنين — الانتباه والشبكة الأمامية — يتلقّيان المدخل ذاته بعد التطبيع، ويعملان بشكل مستقلّ، ثمّ تُجمع مخرجاتهما معاً في التدفّق المتبقّي. رياضياً:

  • التتابعي: y = x + FFN(LayerNorm(x + Attention(LayerNorm(x))))
  • المتوازي: y = x + Attention(LayerNorm(x)) + FFN(LayerNorm(x))

الصيغة المتوازية تتيح للمعالج دمج عمليات الانتباه والشبكة الأمامية في خطوات أقلّ، فيستغلّ العتاد بكفاءة أعلى. عند حجم PaLM الكامل (540 مليار)، يعني هذا تسريعاً بنحو 15% في زمن التدريب الفعلي. عند أحجام أصغر (8 مليارات) يظهر تراجع طفيف في الجودة، لكن من 62 مليار فصاعداً تتطابق الجودة مع الصيغة التتابعية تماماً.

y=x+Attention ⁣(LN(x))+FFN ⁣(LN(x))y = x + \text{Attention}\!\big(\text{LN}(x)\big) + \text{FFN}\!\big(\text{LN}(x)\big)
صيغة الطبقة المتوازية في PaLMالانتباه والشبكة الأمامية يأخذان المدخل ذاته بعد التطبيع، وتُجمع مخرجاتهما في التدفّق المتبقّي في آنٍ واحد. هذا يسمح بدمج العمليات على مستوى العتاد فيتسارع التدريب.
افتح في المختبر
قارن تدفّق البيانات في كتلة المحوِّل التتابعية مقابل كتلة PaLM المتوازية.
تستيقظ التجربة عند وصولك…

SwiGLU: دالّة تنشيط أفضل

الشبكة الأمامية في المحوِّل المعتاد تُطبّق واحدة بشكل مباشر: FFN(x) = ReLU(xW₁)W₂. تنشيط SwiGLU يستبدل ذلك بتنشيط قائم على بوابات يتعلّم بنفسه أيّ المعلومات يمرّرها وأيّها يحجبها:

FFN(x) = (Swish(xW₁) ⊙ xW₃) · W₂

حيث Swish(u) = u · σ(u). الفكرة الجوهرية أنّ xW₃ تعمل كـبوابة تتحكّم في مخرج Swish(xW₁) عنصراً بعنصر. تخيّل الأمر كمنظومة صمّامات: أنبوب يحمل الإشارة وأنبوب آخر يُقرّر كم يمرّ من كلّ عنصر. هذا يمنح الشبكة قدرة أعلى على الانتقاء — تُضخّم السمات المفيدة وتكبح الباقي.

رغم أنّ SwiGLU يحتاج مصفوفة أوزان ثالثة (أي نحو 33% معاملات إضافية في الشبكة الأمامية)، إلّا أنّه تفوّق باستمرار على دوال التنشيط المعتادة عبر جميع الأحجام. وحين تجمعه مع التسريع الذي تمنحه الطبقات المتوازية، تكون المحصّلة ربحاً صافياً في الجودة والسرعة معاً.

FFNSwiGLU(x)=(Swish(xW1)xW3)W2\text{FFN}_{\text{SwiGLU}}(x) = \big(\text{Swish}(xW_1) \odot xW_3\big)\,W_2
تنشيط SwiGLUالوحدة الخطّية ببوابة Swish. المصفوفتان W₁ وW₃ تُنتجان إشارتين من المدخل ذاته؛ W₃ تتحكّم في مخرج Swish عنصراً بعنصر. ثمّ W₂ تُعيد الإسقاط إلى بُعد النموذج.

بيانات التدريب: 780 مليار رمز عبر 124 لغة

بيانات تدريب PaLM كانت مزيجاً مُنتقى بعناية ليغطّي طيفاً واسعاً من الاستخدامات:

  • صفحات ويب مُصفّاة — تُشكّل الحصّة الأكبر، مع ترشيح صارم للجودة.
  • كتب — نصوص مطوّلة ومنظّمة تُعلّم النموذج التوليد المتماسك.
  • ويكيبيديا — معرفة حقائقية متعدّدة اللغات.
  • مقالات إخبارية — أحداث جارية وأسلوب صحفي.
  • شيفرة مصدرية — من GitHub، لتمكين وفهمها.
  • محادثات من منصّات التواصل — نصوص حوارية تُعزّز القدرة على المحادثة.

الجانب متعدّد اللغات يستحقّ التوقّف عنده: رغم أنّ الإنجليزية تهيمن على الحصّة الأكبر من الرموز، شمل المزيج نصوصاً بـ 124 لغة. هذا التنوّع اللغوي مع مفردات SentencePiece كبيرة من 256,000 رمز أعطى PaLM قدرات متعدّدة اللغات أقوى ممّا كان متوقّعاً — لا سيّما أنّه لم يُصمَّم أصلاً للعمل بلغات متعدّدة.

قرار تصميمي مهمّ: دُرِّب PaLM لـ واحدة فقط، أي أنّ كلّ رمز من الـ 780 مليار شُوهد مرّة واحدة بالضبط دون تكرار. هذا يتباين مع ما أظهرته Chinchilla من أنّ نماذج أصغر تُدرَّب على بيانات أكثر قد تُضاهي نماذج أكبر — لكنّ PaLM أثبت أنّ الحجم الخام لا يزال مؤثّراً حين تكون البيانات وفيرة بما يكفي.

سلوك التوسيع: مكاسب متدرّجة وقفزات مفاجئة

من أهمّ ما كشفه PaLM هو الطريقة التي يتطوّر بها الأداء مع الحجم. في أغلب المهام، كان الانتقال من 8 مليارات إلى 62 مليار ثمّ إلى 540 مليار يتبع منحنى تحسّن سلس لوغاريتمي خطّي — وهذا متّسق مع التي وصفتها Chinchilla. معاملات أكثر تعني أداءً أفضل بشكل يمكن التنبّؤ به.

لكنّ الأمر اختلف في مهام بعينها — تحديداً تلك التي تتطلّب استدلالاً متعدّد الخطوات أو استنتاجاً منطقياً أو فهم النكات. هنا كان التحسّن غير مستمر: الأداء بالكاد تغيّر بين 8 مليارات و62 مليار، ثمّ قفز فجأة عند 540 مليار. يُسمّي الباحثون هذه الظاهرة : إمكانات تبدو وكأنّها «تُشعَل» فقط عند حجم كافٍ، كما لو أنّ النموذج يحتاج إلى كتلة حرجة من المعرفة المخزّنة قبل أن تنتظم مهارة جديدة وتعمل.

كان هذا الاكتشاف محورياً لأنّه بيّن أنّ قوانين التوسيع اللوغاريتمية تقلّل من شأن ما تُحقّقه النماذج الكبيرة في مهام الاستدلال الصعبة. لو نظرت فقط إلى ما بين 8 مليارات و62 مليار، لتوقّعت مكاسب متواضعة عند 540 مليار. لكنّ المكاسب الفعلية تجاوزت تلك التوقّعات بمراحل.

افتح في المختبر
قارن بين التوسيع السلس (اللوغاريتمي الخطّي) والتوسيع بالقفزات (الناشئ). بدّل بين أنواع المهام لترى الفرق.
تستيقظ التجربة عند وصولك…

اختراقات الاستدلال والتفكير التسلسلي

ربّما كانت أقوى نتائج PaLM في الاستدلال متعدّد الخطوات. النماذج الكبيرة السابقة كانت تتعثّر في المهام التي تحتاج سلاسل منطقية: مسائل حسابية مصاغة بلغة طبيعية، و، وأسئلة تتطلّب ربط معلومات من عدّة مصادر. PaLM 540B لم يتحسّن في هذه المهام فحسب — بل تفوّق على نماذج متخصّصة مضبوطة بعناية مستخدماً فقط.

العامل الحاسم كان : بدلاً من أن تطلب إجابة مباشرة، تُضمّن في السؤال أمثلة تُظهر خطوات الاستدلال واحدة تلو الأخرى. مثلاً:

س: لدى أحمد 5 كرات تنس. اشترى علبتين في كلّ واحدة 3 كرات. كم كرة عنده الآن؟ ج: بدأ أحمد بـ 5 كرات. اشترى 2 × 3 = 6 كرات. المجموع: 5 + 6 = 11. الإجابة 11.

بهذا الأسلوب حقّق PaLM 540B نسبة 58.1% على GSM8K (رياضيات ابتدائية) بثمانية أمثلة فقط — متجاوزاً أفضل النماذج المضبوطة دقيقاً آنذاك. وسجّل 75.6% على StrategyQA (الاستدلال بالمعرفة العامّة) متفوّقاً أيضاً على أفضل نتيجة سابقة.

كان هذا تحوّلاً حقيقياً في المنظور: أظهر أنّ نموذجاً عامّ الغرض بحجم كافٍ مع أسلوب إسناد مناسب يستطيع أن يُضاهي أو يتجاوز نماذج مضبوطة على مهام محدّدة — من دون أيّ تحديث لـ.

النتائج: تجاوز البشر والنماذج المضبوطة

قُيِّم PaLM 540B عبر مئات . فيما يلي أبرز النتائج:

BIG-bench (أكثر من 150 مهمّة): PaLM 540B بخمسة أمثلة تفوّق على متوسّط المُقيِّمين البشريين في أغلب مهام BIG-bench — وهي المرّة الأولى التي يُحقّق فيها نموذج لغوي ذلك. في مهام مثل الاستنتاج المنطقي والاستدلال السببي والأمثال الإنجليزية، حقّق PaLM قفزات كبيرة مقارنةً بالنماذج السابقة.

مهام الاستدلال: مع التفكير التسلسلي، سجّل PaLM 540B نسبة 58.1% على GSM8K و75.6% على StrategyQA — متجاوزاً في الحالتين أفضل النماذج المضبوطة دقيقاً آنذاك.

معايير معالجة اللغة (29 مهمّة): تصدّر PaLM نتائج التعلّم بأمثلة قليلة على مهام تشمل TriviaQA وNatural Questions وLAMBADA وHellaSwag. وعلى SuperGLUE بعد سجّل 92.6%.

توليد الشيفرة: أظهر PaLM قدرات قوية في كتابة الشيفرة البرمجية تُنافس نماذج متخصّصة، بفضل الشيفرة المصدرية من GitHub في بيانات تدريبه.

متعدّد اللغات: رغم أنّه مُوجَّه أساساً للإنجليزية، سجّل PaLM أرقاماً قياسية في الإجابة عن الأسئلة والتوليد بعدّة لغات، متفوّقاً حتّى على نماذج دُرِّبت على بيانات غير إنجليزية أكثر منه.

افتح في المختبر
قارن أداء PaLM 540B مع GPT-3 وGopher وChinchilla عبر فئات المهام المختلفة.
تستيقظ التجربة عند وصولك…

الفكرة في شيفرة

الطبقة المتوازية في PaLM — الانتباه والشبكة الأمامية يعملان معاًpython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

import torch
import torch.nn as nn

class PaLMBlock(nn.Module):
    """كتلة محوِّل PaLM — الانتباه والشبكة الأمامية يعملان بالتوازي."""

    def __init__(self, d_model, n_heads, d_ff):
        super().__init__()
        self.norm = nn.LayerNorm(d_model, bias=False)  # بلا انحياز!
        self.attn = MultiQueryAttention(d_model, n_heads)
        self.ffn = SwiGLUFFN(d_model, d_ff)

    def forward(self, x):
        # الفرق الجوهري: الفرعان يتشاركان المدخل المُطبَّع ذاته
        normed = self.norm(x)

        # التتابعي: attn_out = attn(normed); x = x + attn_out;
        #           x = x + ffn(norm(x))   <-- تتابعي
        # PaLM:     الفرعان يُحسبان بالتوازي ثمّ تُجمع المخرجات
        attn_out = self.attn(normed)
        ffn_out = self.ffn(normed)

        return x + attn_out + ffn_out  # اتصال متبقٍّ متوازٍ


class SwiGLUFFN(nn.Module):
    """SwiGLU: تنشيط ببوابات يتعلّم أيّ السمات يُضخّم."""

    def __init__(self, d_model, d_ff):
        super().__init__()
        self.w1 = nn.Linear(d_model, d_ff, bias=False)
        self.w3 = nn.Linear(d_model, d_ff, bias=False)  # البوابة
        self.w2 = nn.Linear(d_ff, d_model, bias=False)

    def forward(self, x):
        # Swish(xW1) ⊙ (xW3) — البوابة تتحكّم في الإشارة
        return self.w2(torch.sigmoid(self.w1(x)) * self.w1(x) * self.w3(x))

# PaLM 540B: 118 كتلة مكدّسة
# d_model=18432, n_heads=48, d_ff=73728

ما الذي فتحه PaLM

  1. 2022

    PaLM

    نموذج كثيف بـ 540 مليار معامل يعمل بفاكّ الترميز فقط. أوّل من استخدم Pathways للتدريب على عدّة وحدات. تصدّر نتائج التعلّم بأمثلة قليلة على مئات المهام. قدرات استدلالية ناشئة.

  2. 2022

    التفكير التسلسلي (Wei وآخرون)

    شكّل PaLM منصّة اختبار رئيسية لأبحاث التفكير التسلسلي. الجمع بين التفكير التسلسلي وPaLM 540B تغلّب على نماذج مضبوطة في مهام الاستدلال من دون أيّ تحديث للأوزان.

  3. 2022

    Flan-PaLM

    نسخة PaLM المضبوطة بالتعليمات على 1,836 مهمّة. حقّقت 75.2% على MMLU — قفزة كبيرة. أثبتت أنّ الحجم + الضبط بالتعليمات + التفكير التسلسلي = أداء متفوّق.

  4. 2023

    PaLM 2

    الخَلَف الذي طبّق مبدأ Chinchilla في التدريب الأمثل: نموذج أصغر مع بيانات أكثر. تفوّق على PaLM 540B في كلّ مهمّة من BIG-Bench Hard. شغّل Bard الذي تحوّل لاحقاً إلى Gemini.

  5. 2023

    Gemini

    نموذج Google متعدّد الوسائط المبني على بنية Pathways التي مهّد لها PaLM. يُعالج النصوص والصور والصوت والفيديو بشكل أصيل.

  6. 2023

    RT-2 (المحوِّل الروبوتي 2)

    اعتمد على PaLM كعمود فقري لغوي للتحكّم بالروبوتات، وأظهر أنّ قدرات الاستدلال المكتسبة من النصوص يمكن نقلها إلى مهام التعامل مع العالم المادّي.

إرث PaLM يمتدّ في ثلاثة اتجاهات. الأوّل البنية التحتية: نظام Pathways أثبت أنّ التدريب عبر وحدات متعدّدة من دون توازٍ أنبوبي ممكن عملياً، وفتح الباب أمام نماذج أكبر. الثاني المعمارية: أصبح SwiGLU والطبقات المتوازية وانتباه الاستعلام المتعدّد وتضمينات RoPE الوصفة المعتمدة في الجيل التالي من النماذج الكبيرة كـ LLaMA وMistral وGemini. الثالث العلم: اكتشاف القدرات الناشئة وقوّة التفكير التسلسلي غيّرا نظرة المجال بأكمله إلى ما يمكن أن يُحقّقه التوسيع.

والأهمّ ربّما أنّ PaLM أثبت أنّ فرضية التوسيع لا تزال حيّة. في وقت أشارت فيه Chinchilla إلى أنّ كفاءة استخدام البيانات أهمّ من الحجم المجرّد، أظهر PaLM أنّ كليهما مهمّ — وأنّ بعد عتبة حجم معيّنة تظهر قدرات جديدة نوعياً لا يمكن لأيّ كمّ من البيانات وحدها أن ينتجها.

المرجعChowdhery, Narang, Devlin, Bosma, Mishra, Roberts, Barham, et al.. PaLM: Scaling Language Modeling with Pathways. JMLR, 2023.

مصطلحات هذه الورقة