تقييم معالجة اللغة2018مبتدئ9 دقيقة قراءة
GLUE: معيار مرجعي متعدد المهام ومنصة تحليل لفهم اللغة الطبيعية
GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding
Wang, A. · Singh, A. · Michael, J. · Hill, F. · Levy, O. · Bowman, S. R. — EMNLP Workshop (BlackboxNLP) / ICLR 2019
المشكلة
حتى عام 2018، كان العمل الشائع في معالجة اللغة الطبيعية أن يُبنى نموذج ويُقيَّم عليها منفرداً. قد يتفوّق نموذج في تحليل المشاعر لكنه يفشل فشلاً ذريعاً في الاستدلال اللغوي — ولم تكن هناك طريقة موحّدة لتقييم الفهم اللغوي العام. المعايير المتاحة كانت تقيس مهارات ضيّقة، فلا يمكنك أن تعرف إن كان النموذج يفهم اللغة فعلاً أم أنه حفظ أنماطاً سطحية مرتبطة بمهمة بعينها. المشكلة الأكبر أن كثيراً من هذه المهام بياناتها محدودة، فلا بدّ أن يستفيد النموذج من مهمة لينجح في أخرى — لكن لم توجد منصة معيارية تدفع نحو ذلك أو تقيسه.
الإسهام
قدّمت الورقة GLUE (التقييم العام لفهم اللغة): معيار مرجعي يضم تسع مهام متنوّعة لفهم اللغة الطبيعية، تغطّي تحليل المشاعر واكتشاف والاستدلال اللغوي والمقبولية النحوية. يرافق المعيار مجموعة تشخيصية مصمَّمة يدوياً لفحص ظواهر لغوية بعينها، إضافة إلى لوحة ترتيب إلكترونية تتيح مقارنة النماذج بشفافية. يخلط GLUE عمداً بين مجموعات بيانات كبيرة وصغيرة ليكافئ النماذج القادرة على نقل المعرفة بين المهام. وقد وضع المؤلفون خطوط أساس باستخدام BiLSTM وELMo والتدريب متعدد المهام، وبيّنوا أن أفضل نماذج 2018 ظلّت بعيدة عن مستوى الأداء البشري.
الأثر
تحوّل GLUE إلى المسطرة المعيارية لقياس التقدّم في معالجة اللغة الطبيعية. طفرة BERT ظهرت للعالم أوّل مرة على GLUE، والمعيار نفسه أطلق موجة واسعة من أبحاث ثم . خلال سنة واحدة تجاوزت النماذج الأداء البشري، فجاء معيار SuperGLUE الأصعب ليحلّ محلّه. ألهم GLUE معايير مماثلة في لغات أخرى — CLUE للصينية، وFLUE للفرنسية، وIndoNLU للإندونيسية — ورسّخ قناعة أن فهم اللغة يجب أن يُقاس عبر مهام متنوّعة لا على مهمة واحدة.
تخيّل أنك وظّفت مترجماً واختبرته في شيء واحد فقط — ترجمة قوائم الطعام مثلاً. ربما يبرع فيها، لكن ماذا عن الشعر؟ العقود القانونية؟ الرسائل العامّية؟ لن تثق به ما لم تختبره في أنواع كثيرة ومختلفة.
قبل GLUE، كان تقييم نماذج اللغة يسير بهذا المنطق تماماً: كل مهمة لوحدها وكل مهمة لها امتحانها الخاص. قد يكون النموذج «متخصصاً في قوائم الطعام» ولا نكتشف ذلك أبداً. ما فعله GLUE هو تجميع تسعة امتحانات مختلفة في بطاقة تقييم واحدة — القواعد، والمشاعر، وإعادة الصياغة، والاستدلال المنطقي — لنستطيع أخيراً أن نسأل: هل يفهم هذا النموذج اللغة فعلاً؟
المشكلة: التقييم على مهمة واحدة يُخفي نقاط الضعف
في 2018 كان نمط العمل السائد واضحاً: يختار الباحث مجموعة بيانات واحدة، يبني نموذجاً مخصّصاً لها، يُعلن النتيجة، ثم ينتقل لموضوع آخر. نماذج تُختبر على المشاعر فقط، ونماذج تُختبر على الاستدلال فقط. بهذه الطريقة لا يمكنك أن تعرف هل النموذج يملك فهماً عاماً للغة، أم أنه وجد اختصارات سطحية في مجموعة بيانات بعينها.
المشكلة الأعمق أن فهم اللغة ليس مهارة واحدة، بل نسيج من مهارات متشابكة. خذ مثلاً جملة إنجليزية مثل "The old man the boats" — فهمها يتطلّب قواعد نحوية (إعراب "man" كفعل لا كاسم)، ودلالات (معرفة أن المقصود هو قيادة القوارب)، ومعرفة بالعالم (كبار السن يمكنهم تشغيل القوارب). لا توجد مجموعة بيانات واحدة تغطّي كل هذه الأبعاد. نموذج يحقق 95% في تحليل المشاعر قد يفشل تماماً حين تسأله هل جملة ما تنتج منطقياً من جملة أخرى.
من هنا جاءت فكرة GLUE: ادمج مهام متنوّعة في واحد بحيث لا ينجح إلا النموذج الجيّد في كل شيء، لا في شيء واحد فقط.
المهام التسع: جولة في فهم اللغة
ينظّم GLUE مهامه التسع في ثلاث مجموعات. تخيّلها كثلاثة أجنحة لامتحان شامل: مهام الجملة الواحدة وفيها نختبر ما يفهمه النموذج من جملة بمعزل عن غيرها، ومهام وإعادة الصياغة وفيها نسأل هل يستطيع النموذج أن يميّز أن جملتين تحملان المعنى ذاته، ومهام الاستدلال اللغوي وفيها نختبر قدرة النموذج على الاستنتاج المنطقي بين أزواج من الجمل.
مهام الجملة الواحدة — مهمة CoLA (مجموعة المقبولية اللغوية) تعرض جملة إنجليزية وتسأل: هل هي صحيحة نحوياً؟ فتختبر بذلك المعرفة التركيبية للنموذج. أما SST-2 (بنك جمل مشاعر ستانفورد) فتعرض مراجعة فيلم وتسأل: إيجابية أم سلبية؟ وهنا الاختبار للفهم الدلالي.
مهام التشابه وإعادة الصياغة — مهمة MRPC (مجموعة مايكروسوفت لإعادة الصياغة) تُقدّم جملتين إخباريتين وتسأل هل تؤدّيان المعنى نفسه. مهمة STS-B (معيار التشابه الدلالي النصّي) تطلب تقدير درجة التشابه بين جملتين على مقياس من 1 إلى 5 — وهي مهمة الوحيدة في GLUE. ومهمة QQP (أزواج أسئلة Quora) تسأل هل سؤالان من المنصة يقصدان الشيء نفسه.
مهام الاستدلال اللغوي — مهمة MNLI (الاستدلال اللغوي متعدد الأنواع) هي الأكبر: تُعطيك مقدّمة وفرضية من عشرة أنواع نصية مختلفة، والمطلوب تصنيف العلاقة بينهما إلى استلزام أو تناقض أو حياد. مهمة QNLI تُحوِّل من SQuAD إلى صيغة استدلال: هل تحتوي هذه الجملة على إجابة هذا السؤال؟ مهمة RTE () مهمة استدلال ثنائية أصغر حجماً. وأخيراً WNLI (استدلال ويناغراد) تختبر تحليل المرجعية المشتركة من خلال منظور الاستدلال — وهي الأصغر والأصعب في المعيار كلّه.
كيف يعمل نظام التقييم في GLUE
لكل مهمة خاص بها: الدقة لمعظم مهام التصنيف، ومعامل ماثيوز لـ CoLA لأن فئاتها غير متوازنة، وارتباط بيرسون وسبيرمان لـ STS-B لأنها مهمة انحدار، والدقة مع مقياس F1 لـ MRPC وQQP لأن اكتشاف إعادة الصياغة يحتاج موازنة بين و.
الدرجة الإجمالية في GLUE ببساطة هي المتوسط الحسابي لجميع المهام. يعني ذلك أن كل مهمة تحمل الوزن نفسه مهما كان حجم بياناتها. لا يستطيع النموذج أن يتجاهل المهام الصغيرة والصعبة مثل WNLI دون أن ينخفض متوسطه. وهذا قرار تصميمي مقصود: GLUE يكافئ اتّساع الفهم اللغوي، لا العمق في مجال واحد.
خطوط الأساس: إلى أين وصلت نماذج 2018؟
اختبر المؤلفون عدة بنيات كـ لرسم خريطة صعوبة GLUE. أبسطها BiLSTM يُدرَّب على كل مهمة منفردة. ثم أضافوا تمثيلات كلمات مُدرَّبة مسبقاً: ELMo وهي مستخرجة من ، وCoVe وهي تضمينات من نموذج ترجمة. وأخيراً جرّبوا ، حيث يتعلّم نموذج واحد المهام التسع في آنٍ واحد.
النتائج رسمت تسلسلاً واضحاً. BiLSTM بمهمة واحدة حقّق 63.9 إجمالاً. بإضافة ELMo ارتفع إلى 66.4 — دليل عملي على أن نقل التعلّم من النمذجة اللغوية يُحدث فرقاً. التدريب متعدد المهام مع ELMo وصل إلى 70.0، وهي أعلى نتيجة في ذلك العام. لكن الأداء البشري يقف عند 87.1 تقريباً. فجوة 17 نقطة كاملة أكّدت أن فهم اللغة ما زال بعيداً عن الحل، وأن النماذج تتعثّر بشكل خاص في المهام قليلة البيانات والبنى المنطقية.
المجموعة التشخيصية: تصوير بالأشعة للمهارات اللغوية
إلى جانب المهام التسع، يحتوي GLUE على مجموعة اختبار تشخيصية مصمَّمة يدوياً على هيئة أمثلة استدلال لغوي. كل مثال مُعلَّم بالظاهرة اللغوية التي يختبرها، وتقع هذه الظواهر في أربع فئات رئيسية:
الدلالة المعجمية — المترادفات، الأضداد، تعدّد المعاني. هل يدرك النموذج أن «أريكة» و«كنبة» تعنيان الشيء نفسه؟ بنية المحمول والحجج — أُطر الأفعال والأدوار الدلالية. هل يفهم النموذج مَن فعل ماذا لمَن؟ المنطق — النفي، المحدِّدات الكمّية، النفي المزدوج، الشروط. هل يفرّق النموذج بين «ليس الكل» و«لا أحد»؟ المعرفة والحسّ العام — معرفة بالعالم لا تظهر من سطح النصّ وحده.
ما كشفته هذه المجموعة التشخيصية أن نماذج 2018 تتعامل جيداً مع الإشارات المعجمية الواضحة — كتداخل الكلمات بين الجملتين أو وجود كلمات ذات شحنة عاطفية — لكنها تتعثّر في البنى المنطقية الأعمق، وبالذات النفي والمحدِّدات الكمّية. بذلك حصل الباحثون على خريطة دقيقة تُوضّح أين يجب تركيز الجهود.
لوحة الترتيب: تقييم عادل وقابل لإعادة الإنتاج
GLUE ليس مجرد مجموعة بيانات — بل منصة متكاملة. الإلكترونية على gluebenchmark.com تستقبل تنبؤات النماذج على محجوبة. أربع مهام (CoLA وSST-2 وRTE وWNLI) لم تُنشر تسمياتها الاختبارية قطّ، وذلك لمنع على مجموعة الاختبار. بهذا التصميم تعكس النتائج المنشورة حقيقياً وليس حفظاً لبيانات الاختبار.
لوحة الترتيب أيضاً توحّد قواعد المقارنة. قبل GLUE، كان كل باحث قد يستخدم تقسيمات مختلفة لنفس مجموعة البيانات، فتصبح المقارنة العادلة مستحيلة. GLUE حسم هذا بتحديد تقسيمات ثابتة لـ و ومجموعة الاختبار، مع مقياس تقييم واضح لكل مهمة.
الفكرة في شفرة برمجية
جوهر GLUE بسيط: حمِّل بيانات كل مهمة، شغِّل نموذجك عليها، احسب المقياس، ثم خذ المتوسط. إليك الطريقة عملياً:
مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.
# كل مهمة تُسهم بالتساوي في درجة GLUE
task_scores = {
"CoLA": 0.352, # معامل ارتباط ماثيوز
"SST-2": 0.902, # الدقة
"MRPC": 0.793, # متوسط الدقة و F1
"STS-B": 0.615, # متوسط بيرسون وسبيرمان
"QQP": 0.817, # متوسط الدقة و F1
"MNLI": 0.708, # متوسط الدقة المتطابقة وغير المتطابقة
"QNLI": 0.757, # الدقة
"RTE": 0.528, # الدقة
"WNLI": 0.651, # الدقة (خط أساس الأغلبية)
}
# درجة GLUE: المتوسط الحسابي البسيط لجميع المهام
glue_score = sum(task_scores.values()) / len(task_scores)
print(f"درجة GLUE: {glue_score:.1f}") # ~68.0 لخط أساس ELMo
ماذا حدث بعد GLUE
2018
إطلاق معيار GLUE المرجعي
تسع مهام لفهم اللغة، ومجموعة تشخيصية، ولوحة ترتيب إلكترونية. أفضل نموذج (ELMo مع BiLSTM متعدد المهام) يسجّل نحو 70 مقابل 87 تقريباً للبشر.
2018
BERT يكتسح GLUE
حقّق BERT درجة 80.5 على GLUE — قفزة هائلة بـ11 نقطة. أثبت أن التدريب المسبق العميق ثنائي الاتجاه مع الضبط الدقيق هو مفتاح الفهم اللغوي العام.
2019
النماذج تتخطّى مستوى البشر
تجاوزت عدّة نماذج الأداء البشري على GLUE. المعيار أدّى دوره لكنه لم يعد يمثّل تحدّياً كافياً.
2019
إطلاق SuperGLUE
معيار أصعب يضمّ مهام مثل الفهم القرائي وتوضيح معنى الكلمات والاستدلال السببي. صُمِّم ليبقى صعباً لفترة أطول.
2020
معايير مستلهَمة من GLUE حول العالم
CLUE للصينية وFLUE للفرنسية وIndoNLU للإندونيسية وغيرها. نموذج التقييم متعدد المهام ينتشر عالمياً.
الأثر الأبقى لـ GLUE ليس رقماً بعينه — بل الفكرة نفسها: أن فهم اللغة يجب أن يُقاس على نطاق واسع وليس من زاوية واحدة. قبل GLUE كان أي باحث قد يُعلن «أفضل النتائج» استناداً إلى مجموعة بيانات واحدة. بعد GLUE أصبح المجتمع يتوقّع من أي نموذج أن يُثبت نفسه عبر مهام متنوّعة. هذا التحوّل في ثقافة التقييم لا يقلّ أهمية عن أي ابتكار معماري.
المرجعWang, Singh, Michael, Hill, Levy, Bowman. GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. ICLR, 2019.
مصطلحات هذه الورقة
- المعيار المرجعيBenchmark
- التعلّم متعدد المهامMulti-Task Learning
- نقل التعلمTransfer Learning
- الاستدلال اللغوي الطبيعيNatural Language Inference
- تحليل المشاعر والآراءSentiment Analysis
- التشابه الدلاليSemantic Similarity
- إعادة الصياغةParaphrase
- الضبط الدقيقFine-Tuning
- التدريب المسبقPre-training
- معيار قياس الأداءEvaluation Metric
- الخط المرجعيBaseline
- معيار GLUEGLUE Benchmark
- نسبة الدقة الإجماليةAccuracy
- مهمة واحدةSingle-Task
- لوحة الصدارة والتصنيفLeaderboard