المعيار المرجعي
Benchmark
مجموعة مهام أو أسئلة موحَّدة تُستخدم لقياس أداء النماذج ومقارنتها بشكل عادل ومتسق عبر الزمن.
A standardized set of tasks or questions used to measure and compare model performance fairly and consistently over time.
تُرجم أيضاًمعيار الأداء، مقياس التقييم
أول ظهور في هذه المجموعة: ImageNet: قاعدة بيانات صور هرمية واسعة النطاق (2009)
يظهر في هذه الأوراق
- نقل التعلُّم بكفاءة المُعاملات في معالجة اللغة الطبيعية2019في السماء ✦
- BLOOM: نموذج لغوي متعدد اللغات مفتوح الوصول بـ 176 مليار معامل2022في السماء ✦
- Microsoft COCO: الأجسام الشائعة في سياقها الطبيعي2014في السماء ✦
- تقييم النماذج اللغوية الكبيرة المُدرَّبة على الشيفرات البرمجية2021في السماء ✦
- Contriever: استرجاع كثيف للمعلومات بدون إشراف عبر التعلّم التبايُني2022في السماء ✦
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- DeBERTa: تعزيز BERT بفكّ ترميز مُحسَّن وانتباه مُفكَّك2020في السماء ✦
- DistilBERT: نسخة مُقطَّرة من BERT — أصغر وأسرع وأرخص وأخفّ2019في السماء ✦
- هل المحوِّلات فعّالة في التنبؤ بالسلاسل الزمنية؟2023في السماء ✦
- القدرات الناشئة في النماذج اللغوية الكبيرة2022في السماء ✦
- هل القدرات الناشئة في النماذج اللغوية الكبيرة مجرد سراب؟2023في السماء ✦
- سلسلة Falcon من النماذج اللغوية المفتوحة2023في السماء ✦
- Flamingo: نموذج لغوي بصري للتعلّم بأمثلة قليلة2022في السماء ✦
- Gemini: عائلة نماذج فائقة القدرات تجمع بين وسائط متعددة2023في السماء ✦
- Gemma: نماذج مفتوحة الأوزان مبنية على أبحاث وتقنيات Gemini2024في السماء ✦
- GLUE: معيار مرجعي متعدد المهام ومنصة تحليل لفهم اللغة الطبيعية2018في السماء ✦
- عُد أولاً، ثم استكشِف2021في السماء ✦
- توسيع نطاق النماذج اللغوية: أساليب وتحليلات ورؤى من تدريب Gopher2022في السماء ✦
- HuggingGPT: كيف يقود ChatGPT فريقاً من النماذج المتخصّصة على Hugging Face2023في السماء ✦
- ImageNet: قاعدة بيانات صور هرمية واسعة النطاق2009في السماء ✦
- LIMA: القليل يكفي للمواءمة2023في السماء ✦
- Llama 2: نماذج أساسية مفتوحة الأوزان ونماذج محادثة مُحاذَاة2023في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- LLaMA: نماذج أساسية مفتوحة وعالية الكفاءة للغة2023في السماء ✦
- LLM.int8(): ضرب المصفوفات بدقة 8 بت للمحوِّلات على نطاق واسع2022في السماء ✦
- Mistral 7B2023في السماء ✦
- Mixtral: مزيج الخبراء2024في السماء ✦
- Open X-Embodiment: مجموعات بيانات التعلّم الروبوتي ونماذج RT-X2024في السماء ✦
- OPT: نماذج لغوية مفتوحة مُدرَّبة مسبقاً بمعمارية المُحوِّل2022في السماء ✦
- PaLM: توسيع نمذجة اللغة عبر نظام Pathways2022في السماء ✦
- الكتب المدرسية هي كل ما تحتاجه2023في السماء ✦
- اختبار الفريق الأحمر للنماذج اللغوية للحدّ من أضرارها: المنهجيات وأنماط التوسّع والدروس المستفادة2022في السماء ✦
- Reflexion: وكلاء لغويون بالتعزيز اللفظي2023في السماء ✦
- RoBERTa: منهج مُحسَّن بمتانة للتدريب المسبق على غرار BERT2019في السماء ✦
- Self-Instruct: مواءمة النماذج اللغوية بتعليمات يولّدها النموذج بنفسه2022في السماء ✦
- شرارات الذكاء الاصطناعي العام: تجارب مبكرة مع GPT-42023في السماء ✦
- SQuAD: أكثر من 100,000 سؤال لفهم الآلة للنصوص2016في السماء ✦
- SWE-bench: هل تستطيع النماذج اللغوية حلّ مشكلات GitHub الحقيقية؟2024في السماء ✦
- محوِّل Swin: محوِّل رؤية هرمي باستخدام النوافذ المُنزاحة2021في السماء ✦
- نموذج أساسي بفاكّ ترميز فقط للتنبؤ بالسلاسل الزمنية2024في السماء ✦
- Toolformer: نماذج اللغة تستطيع تعليم نفسها استخدام الأدوات2023في السماء ✦
- الضبط الدقيق الشامل لنموذج اللغة من أجل تصنيف النصوص2018في السماء ✦
- VQA: الإجابة البصرية عن الأسئلة2015في السماء ✦
- WebArena: بيئة ويب واقعية لبناء وكلاء مستقلّين2023في السماء ✦
- XLNet: تدريب مسبق ذاتي الانحدار مُعمَّم لفهم اللغة2019في السماء ✦