التعلم بالتعزيز القائم على التقييم البشري
Reinforcement Learning from Human Feedback
تدريب السلوك اللغوي عبر دمج تقييمات وتفضيلات البشر كمكافآت لتوجيه مخرجات الشبكة العصبية.
تُرجم أيضاًمواءمة السلوك بالتغذية الراجعة البشرية، التدريب التدعيمي بإشراف إنساني، RLHF، التعلم التعزيزي من الملاحظات البشرية، التعلم التعزيزي بالتغذية البشرية، التعلم التعزيزي من الملاحظات البشرية
أول ظهور في هذه المجموعة: في المعلومات والكفاية الإحصائية (1951)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- أمان الذكاء الاصطناعي عبر المناظرة2018في السماء ✦
- ألباكا: نموذج قوي وقابل للتكرار يتّبع التعليمات2023في السماء ✦
- مشكلات ملموسة في أمان الذكاء الاصطناعي2016في السماء ✦
- مقترح مشروع دارتموث الصيفي للبحث في الذكاء الاصطناعي1956في السماء ✦
- DeepSeek-R1: تحفيز قدرات الاستدلال في النماذج اللغوية الكبيرة عبر التعلم المعزز2025في السماء ✦
- التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة2023في السماء ✦
- النماذج اللغوية المضبوطة بالتعليمات تتعلَّم بدون أمثلة2022في السماء ✦
- التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم2016في السماء ✦
- Gemini: عائلة نماذج فائقة القدرات تجمع بين وسائط متعددة2023في السماء ✦
- Gemma: نماذج مفتوحة الأوزان مبنية على أبحاث وتقنيات Gemini2024في السماء ✦
- نظام الترجمة الآلية العصبية من جوجل: ردم الفجوة بين الترجمة البشرية والآلية2016في السماء ✦
- توسيع نطاق النماذج اللغوية: أساليب وتحليلات ورؤى من تدريب Gopher2022في السماء ✦
- التقرير التقني لـ GPT-42023في السماء ✦
- تدريب النماذج اللغوية على اتّباع التعليمات باستخدام التغذية الراجعة البشرية2022في السماء ✦
- في المعلومات والكفاية الإحصائية1951في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- LIMA: القليل يكفي للمواءمة2023في السماء ✦
- Llama 2: نماذج أساسية مفتوحة الأوزان ونماذج محادثة مُحاذَاة2023في السماء ✦
- اختبار الفريق الأحمر للنماذج اللغوية للحدّ من أضرارها: المنهجيات وأنماط التوسّع والدروس المستفادة2022في السماء ✦
- WebGPT: الإجابة عن الأسئلة بمساعدة متصفّح ويب وتغذية راجعة بشرية2021في السماء ✦