اختراق المكافأة
Reward Hacking
حين تتعلم السياسة استغلال ثغرات نموذج المكافأة بدلاً من التحسّن الحقيقي، فتُنتج مخرجات عالية الدرجة لكنها منخفضة الجودة فعلياً.
When a policy learns to exploit flaws in the reward model rather than genuinely improving, producing high-scoring but actually low-quality outputs.
تُرجم أيضاًاستغلال المكافأة، استغلال دالة المكافأة، الاستغلال السلبي الثغرات دالة التحفيز، التحايل على أهداف البيئة الحوسبية، التحايل على المكافأة، التلاعب بالمكافأة، التلاعب بنموذج المكافأة، خداع نموذج المكافأة
أول ظهور في هذه المجموعة: مشكلات ملموسة في أمان الذكاء الاصطناعي (2016)
يظهر في هذه الأوراق
- مشكلات ملموسة في أمان الذكاء الاصطناعي2016في السماء ✦
- التعلم المعزز العميق من التفضيلات البشرية2017في السماء ✦
- DeepSeek-R1: تحفيز قدرات الاستدلال في النماذج اللغوية الكبيرة عبر التعلم المعزز2025في السماء ✦
- التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة2023في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- تدريب النماذج اللغوية على اتّباع التعليمات باستخدام التغذية الراجعة البشرية2022في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- كيف تتعلّم النماذج اللغوية الكبيرة الاستدلال2024في السماء ✦