صياغة وهندسة دالة المكافأة
Reward Shaping
تقنية في التعلم بالتعزيز تضيف مكافآت بينية صغيرة وموجهة لتسهيل وتسريع تعلم العميل في البيئات المعقدة.
Reward Shaping
تُرجم أيضاًتحسين قيم التحفيز لتسريع توجيه العميل الذكي، هيكلة المكافآت البينية لتسهيل التعلم
أول ظهور في هذه المجموعة: التعلم المعزز العميق من التفضيلات البشرية (2017)
يظهر في هذه الأوراق
- مستوى الأستاذ الأكبر في StarCraft II باستخدام التعلّم المعزّز متعدّد الوكلاء2019في السماء ✦
- التعلم المعزز العميق من التفضيلات البشرية2017في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- عُد أولاً، ثم استكشِف2021في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦