المكافأة
Reward
القيمة العددية التحفيزية التي يتلقاها العميل من البيئة لتقييم مدى جودة الفعل المتخذ.
Reward
تُرجم أيضاًالقيمة التحفيزية، دالة التعزيز الإيجابي
أول ظهور في هذه المجموعة: البرمجة الديناميكية (1957)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- أمان الذكاء الاصطناعي عبر المناظرة2018في السماء ✦
- اكتشاف خوارزميات أسرع لضرب المصفوفات بالتعلّم المعزَّز2022في السماء ✦
- خوارزمية تعلّم مُعزَّز عامة تتقن الشطرنج والشوغي والغو عبر اللعب الذاتي2018في السماء ✦
- مشكلات ملموسة في أمان الذكاء الاصطناعي2016في السماء ✦
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- التعلّم المعزّز العميق بأسلوب Q المزدوج2016في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- بنية الشبكة المزدوجة للتعلُّم المعزَّز العميق2016في السماء ✦
- البرمجة الديناميكية1957في السماء ✦
- التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم2016في السماء ✦
- نظام الترجمة الآلية العصبية من جوجل: ردم الفجوة بين الترجمة البشرية والآلية2016في السماء ✦
- عُد أولاً، ثم استكشِف2021في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- الاستكشاف المدفوع بالفضول عبر التنبؤ ذاتي الإشراف2017في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- تدريب النماذج اللغوية على اتّباع التعليمات باستخدام التغذية الراجعة البشرية2022في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- خوارزمية تحسين السياسة القريبة (PPO)2017في السماء ✦
- إعادة التجربة بالأولوية2015في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- Reflexion: وكلاء لغويون بالتعزيز اللفظي2023في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- التعلُّم بالفرق الزمني و TD-Gammon1995في السماء ✦
- التعلُّم بالتنبؤ عبر أساليب الفارق الزمني1988في السماء ✦
- أمثَلة السياسة بمنطقة الثقة2015في السماء ✦
- نماذج العالَم2018في السماء ✦