الاستغلال (اعتماد الأفعال الناجحة)
Exploitation
اعتماد العميل الذكي على الأفعال الناجحة والمعروفة مسبقاً لتعظيم المكاسب المضمونة والآنية.
Exploitation
تُرجم أيضاًتعظيم العوائد بناءً على المعرفة الحالية، الاستثمار الفعلي للمسارات المجربة
أول ظهور في هذه المجموعة: حسابات معادلة الحالة باستخدام الحواسيب السريعة (1953)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- إتقان لعبة غو دون أي معرفة بشرية2017في السماء ✦
- إتقان لعبة غو باستخدام الشبكات العصبية العميقة والبحث الشجري2016في السماء ✦
- خوارزمية تعلّم مُعزَّز عامة تتقن الشطرنج والشوغي والغو عبر اللعب الذاتي2018في السماء ✦
- الأمثَلة البايزية التطبيقية لخوارزميات التعلم الآلي2012في السماء ✦
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- Hyperband: نهج مبتكر لضبط المعاملات الفائقة مستوحى من مسائل قطّاع الطريق2018في السماء ✦
- حسابات معادلة الحالة باستخدام الحواسيب السريعة1953في السماء ✦
- MuZero: إتقان ألعاب Atari وGo والشطرنج وShogi بالتخطيط عبر نموذج مُتعلَّم2020في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- Rainbow: دمج التحسينات في التعلُّم المعزَّز العميق2018في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- الأمثَلة بالتلدين المحاكى1983في السماء ✦
- التعلُّم بالفرق الزمني و TD-Gammon1995في السماء ✦