خوارزمية التعلم خارج السياسة الحالية
Off-Policy
خوارزميات تعزيز تمتلك مرونة التعلم وتحديث استراتيجيتها بالاعتماد على سجلات تفاعلية سابقة أو سياسات سلوكية أخرى.
Off-Policy
تُرجم أيضاًالتعلم التدعيمي المستقل عن استراتيجية التنفيذ، مواءمة الأفعال عبر السجلات التاريخية
أول ظهور في هذه المجموعة: تعلُّم دالة الجودة (Q-Learning) (1992)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- إعادة التجربة بالأولوية2015في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦