خوارزمية التعلم من السياسة الحالية
On-Policy
خوارزميات تعزيز تتعلم وتحدث استراتيجيتها بالاعتماد الحصري على الأفعال المباشرة التي يتخذها العميل حالياً في البيئة.
On-Policy
تُرجم أيضاًالتعلم التدعيمي الملتزم باستراتيجية العمل، مواءمة الأفعال المباشرة الحية
أول ظهور في هذه المجموعة: طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال (1999)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦