تدرج السياسة التشغيلية
Policy Gradient
أساليب تحسين تحدث معالم استراتيجية الأفعال مباشرة عبر تتبع تدرج العوائد لزيادة احتمال الخطوات الناجحة.
Policy Gradient
تُرجم أيضاًالتحسين المباشر لميل استراتيجية الأفعال، توجيه مسارات الاختيار آلياً
أول ظهور في هذه المجموعة: خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية (1992)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- إتقان لعبة غو باستخدام الشبكات العصبية العميقة والبحث الشجري2016في السماء ✦
- مستوى الأستاذ الأكبر في StarCraft II باستخدام التعلّم المعزّز متعدّد الوكلاء2019في السماء ✦
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- محوِّل القرار: التعلّم المعزَّز عبر نمذجة التسلسلات2021في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم2016في السماء ✦
- نظام الترجمة الآلية العصبية من جوجل: ردم الفجوة بين الترجمة البشرية والآلية2016في السماء ✦
- عُد أولاً، ثم استكشِف2021في السماء ✦
- الاستكشاف المدفوع بالفضول عبر التنبؤ ذاتي الإشراف2017في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- خوارزمية تحسين السياسة القريبة (PPO)2017في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- أَرِني، انتبِه وأخبرني: توليد وصف الصور بالانتباه البصري2015في السماء ✦
- STaR: تمهيد الاستدلال بالاستدلال2022في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦
- أمثَلة السياسة بمنطقة الثقة2015في السماء ✦