Q-Learning المزدوج
Double Q-Learning
تعديل على Q-Learning يحتفظ بجدولي Q مستقلين: أحدهما يختار الفعل الأفضل والآخر يُقيّم قيمته، مما يقضي على انحياز التعظيم الناتج عن استخدام نفس الجدول للاختيار والتقييم.
A modification of Q-Learning that maintains two independent Q-tables: one selects the best action, the other evaluates its value, eliminating the maximization bias from using the same table for both selection and evaluation.
تُرجم أيضاًالتعلم المزدوج لقيم الجودة
أول ظهور في هذه المجموعة: تعلُّم دالة الجودة (Q-Learning) (1992)
يظهر في هذه الأوراق
- التعلّم المعزّز العميق بأسلوب Q المزدوج2016في السماء ✦
- بنية الشبكة المزدوجة للتعلُّم المعزَّز العميق2016في السماء ✦
- إعادة التجربة بالأولوية2015في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- Rainbow: دمج التحسينات في التعلُّم المعزَّز العميق2018في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦