انحياز المبالغة في التقدير
Overestimation Bias
ظاهرة منهجية في Q-learning حيث يؤدي استخدام عامل الحد الأقصى (max) على تقديرات مُشوَّشة إلى المبالغة المتكررة في تقدير قيم الأفعال، مما يُضعف جودة السياسة المُتعلَّمة.
A systematic phenomenon in Q-learning where the max operator over noisy estimates consistently overestimates action values, degrading learned policy quality.
تُرجم أيضاًتحيُّز الإفراط في التقدير
أول ظهور في هذه المجموعة: الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي (2018)
يظهر في هذه الأوراق
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦