انحياز المبالغة في التقدير
Overestimation Bias
ظاهرة منهجية في Q-learning حيث يؤدي استخدام عامل الحد الأقصى (max) على تقديرات مُشوَّشة إلى المبالغة المتكررة في تقدير قيم الأفعال، مما يُضعف جودة السياسة المُتعلَّمة.
A systematic phenomenon in Q-learning where the max operator over noisy estimates consistently overestimates action values, degrading learned policy quality.
تُرجم أيضاًتحيُّز الإفراط في التقدير
أول ظهور في هذه المجموعة: الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي (2018)
يظهر في هذه الأوراق