تعلُّم Q المزدوج المقصوص
Clipped Double Q-Learning
تمديد لتعلُّم Q المزدوج يستخدم شبكتي هدف ويأخذ الأدنى من تقديراتهما لقيمة الحالة التالية، مما يكبح انحياز المبالغة في التقدير الذي يُصيب تعلُّم Q العادي.
An extension of Double Q-learning that uses two target networks and takes the minimum of their value estimates for the next state, suppressing the overestimation bias that plagues standard Q-learning.
تُرجم أيضاًQ-Learning المزدوج بالقصّ
أول ظهور في هذه المجموعة: QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية (2018)
يظهر في هذه الأوراق