المعجم

تعلُّم Q المزدوج المقصوص

Clipped Double Q-Learning

تمديد لتعلُّم Q المزدوج يستخدم شبكتي هدف ويأخذ الأدنى من تقديراتهما لقيمة الحالة التالية، مما يكبح انحياز المبالغة في التقدير الذي يُصيب تعلُّم Q العادي.

An extension of Double Q-learning that uses two target networks and takes the minimum of their value estimates for the next state, suppressing the overestimation bias that plagues standard Q-learning.

تُرجم أيضاًQ-Learning المزدوج بالقصّ

أول ظهور في هذه المجموعة: QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية (2018)

يظهر في هذه الأوراق