خطأ الفارق الزمني
TD Error
الفرق بين التنبؤ الحالي والهدف المُستمَد من الخطوة التالية: δₜ = rₜ₊₁ + γV(sₜ₊₁) − V(sₜ). هذه الإشارة الأساسية تقود التعلم في جميع خوارزميات التعلم المعزز القائمة على القيمة.
The difference between the current prediction and the target derived from the next step: δₜ = rₜ₊₁ + γV(sₜ₊₁) − V(sₜ). This fundamental signal drives learning in all value-based reinforcement learning algorithms.
تُرجم أيضاًإشارة الخطأ الزمني، فارق التنبؤ المتعاقب
أول ظهور في هذه المجموعة: التعلُّم بالتنبؤ عبر أساليب الفارق الزمني (1988)
يظهر في هذه الأوراق
- إعادة التجربة بالأولوية2015في السماء ✦
- Rainbow: دمج التحسينات في التعلُّم المعزَّز العميق2018في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- التعلُّم بالفرق الزمني و TD-Gammon1995في السماء ✦
- التعلُّم بالتنبؤ عبر أساليب الفارق الزمني1988في السماء ✦