المعجم

خطأ الفارق الزمني

TD Error

الفرق بين التنبؤ الحالي والهدف المُستمَد من الخطوة التالية: δₜ = rₜ₊₁ + γV(sₜ₊₁) − V(sₜ). هذه الإشارة الأساسية تقود التعلم في جميع خوارزميات التعلم المعزز القائمة على القيمة.

The difference between the current prediction and the target derived from the next step: δₜ = rₜ₊₁ + γV(sₜ₊₁) − V(sₜ). This fundamental signal drives learning in all value-based reinforcement learning algorithms.

تُرجم أيضاًإشارة الخطأ الزمني، فارق التنبؤ المتعاقب

أول ظهور في هذه المجموعة: التعلُّم بالتنبؤ عبر أساليب الفارق الزمني (1988)

يظهر في هذه الأوراق