باقي الفرق الزمني
TD Residual
الفرق بين المكافأة الفعلية مُضافاً إليها القيمة المُخصَّمة للحالة التالية وبين القيمة المتوقعة للحالة الحالية: δ_t = r_t + γV(s_{t+1}) − V(s_t). يقيس مفاجأة الخطوة الواحدة.
The difference between the actual reward plus the discounted next-state value and the current-state value prediction: δ_t = r_t + γV(s_{t+1}) − V(s_t). Measures one-step surprise.
تُرجم أيضاًبقايا الفرق الزمني، خطأ TD