التعلُّم بالفرق الزمني
Temporal Difference Learning
عائلة خوارزميات في التعلّم المعزّز تُحدِّث تقديرات دالة القيمة بناءً على الفرق بين تنبؤات متعاقبة بدل انتظار النتيجة النهائية. تجمع بين فكرة التمهيد من البرمجة الديناميكية وأخذ العيّنات من أساليب مونت كارلو.
A family of reinforcement learning algorithms that update value-function estimates based on the difference between successive predictions rather than waiting for the final outcome. Combines the bootstrapping idea from dynamic programming with the sampling approach of Monte Carlo methods.
تُرجم أيضاًتعلّم الفرق الزمني، أسلوب الفرق الزمني
أول ظهور في هذه المجموعة: TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد (2018)
يظهر في هذه الأوراق