N-Step Return
العائد متعدّد الخطوات
تقدير للعائد يجمع بين مكافآت حقيقية لعدد محدود من الخطوات ثم يستكمل الباقي من تقدير الناقد، محققاً توازناً بين الانحياز والتباين.
A return estimate that combines a fixed number of real reward steps with a bootstrapped critic estimate for the remainder, balancing bias and variance.
Also translated asعائد الخطوات المتعدّدة، العائد بخطوات n
First appears in this corpus in: Asynchronous Methods for Deep Reinforcement Learning (2016)
Appears in these papers