Baseline (RL)
خطّ الأساس (في التعلّم بالتعزيز)
قيمة مرجعية تُطرح من المكافأة قبل تحديث الأوزان. الهدف: بدلًا من تعزيز كل فعل أعطى مكافأة إيجابية، عزّز فقط الأفعال التي أعطت مكافأة *أفضل من المتوقّع*. هذا يُقلّل تذبذب التدرّج بشكل كبير دون إفساد اتجاه التعلّم. أفضل خطّ أساس يقترب من دالّة قيمة الحالة — أي المكافأة المتوقّعة من الحالة الحالية.
A value subtracted from the return in the policy gradient to reduce estimation variance without introducing bias; the optimal baseline approximates the state value function.
Also translated asالقيمة المرجعية لتقليل التباين، المعيار الأساسي للمكافأة، خطّ الأساس
First appears in this corpus in: Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning (1992)
Appears in these papers