خوارزمية SARSA
SARSA
خوارزمية تعلم معزز داخل السياسة تُحدِّث قيم Q باستخدام الفعل الذي اتُّخِذ فعلاً في الحالة التالية (بدلاً من أفضل فعل كما في Q-Learning)، مما يجعلها تُقيّم السياسة التي تتبعها فعلاً.
An on-policy reinforcement learning algorithm that updates Q-values using the action actually taken in the next state (rather than the best action as in Q-Learning), making it evaluate the policy it actually follows.
تُرجم أيضاًحالة-فعل-مكافأة-حالة-فعل
أول ظهور في هذه المجموعة: طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال (1999)
يظهر في هذه الأوراق