المعجم

خوارزمية SARSA

SARSA

خوارزمية تعلم معزز داخل السياسة تُحدِّث قيم Q باستخدام الفعل الذي اتُّخِذ فعلاً في الحالة التالية (بدلاً من أفضل فعل كما في Q-Learning)، مما يجعلها تُقيّم السياسة التي تتبعها فعلاً.

An on-policy reinforcement learning algorithm that updates Q-values using the action actually taken in the next state (rather than the best action as in Q-Learning), making it evaluate the policy it actually follows.

تُرجم أيضاًحالة-فعل-مكافأة-حالة-فعل

أول ظهور في هذه المجموعة: طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال (1999)

يظهر في هذه الأوراق