المعجم

التعلم بالتعزيز المباشر (دون نموذج بيئة)

Model-Free RL

خوارزميات تعزيز تتعلم مباشرة عبر خوض التجربة والخطأ دون الحاجة لبناء نموذج محاكاة للبيئة.

Model-Free RL

تُرجم أيضاًالخوارزميات المعتمدة على التجربة المباشرة، التعلم التدعيمي الحر من القيود التنبؤية

أول ظهور في هذه المجموعة: تعلُّم دالة الجودة (Q-Learning) (1992)

يظهر في هذه الأوراق