التعلم بالتعزيز المباشر (دون نموذج بيئة)
Model-Free RL
خوارزميات تعزيز تتعلم مباشرة عبر خوض التجربة والخطأ دون الحاجة لبناء نموذج محاكاة للبيئة.
Model-Free RL
تُرجم أيضاًالخوارزميات المعتمدة على التجربة المباشرة، التعلم التدعيمي الحر من القيود التنبؤية
أول ظهور في هذه المجموعة: تعلُّم دالة الجودة (Q-Learning) (1992)
يظهر في هذه الأوراق