المعجم

خوارزمية التعلم خارج السياسة الحالية

Off-Policy

خوارزميات تعزيز تمتلك مرونة التعلم وتحديث استراتيجيتها بالاعتماد على سجلات تفاعلية سابقة أو سياسات سلوكية أخرى.

Off-Policy

تُرجم أيضاًالتعلم التدعيمي المستقل عن استراتيجية التنفيذ، مواءمة الأفعال عبر السجلات التاريخية

أول ظهور في هذه المجموعة: تعلُّم دالة الجودة (Q-Learning) (1992)

يظهر في هذه الأوراق