تعلم دالة الجودة (Q)
Q-Learning
خوارزمية تعلم تعزيز مباشرة تحدّث قيم جودة الأفعال (Q) مستقلة عن السياسة السلوكية المتبعة لحظياً.
Q-Learning
تُرجم أيضاًخوارزمية جدول الأفعال والمنفعة، التعلم التدعيمي غير المقيد بالسياسة المسبقة
أول ظهور في هذه المجموعة: التعلُّم بالتنبؤ عبر أساليب الفارق الزمني (1988)
يظهر في هذه الأوراق
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- التعلّم المعزّز العميق بأسلوب Q المزدوج2016في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- التعلُّم بالتنبؤ عبر أساليب الفارق الزمني1988في السماء ✦