عملية ماركوف لاتخاذ القرار
Markov Decision Process (MDP)
الإطار الرياضي الرسمي المستخدم لنمذجة وصياغة مسائل التعلم بالتعزيز وبيئاتها التفاعلية.
Markov Decision Process (MDP)
تُرجم أيضاًالصياغة الرياضية لبيئات التعزيز، هيكلية القرارات الاحتمالية المتعاقبة
أول ظهور في هذه المجموعة: البرمجة الديناميكية (1957)
يظهر في هذه الأوراق
- محوِّل القرار: التعلّم المعزَّز عبر نمذجة التسلسلات2021في السماء ✦
- البرمجة الديناميكية1957في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦