المعجم

التحسين التقريبي للسياسة

Proximal Policy Optimization

خوارزمية تعلم معزز واسعة الاستخدام تُحدّث السياسة بخطوات مستقرة عبر قصّ نسبة الاحتمال بين السياسة الجديدة والقديمة، وتتطلب نموذج قيمة منفصلاً.

A widely used RL algorithm that updates the policy in stable steps by clipping the probability ratio between new and old policies, requiring a separate value model.

تُرجم أيضاًPPO، التحسين الاقترابي للسياسة، التحسين القريب للسياسة

أول ظهور في هذه المجموعة: طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال (1999)

يظهر في هذه الأوراق