التحسين التقريبي للسياسة
Proximal Policy Optimization
خوارزمية تعلم معزز واسعة الاستخدام تُحدّث السياسة بخطوات مستقرة عبر قصّ نسبة الاحتمال بين السياسة الجديدة والقديمة، وتتطلب نموذج قيمة منفصلاً.
A widely used RL algorithm that updates the policy in stable steps by clipping the probability ratio between new and old policies, requiring a separate value model.
تُرجم أيضاًPPO، التحسين الاقترابي للسياسة، التحسين القريب للسياسة
أول ظهور في هذه المجموعة: طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال (1999)
يظهر في هذه الأوراق
- DeepSeek-R1: تحفيز قدرات الاستدلال في النماذج اللغوية الكبيرة عبر التعلم المعزز2025في السماء ✦
- التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة2023في السماء ✦
- تدريب النماذج اللغوية على اتّباع التعليمات باستخدام التغذية الراجعة البشرية2022في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- Llama 2: نماذج أساسية مفتوحة الأوزان ونماذج محادثة مُحاذَاة2023في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- خوارزمية تحسين السياسة القريبة (PPO)2017في السماء ✦
- WebGPT: الإجابة عن الأسئلة بمساعدة متصفّح ويب وتغذية راجعة بشرية2021في السماء ✦