خوارزمية تحسين السياسة القريبة
Proximal Policy Optimization (PPO)
خوارزمية تعزيز متطورة تضمن تحديث استراتيجية الأفعال بنسب آمنة وتدريجية لمنع انهيار الأداء التدريبي.
Proximal Policy Optimization (PPO)
تُرجم أيضاًمحسن استراتيجيات الأفعال المحدود التغير، معيار التعديل الآمن والتدريجي للقرارات
أول ظهور في هذه المجموعة: الأساليب غير المتزامنة للتعلُّم المعزَّز العميق (2016)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- التقرير التقني لـ DeepSeek-V32024في السماء ✦
- التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم2016في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- Llama 2: نماذج أساسية مفتوحة الأوزان ونماذج محادثة مُحاذَاة2023في السماء ✦
- Self-RAG: كيف يتعلّم النموذج أن يسترجع ويُولِّد وينتقد نفسه2023في السماء ✦