التحسين التجميعي النسبي للسياسة
Group Relative Policy Optimization
خوارزمية تعلم معزز تُبسّط PPO بإلغاء نموذج القيمة: تُعيّن مجموعة مخرجات لكل سؤال وتحسب ميزة كل ناتج نسبةً لمتوسط المجموعة عبر معيار z.
An RL algorithm that simplifies PPO by eliminating the value model: it samples a group of outputs per question and computes each output's advantage relative to the group mean via z-scoring.
تُرجم أيضاًGRPO، التحسين النسبي للمجموعة
أول ظهور في هذه المجموعة: التقرير التقني لـ DeepSeek-V3 (2024)
يظهر في هذه الأوراق