Group Relative Policy Optimization
التحسين التجميعي النسبي للسياسة
خوارزمية تعلم معزز تُبسّط PPO بإلغاء نموذج القيمة: تُعيّن مجموعة مخرجات لكل سؤال وتحسب ميزة كل ناتج نسبةً لمتوسط المجموعة عبر معيار z.
An RL algorithm that simplifies PPO by eliminating the value model: it samples a group of outputs per question and computes each output's advantage relative to the group mean via z-scoring.
Also translated asGRPO، التحسين النسبي للمجموعة
First appears in this corpus in: DeepSeek-V3 Technical Report (2024)
Appears in these papers