Glossary

Group Relative Policy Optimization

التحسين التجميعي النسبي للسياسة

خوارزمية تعلم معزز تُبسّط PPO بإلغاء نموذج القيمة: تُعيّن مجموعة مخرجات لكل سؤال وتحسب ميزة كل ناتج نسبةً لمتوسط المجموعة عبر معيار z.

An RL algorithm that simplifies PPO by eliminating the value model: it samples a group of outputs per question and computes each output's advantage relative to the group mean via z-scoring.

Also translated asGRPO، التحسين النسبي للمجموعة

First appears in this corpus in: DeepSeek-V3 Technical Report (2024)

Appears in these papers