المعجم

التحسين التجميعي النسبي للسياسة

Group Relative Policy Optimization

خوارزمية تعلم معزز تُبسّط PPO بإلغاء نموذج القيمة: تُعيّن مجموعة مخرجات لكل سؤال وتحسب ميزة كل ناتج نسبةً لمتوسط المجموعة عبر معيار z.

An RL algorithm that simplifies PPO by eliminating the value model: it samples a group of outputs per question and computes each output's advantage relative to the group mean via z-scoring.

تُرجم أيضاًGRPO، التحسين النسبي للمجموعة

أول ظهور في هذه المجموعة: التقرير التقني لـ DeepSeek-V3 (2024)

يظهر في هذه الأوراق