المعجم

المكافأة الضمنية

Implicit Reward

في DPO، المكافأة المُعرَّفة بنسبة لوغاريتم السياسة إلى المرجع: β·log(π_θ/π_ref)، دون الحاجة لنموذج مكافأة منفصل.

In DPO, the reward defined by the policy-to-reference log-ratio: β·log(π_θ/π_ref), requiring no separate reward model.

تُرجم أيضاًالمكافأة المُتضمَّنة، الجزاء الضمني

أول ظهور في هذه المجموعة: التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة (2023)

يظهر في هذه الأوراق