المكافأة الضمنية
Implicit Reward
في DPO، المكافأة المُعرَّفة بنسبة لوغاريتم السياسة إلى المرجع: β·log(π_θ/π_ref)، دون الحاجة لنموذج مكافأة منفصل.
In DPO, the reward defined by the policy-to-reference log-ratio: β·log(π_θ/π_ref), requiring no separate reward model.
تُرجم أيضاًالمكافأة المُتضمَّنة، الجزاء الضمني
أول ظهور في هذه المجموعة: التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة (2023)
يظهر في هذه الأوراق