نسبة اللوغاريتم
Log-Ratio
log(π_θ(y|x) / π_ref(y|x)): تقيس مقدار انحراف السياسة عن المرجع لإجابة معينة، وهي اللبنة الأساسية للمكافأة الضمنية في DPO.
log(π_θ(y|x) / π_ref(y|x)): measures how much the policy has drifted from the reference for a given response, the building block of DPO's implicit reward.
تُرجم أيضاًاللوغاريتم النسبي، نسبة الأرجحية اللوغاريتمية
أول ظهور في هذه المجموعة: التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة (2023)
يظهر في هذه الأوراق