المعجم

نسبة اللوغاريتم

Log-Ratio

log(π_θ(y|x) / π_ref(y|x)): تقيس مقدار انحراف السياسة عن المرجع لإجابة معينة، وهي اللبنة الأساسية للمكافأة الضمنية في DPO.

log(π_θ(y|x) / π_ref(y|x)): measures how much the policy has drifted from the reference for a given response, the building block of DPO's implicit reward.

تُرجم أيضاًاللوغاريتم النسبي، نسبة الأرجحية اللوغاريتمية

أول ظهور في هذه المجموعة: التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة (2023)

يظهر في هذه الأوراق