المعجم

التحسين المباشر للتفضيلات

Direct Preference Optimization

أسلوب مواءمة يُحسِّن النموذج اللغوي مباشرة على أزواج التفضيل بدالة خسارة تصنيفية مُوجَّهة، متخطياً نمذجة المكافأة والتعلم المعزز بالكامل.

An alignment method that optimizes a language model directly on preference pairs using a supervised classification loss, bypassing reward modeling and reinforcement learning entirely.

تُرجم أيضاًDPO، التحسين المباشر بالتفضيل، المواءمة الفورية للاختيارات اللغوية، ضبط الترجيح المباشر للحلول

أول ظهور في هذه المجموعة: التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة (2023)

يظهر في هذه الأوراق