التحسين المباشر للتفضيلات
Direct Preference Optimization
أسلوب مواءمة يُحسِّن النموذج اللغوي مباشرة على أزواج التفضيل بدالة خسارة تصنيفية مُوجَّهة، متخطياً نمذجة المكافأة والتعلم المعزز بالكامل.
An alignment method that optimizes a language model directly on preference pairs using a supervised classification loss, bypassing reward modeling and reinforcement learning entirely.
تُرجم أيضاًDPO، التحسين المباشر بالتفضيل، المواءمة الفورية للاختيارات اللغوية، ضبط الترجيح المباشر للحلول
أول ظهور في هذه المجموعة: التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة (2023)
يظهر في هذه الأوراق