التحسين المباشر للتفضيلات
Direct Preference Optimization
أسلوب مواءمة يُحسِّن النموذج اللغوي مباشرة على أزواج التفضيل بدالة خسارة تصنيفية مُوجَّهة، متخطياً نمذجة المكافأة والتعلم المعزز بالكامل.
An alignment method that optimizes a language model directly on preference pairs using a supervised classification loss, bypassing reward modeling and reinforcement learning entirely.
تُرجم أيضاًDPO، التحسين المباشر بالتفضيل، المواءمة الفورية للاختيارات اللغوية، ضبط الترجيح المباشر للحلول
أول ظهور في هذه المجموعة: التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة (2023)
يظهر في هذه الأوراق
- التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة2023في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- Mixtral: مزيج الخبراء2024في السماء ✦
- Mixtral: مزيج الخبراء2024في السماء ✦
- RLAIF: توسيع التعلّم المعزَّز بتغذية راجعة آلية بدلاً من البشر2023في السماء ✦
- RLAIF: توسيع التعلّم المعزَّز بتغذية راجعة آلية بدلاً من البشر2023في السماء ✦