التعلُّم المعزز من التغذية الراجعة البشرية
RLHF
تقنية تدريب يُجمع فيها آلاف التفضيلات البشرية بين أزواج الاستجابات لتدريب نموذج مكافأة، ثمّ يُستخدم هذا النموذج لتحسين سياسة الذكاء الاصطناعي عبر التعلُّم المعزز.
A training technique where thousands of human preferences between response pairs train a reward model, which then optimizes the AI policy via reinforcement learning.
تُرجم أيضاًRLHF، التعزيز بالتقييم البشري، التعلم المعزز بالتغذية الراجعة البشرية، التعلم المعزز بالتقييم البشري، التعلم المعزز بتقييم بشري
أول ظهور في هذه المجموعة: تعلُّم التلخيص من التغذية الراجعة البشرية (2020)
يظهر في هذه الأوراق
- ألباكا: نموذج قوي وقابل للتكرار يتّبع التعليمات2023في السماء ✦
- الذكاء الاصطناعي الدستوري: نحو نماذج آمنة بإشراف ذاتي مبني على مبادئ2022في السماء ✦
- Gemini: عائلة نماذج فائقة القدرات تجمع بين وسائط متعددة2023في السماء ✦
- التقرير التقني لـ GPT-42023في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- Mixtral: مزيج الخبراء2024في السماء ✦
- RLAIF: توسيع التعلّم المعزَّز بتغذية راجعة آلية بدلاً من البشر2023في السماء ✦
- التعميم من الضعيف إلى القوي: استخراج القدرات القوية بإشراف ضعيف2023في السماء ✦