نموذج المكافأة
Reward Model
شبكة عصبية مُدرَّبة على تفضيلات بشرية لتقدير جودة استجابة النموذج، تُستخدم كإشارة تدريب في التعلم المعزز بدلاً من التقييم البشري المباشر.
A neural network trained on human preferences to estimate the quality of a model's response, used as a training signal in reinforcement learning instead of direct human evaluation.
تُرجم أيضاًمُقيِّم المكافأة، نموذج التفضيلات، نموذج التقييم، نموذج التقييم البشري، نموذج الثواب، نموذج الجزاء
أول ظهور في هذه المجموعة: التعلم المعزز العميق من التفضيلات البشرية (2017)
يظهر في هذه الأوراق
- أمان الذكاء الاصطناعي عبر المناظرة2018في السماء ✦
- الذكاء الاصطناعي الدستوري: نحو نماذج آمنة بإشراف ذاتي مبني على مبادئ2022في السماء ✦
- التعلم المعزز العميق من التفضيلات البشرية2017في السماء ✦
- التقرير التقني لـ DeepSeek-V32024في السماء ✦
- التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة2023في السماء ✦
- Gemma: نماذج مفتوحة الأوزان مبنية على أبحاث وتقنيات Gemini2024في السماء ✦
- التقرير التقني لـ GPT-42023في السماء ✦
- تدريب النماذج اللغوية على اتّباع التعليمات باستخدام التغذية الراجعة البشرية2022في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- LIMA: القليل يكفي للمواءمة2023في السماء ✦
- Llama 2: نماذج أساسية مفتوحة الأوزان ونماذج محادثة مُحاذَاة2023في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- Mixtral: مزيج الخبراء2024في السماء ✦
- MuZero: إتقان ألعاب Atari وGo والشطرنج وShogi بالتخطيط عبر نموذج مُتعلَّم2020في السماء ✦
- RLAIF: توسيع التعلّم المعزَّز بتغذية راجعة آلية بدلاً من البشر2023في السماء ✦
- Self-RAG: كيف يتعلّم النموذج أن يسترجع ويُولِّد وينتقد نفسه2023في السماء ✦
- التعميم من الضعيف إلى القوي: استخراج القدرات القوية بإشراف ضعيف2023في السماء ✦
- WebGPT: الإجابة عن الأسئلة بمساعدة متصفّح ويب وتغذية راجعة بشرية2021في السماء ✦