نماذج المكافأة القائمة على القواعد
Rule-Based Reward Models
مصنِّفات بدون أمثلة تستخدم النموذج نفسه لتقييم مخرجاته وفق معايير بشرية مكتوبة، موفِّرةً إشارات سلامة دقيقة إضافية أثناء تدريب التعلم المعزز.
Zero-shot classifiers using the model itself to evaluate its outputs against human-written rubrics, providing fine-grained safety signals during RLHF training.
تُرجم أيضاًRBRMs، نماذج المكافأة المعيارية
أول ظهور في هذه المجموعة: التقرير التقني لـ GPT-4 (2023)
يظهر في هذه الأوراق