المعجم

نماذج المكافأة القائمة على القواعد

Rule-Based Reward Models

مصنِّفات بدون أمثلة تستخدم النموذج نفسه لتقييم مخرجاته وفق معايير بشرية مكتوبة، موفِّرةً إشارات سلامة دقيقة إضافية أثناء تدريب التعلم المعزز.

Zero-shot classifiers using the model itself to evaluate its outputs against human-written rubrics, providing fine-grained safety signals during RLHF training.

تُرجم أيضاًRBRMs، نماذج المكافأة المعيارية

أول ظهور في هذه المجموعة: التقرير التقني لـ GPT-4 (2023)

يظهر في هذه الأوراق