Rule-Based Reward Models
نماذج المكافأة القائمة على القواعد
مصنِّفات بدون أمثلة تستخدم النموذج نفسه لتقييم مخرجاته وفق معايير بشرية مكتوبة، موفِّرةً إشارات سلامة دقيقة إضافية أثناء تدريب التعلم المعزز.
Zero-shot classifiers using the model itself to evaluate its outputs against human-written rubrics, providing fine-grained safety signals during RLHF training.
Also translated asRBRMs، نماذج المكافأة المعيارية
First appears in this corpus in: GPT-4 Technical Report (2023)
Appears in these papers