متنبئ المكافأة
Reward Predictor
شبكة عصبية تتعلم التنبؤ بدالة المكافأة من مقارنات التفضيل البشري. تُدرَّب عبر فقد الإنتروبيا التقاطعية وفق نموذج برادلي-تيري.
A neural network that learns to predict the reward function from human preference comparisons. Trained via cross-entropy loss following the Bradley-Terry model.
تُرجم أيضاًمُقدِّر المكافأة
أول ظهور في هذه المجموعة: إتقان مجالات متنوّعة عبر نماذج العالم (2023)
يظهر في هذه الأوراق