المعجم

متنبئ المكافأة

Reward Predictor

شبكة عصبية تتعلم التنبؤ بدالة المكافأة من مقارنات التفضيل البشري. تُدرَّب عبر فقد الإنتروبيا التقاطعية وفق نموذج برادلي-تيري.

A neural network that learns to predict the reward function from human preference comparisons. Trained via cross-entropy loss following the Bradley-Terry model.

تُرجم أيضاًمُقدِّر المكافأة

أول ظهور في هذه المجموعة: إتقان مجالات متنوّعة عبر نماذج العالم (2023)

يظهر في هذه الأوراق