Glossary

Reward Model Staleness

تقادم نموذج المكافأة

مشكلة تحدث عندما يُدرَّب نموذج المكافأة على مخرجات السياسة الأولية، فتبتعد مخرجات السياسة المُحسَّنة عن توزيع بيانات التدريب مع تقدّم التعلّم المعزَّز، مما يُضعف موثوقية درجات المكافأة.

A problem where the reward model, trained on the initial policy's outputs, becomes unreliable as the RL-optimized policy's outputs drift away from the training data distribution.

Also translated asنموذج مكافأة متقادم، عدم تحديث نموذج المكافأة