تقادم نموذج المكافأة
Reward Model Staleness
مشكلة تحدث عندما يُدرَّب نموذج المكافأة على مخرجات السياسة الأولية، فتبتعد مخرجات السياسة المُحسَّنة عن توزيع بيانات التدريب مع تقدّم التعلّم المعزَّز، مما يُضعف موثوقية درجات المكافأة.
A problem where the reward model, trained on the initial policy's outputs, becomes unreliable as the RL-optimized policy's outputs drift away from the training data distribution.
تُرجم أيضاًنموذج مكافأة متقادم، عدم تحديث نموذج المكافأة