Reference Policy
السياسة المرجعية
نسخة مجمّدة من نموذج السياسة تُستخدم كنقطة مقارنة في التعلم المعزز عبر حدّ تباعد KL، لمنع السياسة الجديدة من الابتعاد كثيراً.
A frozen copy of the policy model used as a comparison point in RL via a KL divergence penalty, preventing the new policy from drifting too far.
Also translated asالنموذج المرجعي، سياسة الأساس، سياسة المرجع
First appears in this corpus in: Learning to Summarize from Human Feedback (2020)
Appears in these papers