نموذج المكافأة المزدوج
Dual Reward Model
نهج يستخدم نموذجَي مكافأة منفصلَين — واحد للمفيدية وآخر للسلامة — بدلاً من نموذج واحد يوازن بين الهدفين. يتجنّب التوتر حيث قد يُضحّي نموذج وحيد بأحد الهدفين لصالح الآخر.
An approach using two separate reward models — one for helpfulness and one for safety — instead of a single model balancing both objectives. Avoids the tension where a single model might sacrifice one objective for the other.
تُرجم أيضاًنموذجا مكافأة منفصلان
أول ظهور في هذه المجموعة: Llama 2: نماذج أساسية مفتوحة الأوزان ونماذج محادثة مُحاذَاة (2023)
يظهر في هذه الأوراق