التهرُّب
Evasiveness
ميل النماذج المُدرَّبة على السلامة إلى رفض الخوض في المواضيع الحسّاسة كلياً بعبارات جاهزة مثل «لا أستطيع الإجابة»، بدلاً من الشرح المُتعقِّل لأسباب الرفض.
The tendency of safety-trained models to refuse to engage with sensitive topics entirely using canned phrases like 'I can't answer that', instead of thoughtfully explaining why.
تُرجم أيضاًالتملُّص، الاستجابة المُراوِغة
أول ظهور في هذه المجموعة: الذكاء الاصطناعي الدستوري: نحو نماذج آمنة بإشراف ذاتي مبني على مبادئ (2022)
يظهر في هذه الأوراق