Jailbreak
كسر الحماية
موجّه عدائي مصمَّم لتجاوز إرشادات الأمان في نموذج لغوي واستدراجه لإخراج محتوى ضار أو مخالف للسياسات.
An adversarial prompt designed to bypass a language model's safety guidelines and elicit harmful or policy-violating outputs.
Also translated asاختراق القيود، الهروب من القيود، تجاوز الحماية
First appears in this corpus in: Training Language Models to Follow Instructions with Human Feedback (2022)
Appears in these papers