Adversarial Testing
الاختبار العدائي
فحص النموذج عمداً بحثاً عن نقاط الفشل والثغرات والقدرات الخطيرة، عادةً باستخدام خبراء متخصصين في مجالات حساسة كالأمن السيبراني والبيولوجي.
Deliberately probing a model for failures, vulnerabilities, and dangerous capabilities, typically using domain experts in sensitive areas like cybersecurity and biosecurity.
Also translated asالاختبار التنافسي، الفحص بالهجمات
First appears in this corpus in: Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned (2022)
Appears in these papers