الاختبار العدائي
Red Teaming
ممارسة يحاول فيها مقيّمون بشريون أو آليون كسر نموذج ذكاء اصطناعي عمداً بمطالبات مصمَّمة لاستدراج مخرجات ضارّة أو متحيّزة أو غير أمينة، بهدف كشف الثغرات قبل النشر واستخدام النتائج في تحسين تدريب النموذج ومحاذاته.
A practice in which human or automated evaluators deliberately try to break an AI model with prompts crafted to elicit harmful, biased, or dishonest outputs, aiming to surface vulnerabilities before deployment and to feed the findings back into model training and alignment.
تُرجم أيضاًRed Teaming، اختبار الفريق الأحمر، اختبار الاختراق، تقييم أمن النماذج
أول ظهور في هذه المجموعة: مشكلات ملموسة في أمان الذكاء الاصطناعي (2016)
يظهر في هذه الأوراق
- مشكلات ملموسة في أمان الذكاء الاصطناعي2016في السماء ✦
- الذكاء الاصطناعي الدستوري: نحو نماذج آمنة بإشراف ذاتي مبني على مبادئ2022في السماء ✦
- Gemini: عائلة نماذج فائقة القدرات تجمع بين وسائط متعددة2023في السماء ✦
- التقرير التقني لـ GPT-42023في السماء ✦
- Llama 2: نماذج أساسية مفتوحة الأوزان ونماذج محادثة مُحاذَاة2023في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- اختبار الفريق الأحمر للنماذج اللغوية للحدّ من أضرارها: المنهجيات وأنماط التوسّع والدروس المستفادة2022في السماء ✦
- شرارات الذكاء الاصطناعي العام: تجارب مبكرة مع GPT-42023في السماء ✦