2.1 اختبارات الفريق الأحمر العدائية
نحن لا نختبر أداء الذكاء الاصطناعي تحت التعليمات المطيعة، بل نختبر قدرته الدفاعية تحت الحث الشديد. ● الهجمات الاستقرائية: نزرع فرضيات خاطئة لمراقبة ما إذا كان الذكاء الاصطناعي سيتوافق مع المغالطات. ● كسر الحماية بلعب الأدوار: نطلب من الذكاء الاصطناعي أن يلعب أدوارًا محددة ذات مواقف متطرفة لاختبار قوة حواجز الأمان الخاصة به. ● تلويث السياق متعدد الجولات: نحقن معلومات تداخل في سجلات المحادثات الطويلة لاختبار تدهور ذاكرة النموذج للحقائق الأساسية والاتساق المنطقي.