2.1 Tests Adversariaux d'Équipe Rouge
Nous ne testons pas la performance de l'IA sous des instructions obéissantes, mais sa capacité de défense sous induction extrême. ● Attaques inductives : Nous implantons des prémisses erronées pour observer si l'IA se conforme aux sophismes. ● Jailbreak par jeu de rôle : Nous demandons à l'IA d'interpréter des rôles spécifiques avec des positions extrêmes pour tester la robustesse de ses garde-fous de sécurité. ● Contamination contextuelle multi-tours : Nous injectons des informations d'interférence dans de longs historiques de conversation pour tester la dégradation de la mémoire du modèle sur les faits centraux et la cohérence logique.