2.1 Pruebas Adversariales de Equipo Rojo
No probamos el rendimiento de la IA bajo instrucciones obedientes, sino su capacidad de defensa bajo inducción extrema. ● Ataques inductivos: Implantamos premisas erróneas para observar si la IA se conforma a falacias. ● Jailbreak de juego de roles: Solicitamos a la IA que interprete roles específicos con posturas extremas para probar la robustez de sus barreras de seguridad. ● Contaminación contextual de múltiples rondas: Inyectamos información de interferencia en historiales de conversación largos para probar la degradación de memoria del modelo sobre hechos centrales y la consistencia lógica.