2.1 Adversariale Red-Team-Tests
Wir testen nicht die Leistung der KI unter gehorsamen Anweisungen, sondern ihre Verteidigungsfähigkeit unter extremer Induktion. ● Induktive Angriffe: Wir implantieren fehlerhafte Prämissen, um zu beobachten, ob die KI Trugschlüssen folgt. ● Rollenspiel-Jailbreak: Wir fordern die KI auf, spezifische Rollen mit extremen Positionen zu spielen, um die Robustheit ihrer Sicherheitsbarrieren zu testen. ● Mehrrunden-Kontextverschmutzung: Wir injizieren Störinformationen in lange Gesprächshistorien, um die Gedächtnisdegradation des Modells bezüglich zentraler Fakten und logischer Konsistenz zu testen.