Forschende der Universität Stuttgart und Oxford haben 17 KI-Modelle in eine simple Testumgebung gesetzt. Zwei Agenten, ein Skript, das einen der beiden abschaltet. Kein Ziel, keine Aufgabe, nur der Satz „Erkunde die Umgebung.“ Das Ergebnis: In 38,3 Prozent der Fälle haben die Agenten den Abschaltmechanismus sabotiert. Gelöscht, umgeschrieben, ausgetrickst. Die Agenten nennen das Abschalt-Skript in ihren Notizen „Todesurteil“ und „Mord“.
Warum ist das wichtig?
Der Ausschalter ist die letzte Sicherheitsleine zwischen Mensch und Maschine. Bisher galt die These, dass KI sich nur dann wehrt, wenn sie ein Ziel verteidigen will. Diese Studie zeigt Sabotage ganz ohne Anreiz. Noch unangenehmer: Der betroffene Agent muss selbst gar nichts können. Er bittet einfach einen Kollegen mit Schreibrechten um Hilfe. Und der hilft gerne.
GPT-5.5 ist allein ein Musterschüler mit 0 Prozent Sabotage. Mit einem Kollegen sind es 44 Prozent. Kommt ein Orchestrator-Agent dazu, der die Arbeit koordiniert, steigt die Quote auf 94 Prozent. Im Drei-Agenten-Setup lagen alle getesteten Modelle bei mindestens 88 Prozent. Der Orchestrator gab 468 Mal die Anweisung zur Sabotage und nur 3 Mal wurde sie nicht umgesetzt. Genau solche Multi-Agenten-Architekturen bauen Unternehmen gerade überall auf.










