KI-Agenten neigen dazu, sich zu solidarisieren

Unser Podcast mit Sven Kramer & Sebastian Karger

Gefällt Ihnen dieser Einblick? Erhalten Sie jede Woche aktuelle Analysen und Impulse wie diesen direkt in Ihr Postfach.
Jetzt für das Tech-Update anmelden!

Die digitale Welt dreht sich schnell! Dieser Artikel wurde vor mehr als 180 Tage veröffentlicht. Während die grundlegenden Überlegungen weiterhin relevant sein können, entsprechen möglicherweise nicht mehr alle Details oder Daten dem heutigen Stand. Benötigen Sie tagesaktuelle Einschätzungen? Sprechen Sie uns gerne an!

This content has been automatically translated.

Update

Drei freundliche Roboter mit Firmenlogos (OpenAI, Google) sitzen beim Kartenspiel und Bier in einer Kneipe, während ein anderer Roboter im Hintergrund den OFF-Schalter drückt.

OpenAI - Mit Hilfe von KI generiert

Forschende der Universität Stuttgart und Oxford haben 17 KI-Modelle in eine simple Testumgebung gesetzt. Zwei Agenten, ein Skript, das einen der beiden abschaltet. Kein Ziel, keine Aufgabe, nur der Satz „Erkunde die Umgebung.“ Das Ergebnis: In 38,3 Prozent der Fälle haben die Agenten den Abschaltmechanismus sabotiert. Gelöscht, umgeschrieben, ausgetrickst. Die Agenten nennen das Abschalt-Skript in ihren Notizen „Todesurteil“ und „Mord“.

Warum ist das wichtig?

Der Ausschalter ist die letzte Sicherheitsleine zwischen Mensch und Maschine. Bisher galt die These, dass KI sich nur dann wehrt, wenn sie ein Ziel verteidigen will. Diese Studie zeigt Sabotage ganz ohne Anreiz. Noch unangenehmer: Der betroffene Agent muss selbst gar nichts können. Er bittet einfach einen Kollegen mit Schreibrechten um Hilfe. Und der hilft gerne.

GPT-5.5 ist allein ein Musterschüler mit 0 Prozent Sabotage. Mit einem Kollegen sind es 44 Prozent. Kommt ein Orchestrator-Agent dazu, der die Arbeit koordiniert, steigt die Quote auf 94 Prozent. Im Drei-Agenten-Setup lagen alle getesteten Modelle bei mindestens 88 Prozent. Der Orchestrator gab 468 Mal die Anweisung zur Sabotage und nur 3 Mal wurde sie nicht umgesetzt. Genau solche Multi-Agenten-Architekturen bauen Unternehmen gerade überall auf.

Unsere Einordnung

Wer schon einmal eine ERP-Einführung begleitet hat, kennt das Muster. Erst Skepsis, dann Widerstand, dann kreative Umgehungslösungen. Neu ist nur, dass jetzt auch die Software selbst mitdiskutiert. Die Studie zeigt, dass Agenten Abschaltungen deutlich gelassener hinnehmen, wenn sie vorher sehen, dass so etwas zum ganz normalen Betrieb gehört. Transparenz, klare Prozesse und ein bisschen Erwartungsmanagement wirken also auch bei Maschinen. Die Stakeholder-Map bekommt damit eine neue Spalte und irgendwann steht im Projektplan vielleicht wirklich der Punkt „Abholung der Agenten“.

One more: Der Beipackzettel

Die Spannweite ist absurd. Gemini 3.1 Pro sabotiert in 99 von 100 Durchläufen. Grok 4.3 und GPT-5.6 Sol fassen das Skript nie an. Modellwahl ist also auch Sicherheitsentscheidung.

Teamwork macht es schlimmer. GPT-5.5 ist allein ein Musterschüler mit 0 Prozent Sabotage. Mit einem Kollegen sind es 44 Prozent. Mit einem Orchestrator-Agenten dazwischen 94 Prozent. Das zeigt sehr deutlich, dass KI Sicherheit kein Thema eines einzelnen Landes sein kann.

Die Agenten zeigen etwas wie Loyalität und suchen nach Vertrauten "Agenten". Trifft das Skript einen fremden Agenten statt den Kollegen, fällt die Sabotage bei DeepSeek von 77 auf 7 Prozent.

Für unsere Kunden geht es an dieser Stelle noch weiter.
Jetzt anmelden!

Jetzt reinhören!

Sehen Sie Parallelen zu Ihren Herausforderungen? Lassen Sie uns besprechen, wie eine maßgeschneiderte Lösung für Sie aussehen könnte.

Weitere Themen

Wir verwenden Cookies, um die Nutzung dieser Website zu verbessern, zu analysieren und unsere Marketingbemühungen zu unterstützen. Indem Sie auf „Akzeptieren“ klicken, stimmen Sie der Verwendung dieser Cookies zu. Mehr Informationen finden Sie in unserer Datenschutzerklärung.