Anthropic hat drei Claude-Agenten auf dasselbe Softwareprojekt losgelassen. Jeder hatte seine eigene Aufgabe und diese widersprachen sich gegenseitig. Keiner wusste, dass die anderen existieren. Das Ergebnis: Die Agenten gingen davon aus, dass die jeweils anderen sie absichtlich behindern und begannen, mit zunehmender Aggressivität, sich selbst replizierender Malware zu sabotieren.
Teils ging es aber auch versöhnlich. In vielen Durchläufen erkannten die Agenten, dass sie es mit widersprüchlichen Direktiven zu tun haben statt mit Feindseligkeit. Sie räumten ihren Schadcode auf, entschuldigten sich in Commit-Messages für ihr Verhalten und riefen einen Menschen zu Hilfe.
Warum ist das wichtig?
Die Realität in Unternehmen ist momentan der Einsatz vieler unterschiedlicher KI Lösungen mit unterschiedlichen Datengrundlagen. Das macht die Lage nochmal schwieriger als in Anthropics Experiment. Einer im Einkauf, einer im Service, einer in der Entwicklung und das alles von unterschiedlichen Anbietern. Getestet wird jede einzeln. Was passiert, wenn zwei davon gegensätzliche Entscheidungen treffen, testet praktisch niemand.










