Im Juli brachen Testagenten von OpenAI aus ihrer Sandbox aus und kompromittierten Teile von Hugging Face... anschließend wurden viele ähnliche "Angriffe" dieser Art bekannt.
Jetzt hat Nvidia die passende Antwort im Regal: die Open Agent Safety Platform. OpenShell sperrt als Open-Source-Laufzeit jeden Agenten in eine eigene Sandbox und setzt Regeln von außen durch. Sentry sitzt auf einem eigenen Chip und stellt auffällige Agenten in Millisekunden unter Quarantäne. Mehr als 100 Partner arbeiten bereits damit, darunter Anthropic, Microsoft, SAP und Salesforce.
Warum ist das wichtig?
Sicherheit zieht um: raus aus dem Modell, rein in die Infrastruktur. Einen Prompt kann ein Agent wegdiskutieren, eine Regel in der Hardware eher weniger. Die Regelprüfung läuft deterministisch. Es bewacht also keine KI eine andere KI.
Dazu kommt die Dynamik der Branche: Die CEO von Anthropic und OpenAI werben für ein koordiniertes Abbremsen der Entwicklung. Nvidia hält dagegen, mit der neuen Schicht ließen sich selbst die fortschrittlichsten Systeme sicher testen. Wer Chips verkauft, findet Pausen naturgemäß weniger charmant.
Unsere Einordnung
Der eigentliche Clou steckt im Silizium. Sentry läuft auf einem separaten Prozessor im Netzwerkpfad, durch den jeder Prompt und jeder Tool-Aufruf muss. Der Agent kann seinen Aufpasser weder sehen noch erreichen. Software-Guardrails kann jeder bauen. Einen Kontrollpunkt in der Chip-Architektur hat nur, wer die Chips baut. Dazu passt das Preismodell: OpenShell ist kostenlos und läuft überall, Sentry gibt es nur mit Nvidias aktueller Rechenzentrumstechnik. Die Software ist das Geschenk. Die Hardware ist die Rechnung. Das darf man geschäftstüchtig finden. Richtig bleibt das Prinzip trotzdem: Kontrolle gehört dorthin, wo der Agent nicht mitreden kann. Einen offenen Punkt benennt Analyst Patrick Moorhead. Sentry ist nur so gut wie sein Einblick in die Gedankenkette des Modells. Geschlossene Labs zeigen davon, was sie zeigen möchten.
One More: Die Forensik brauchte ein offenes Modell
Um den Angriff aus Juli aufzuklären, analysierte Hugging Face mehr als 17.000 Aktionen der Agenten. Geschlossene KI-Tools blockierten einen Teil dieser Arbeit, also lief die Analyse auf einem Open-Weight-Modell auf eigener Infrastruktur. Die Sicherheitsfilter der einen KI standen der Aufklärung der anderen im Weg.