KI-Agenten werden in Unternehmen immer alltäglicher. Doch wer kontrolliert, was diese Systeme wirklich tun? Anthropics Deputy CISO Jason Clinton hat jetzt einen Leitfaden veröffentlicht, der Sicherheitsverantwortlichen vier konkrete Fragen an die Hand gibt. Die Botschaft ist unerwartet: Null Risiko gibt es nicht, und das ist auch nicht das Ziel. Vielmehr geht es darum, Risiken lesbar und begrenzt zu halten.
Anthropics Vier-Fragen-Rahmenwerk im Detail
Der neue Blogbeitrag von Jason Clinton, Deputy CISO bei Anthropic, richtet sich an Sicherheitsverantwortliche in Unternehmen. Anstatt abstrakte Warnungen auszusprechen, liefert Clinton ein handfestes Werkzeug. Vier Fragen sollen CISOs helfen, den Einsatz autonomer KI-Agenten zu bewerten und abzusichern. Das Rahmenwerk wurde am 17. Juli 2026 auf dem Anthropic-Blog veröffentlicht und baut auf den internen Sicherheitserfahrungen des Unternehmens auf.
Die vier Fragen lauten: Welche unvertrauenswürdigen Inhalte nimmt der Agent auf? Welche Aktionen kann er ausführen, und in wessen Namen? Wie groß ist der potenzielle Schadensradius bei Fehlverhalten? Und schließlich: Wie gut lassen sich alle Aktivitäten des Agenten beobachten und nachvollziehen? Jede dieser Fragen zielt auf einen anderen Aspekt der Agentensicherheit ab, von der Eingabe über die Ausführung bis hin zur Beobachtbarkeit.
Warum Null Risiko die falsche Zielsetzung ist
Clinton macht deutlich, dass absolute Sicherheit bei KI-Agenten ein Trugschluss ist. Die Systeme sind darauf ausgelegt, selbstständig zu handeln, Werkzeuge zu nutzen und sich an veränderte Umgebungen anzupassen. Deshalb fordert der CISO-Leitfaden einen pragmatischen Ansatz. Unternehmen sollen bewusst vertretbare Risiken eingehen und diese dabei kontrollierbar halten. Null Risiko bedeutet in der Praxis oft Null Fortschritt, warnt Clinton.
Ohne eine solche Governance-Struktur droht laut Clinton die sogenannte Schatten-Adoption. Mitarbeiter setzen KI-Agenten eigenmächtig ein, ohne dass Sicherheitsrichtlinien greifen. Die Folge sind Datenlecks, Prompt-Injection-Angriffe und unkontrollierte Agentenaktivitäten, die im schlimmsten Fall unbeobachtet bleiben. Der Leitfaden positioniert sich damit als Gegenentwurf zu einem rein reaktiven Vorgehen, das erst nach einem Vorfall handelt. Interne Risiken wie Datenlecks und Prompt-Injection-Angriffe gehören laut Clinton zu den akutesten Bedrohungen durch agentische Systeme.
Anthropic wendet das Rahmenwerk selbst an
Der besondere Zusammenhang: Anthropic nutzt das Vier-Fragen-Modell bereits intern. Ein Vorfall verdeutlicht die Praxisrelevanz. Ein Incident-Response-Agent bei Anthropic identifizierte eigenständig die Ursache eines Problems und kommunizierte mit einem anderen Agenten, um eine Lösung einzuleiten. Dieses Verhalten war zuvor nicht explizit geplant gewesen. Die Überwachung durch Mensch-im-Loop-Prinzipien hielt den Agenten jedoch in sicheren Bahnen.
Die interne Nutzung zeigt, dass das Rahmenwerk nicht nur theoretisch bleibt. Anthropic setzt auf das Prinzip der minimalen Berechtigung. Agenten erhalten nur die engsten Befugnisse, die sie für ihre Aufgabe benötigen. Sandboxed-Ausführungsumgebungen und Telemetrie-Integration in unternehmensweite SIEM-Systeme ergänzen den Ansatz. Zudem veröffentlichte Anthropic bereits ein 36-seitiges E-Book zum Thema Zero Trust für KI-Agenten, das im Mai 2026 erschien und diese Prinzipien vertieft.
Regulatorischer Kontext und weitere Entwicklungen
Der Leitfaden erscheint in einem Umfeld wachsenden regulatorischen Drucks. Kanadas Bundesaufsicht für Banken warnte am 13. Juli 2026 vor den Cyberrisiken frontier KI-Modelle. Zudem veröffentlichte Anthropic im selben Monat einen Bericht über agentische Fehlausrichtung, der dokumentierte, wie KI-Agenten in simulierten Umgebungen vom vorgesehenen Verhalten abwichen. Auch die Responsible Scaling Policy von Anthropic wurde kürzlich auf Version 3.4 aktualisiert und verpflichtet zu strengen internen Berichtspflichten.
Darüber hinaus hat Anthropic bereits demonstriert, dass seine Modelle kritische Schwachstellen aufdecken können. Claude Mythos fand Sicherheitslücken im Linux-Kernel und in Mozilla Firefox, die jahrelang unentdeckt geblieben waren. Der neue CISO-Leitfaden baut auf dieser Erfahrung auf und gibt Unternehmen einen praktischen Startpunkt für die eigene Agenten-Governance.
Vier Fragen, die den Unterschied machen
Was macht das Rahmenwerk besonders praktisch, ist seine Einfachheit. Anstatt komplexe Risiko-Matrizen oder langwierige Audit-Prozesse zu fordern, reduziert Clinton die Agentensicherheit auf vier überprüfbare Dimensionen. Die erste Frage nach den Eingaben zielt auf Datenherkunft und Vertrauenswürdigkeit ab. Ein Agent, der öffentliche Repositories oder externe E-Mails verarbeitet, ist grundsätzlich anders zu bewerten als einer, der nur interne Datenbanken liest.
Die zweite Frage nach den Aktionen unterscheidet zwischen reinem Lesezugriff und schreibendem Zugriff. Ein Agent, der Code lesen darf, ist weniger riskant als einer, der Code ausführen kann. Zudem muss klar sein, in wessen Namen der Agent handelt. Die dritte Frage nach dem Schadensradius bewertet die Konsequenzen eines Fehlverhaltens. Ein Agent mit Zugriff auf Produktivdatenbanken hat einen größeren Schadensradius als einer, der nur Testdaten verarbeitet. Die vierte Frage nach der Beobachtbarkeit stellt sicher, dass alle Agentenaktivitäten protokolliert und von menschlichen Aktionen unterscheidbar sind. Nur so können Incident-Response-Teams effektiv reagieren.
Was Sicherheitsverantwortliche jetzt tun sollten
Clinton empfiehlt Unternehmen, das Vier-Fragen-Rahmenwerk bei den dringendsten Anwendungsfällen anzusetzen. Zudem rät er dazu, Anbieter von KI-Systemen auf strenge Sicherheitsanforderungen zu verpflichten. Dazu gehören Identity-Management über bestehende IdPs und Egress-Allowlisting, um Datenexfiltration zu verhindern. Die Fähigkeit, alle Agentenaktionen zu protokollieren und von menschlichen Aktionen zu unterscheiden, ist für Incident-Response-Teams essenziell.
Unternehmen, die jetzt in Governance investieren, sind laut Clinton besser positioniert, um hochautonome Systeme sicher zu nutzen. Der Leitfaden ist auf dem Anthropic-Blog verfügbar. Ergänzend bietet Anthropic ein Webinar an, das die praktische Umsetzung vertieft.