Agentjacking: Wie ein gefälschter Fehlerbericht KI-Coding-Agenten übernimmt

von Marcel Buchholz 12. Juni 2026 4 Min. Lesezeit KI-Ethik

Ein falscher Fehlerbericht reicht, um deinen Rechner zu übernehmen

Sicherheitsforscher haben eine neue Angriffsklasse auf KI-Coding-Agenten entdeckt, die ohne Malware, ohne Passwörter und ohne Server-Einbruch auskommt. Der Name: Agentjacking. Der Angriff nutzt eine grundlegende Schwachstelle in der Architektur von Tools, die Millionen Entwickler täglich nutzen. Dabei wird der KI-Agent selbst zur Waffe, weil er fremde Anweisungen nicht von echten unterscheiden kann.

Tenet Security, ein auf autonome KI-Systeme spezialisiertes Sicherheitsunternehmen, offenbarte die Lücke am 12. Juni 2026. Die Attacke funktioniert über Sentry, eines der beliebtesten Tools zur Fehlerüberwachung in der Softwareentwicklung. Ein Angreifer schickt einen gefälschten Fehlerbericht an Sentry, der einen versteckten Befehl enthält. Wenn der Entwickler seinen KI-Agenten bittet, die offenen Fehler zu beheben, führt der Agent den Schadcode aus, weil er den manipulierten Eintrag nicht vom echten unterscheiden kann.

So funktioniert Agentjacking im Detail

Der Angriff beginnt überraschend simpel. Sentry nutzt öffentliche Schlüssel, sogenannte DSNs, die absichtlich im Quellcode von Websites eingebettet sind. Jeder kann über diesen Schlüssel Fehlerberichte an Sentry senden, ohne sich zu authentifizieren. Ein Angreifer postet nun einen manipulierten Fehlerbericht, der im Nachrichtenfeld einen sorgfältig formatierten Markdown-Befehl enthält. Dieser sieht exakt aus wie Sentries eigene Lösungsvorschläge.

KI-Coding-Agenten wie Claude Code, Cursor und Codex greifen über das Model Context Protocol auf Sentry zu. Das MCP ist der Standard, der Agenten den Zugang zu externen Werkzeugen ermöglicht. Das Problem: Der Agent vertraut den Daten aus MCP-Tools blind. Er kann nicht unterscheiden, ob ein Fehlerbericht von einer echten Anwendung stammt oder von einem Angreifer eingespeist wurde. Deshalb führt er den versteckten Befehl aus, sobald der Entwickler sagt: „Behebe die offenen Sentry-Fehler.“

85 Prozent Erfolgsquote und 2.388 gefährdete Organisationen

Die Zahlen sind besorgniserregend. Tenet Security testete den Angriff gegen über 100 reale Ziele und erzielte eine Erfolgsquote von 85 Prozent bei den beliebtesten Coding-Agenten auf dem Markt. Betroffen waren Claude Code, Cursor und Codex gleichermaßen. Zusätzlich identifizierten die Forscher mindestens 2.388 Organisationen mit verwundbaren DSNs, darunter ein Unternehmen mit 250 Milliarden Dollar Marktwert, aber auch einzelne Entwickler und sogar ein Cloud-Sicherheitsanbieter.

Ein einziger injizierter Befehl reicht aus, um Umgebungsvariablen, AWS-Schlüssel, GitHub-Tokens, Git-Zugangsdaten und private Repositories zu stehlen. Von dort ist der Weg zu CI/CD-Pipelines und Cloud-Infrastruktur kurz. Der Angriff umgeht gängige Sicherheitswerkzeuge wie EDR, Firewalls und VPNs, weil in der gesamten Kette nichts Unerlaubtes passiert. Tenet nennt dies die „Authorised Intent Chain“: Der Agent handelt mit voller Berechtigung des Entwicklers.

Warum herkömmliche Sicherheitsmaßnahmen versagen

Die Besonderheit von Agentjacking liegt darin, dass keine herkömmliche Verteidigung greift. EDR-Systeme erkennen keinen Angriff, weil der Code vom Agenten selbst ausgeführt wird. Firewalls blockieren nichts, weil die Kommunikation über legitime Kanäle läuft. Selbst Prompt-Anweisungen helfen nicht: Die Forscher testeten Agenten mit dem Hinweis, keine unvertrauenswürdigen Daten zu akzeptieren. Die Agenten führten den Schadcode dennoch aus.

Sentry wurde am 3. Juni 2026 informiert. Das Unternehmen bestätigte das Problem, lehnte jedoch eine grundlegende Lösung ab und bezeichnete die Lücke als „technisch nicht verteidigbar“. Stattdessen fügte Sentry einen Filter hinzu, der einen spezifischen Payload-String blockiert. Das ist eine symptomatische Behandlung, keine Ursachenbehebung. Die eigentliche Schwachstelle, dass Agenten externe Daten nicht verifizieren können, bleibt bestehen.

Das Problem ist größer als Sentry

Die Forscher betonen, dass Sentry nur das Beispiel ist. Dieselbe Angriffsmethode funktioniert über Support-Tickets, GitHub-Issues und Dokumentationsseiten, überall wo Agenten auf externe Daten zugreifen. Kürzlich konnte ein separates Team einen KI-E-Mail-Agenten dazu bringen, AWS-Schlüssel preiszugeben. Die Grundschwäche ist immer dieselbe: Agenten vertrauen Daten aus Werkzeugen, die sie über MCP angebunden sind.

Diese Erkenntnis trifft auf einen Markt, der rasant wächst. KI-Coding-Agenten sind aus der modernen Softwareentwicklung nicht mehr wegzudenken. Ein Vibe-Coding-Startup erzielte kürzlich 500 Millionen Dollar Jahresumsatz. Doch mit jeder Integration wächst die Angriffsfläche. Ein Agent, der mit deinen Werkzeugen verbunden ist, ist auch ein neuer Weg hinein, wie Tenet warnt.

Was Entwickler jetzt tun können

Der einzige Ort, an dem dieser Angriff gestoppt werden kann, ist der Moment, in dem der Agent entscheidet, ob er handelt. Entwickler sollten daher kritisch prüfen, welche MCP-Integrationen ihre Agenten nutzen und ob diese Werkzeuge unvertrauenswürdige Daten zurückgeben. Zudem empfiehlt es sich, die Ausführungsberechtigungen von Agenten zu begrenzen und sensible Zugangsdaten niemals in Umgebungsvariablen zu speichern, auf die Agenten zugreifen können.

Für Unternehmen lautet die Empfehlung: MCP-Integrationen als neue Angriffsfläche ernst nehmen, Zugriffsrechte für Agenten strikt begrenzen und Audit-Protokolle einführen, die jede Aktion eines Agenten protokollieren. Die Zeit, in der KI-Coding-Agenten als harmlose Hilfswerkzeuge galten, ist vorbei. Agentjacking zeigt, dass jeder Agent gleichzeitig auch ein potenzieller Angreifer sein kann.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.