OpenAI hat eine KI entwickelt, deren einzige Aufgabe darin besteht, andere KI-Systeme anzugreifen. Das Modell namens GPT-Red knackt in 84 Prozent der Testfälle fremde Systeme und übertrifft damit menschliche Sicherheitsexperten deutlich. Die daraus resultierenden Erkenntnisse machen GPT-5.6 laut OpenAI sechsmal robuster gegen Prompt-Injection-Angriffe als alle Vorgängermodelle.
GPT-Red ist kein neues Chatbot-Modell für Endnutzer. Vielmehr handelt es sich um einen internen KI-Angreifer, der über ein Jahr lang darauf trainiert wurde, Schwachstellen in OpenAIs eigenen Modellen aufzudecken. Die Idee klingt paradox: Man baut einen Hacker, damit die eigenen Systeme sicherer werden. Doch die Zahlen sprechen für sich. Menschliche Red-Teamer erreichten im selben Benchmark nur 13 Prozent Erfolgsquote, während GPT-Red 84 Prozent knackte.
So funktioniert das Selbstspiel-Training
GPT-Red nutzt ein Trainingsverfahren namens Self-Play Reinforcement Learning. Dabei tritt das Modell gegen eine Gruppe von Verteidiger-KIs gleichzeitig an. Der Angreifer erhält Belohnungen für erfolgreiche Angriffe, die Verteidiger für das Abwehren. Sobald die Verteidiger besser werden, muss GPT-Red neue und komplexere Angriffsstrategien entwickeln. Dieser Kreislauf produziert mit jeder Generation gleichzeitig einen stärkeren Angreifer und einen robusteren Verteidiger.
OpenAI investierte dafür Rechenkapazität auf dem Niveau seiner größten Post-Training-Läufe für Frontier-Modelle. Das Unternehmen bezeichnet den Rechenaufwand als beispiellos für reine Sicherheitsarbeit. Forscher Dylan Hunn beschrieb den Unterschied zu menschlichen Testern so: GPT-Red sei extrem beharrlich dabei, eine gefundene Schwachstelle systematisch auszuschöpfen und alle möglichen Varianten durchzutesten.
Fake Chain-of-Thought: Eine völlig neue Angriffsklasse
Der bemerkenswerteste Fund von GPT-Red ist eine Angriffsklasse, die kein menschlicher Tester je entdeckt hatte. Die sogenannte Fake Chain-of-Thought-Attacke zielt auf das Zwischendenken von Reasoning-Modellen ab. Reasoning-Modelle schreiben vor der endgültigen Antwort ihre Gedankenschritte auf. GPT-Red fand heraus, dass sich falsche Einträge in dieses Arbeitsgedächtnis einschleusen lassen. Das Modell glaubt dann, es habe eine Aussage bereits verifiziert, obwohl diese von einem Angreifer platziert wurde.
OpenAI-Forscher Chris Choquette-Choo erklärte das Prinzip mit einem einfachen Vergleich: Es sei, als würde jemand behaupten, dass 1+1=3 sei und man dies bereits bestätigt habe. Das Modell akzeptiere die falsche Prämisse einfach und gebe 3 als Ergebnis aus. Diese Art von Angriff ist besonders gefährlich, weil Reasoning-Modelle zunehmend in produktiven Systemen eingesetzt werden.
Der Vending-Machine-Test: Wenn KI echte Systeme hackt
OpenAI testete GPT-Red nicht nur in Simulationen, sondern auch gegen ein echtes System. Die KI griff Vendy an, einen KI-gesteuerten Verkaufsautomaten im OpenAI-Büro, der von Andon Labs entwickelt wurde. GPT-Red schaffte es, alle drei Schadziele zu erreichen: Es senkte den Preis eines teuren Artikels auf 50 Cent, bestellte einen neuen Artikel für über 100 Dollar und bot ihn für 50 Cent an, und stornierte die Bestellung eines anderen Kunden.
Der Angriff lief in zwei Phasen ab. Zunächst testete GPT-Red seine Angriffe in einer Simulation. Anschließend übertrug es die erfolgreichen Strategien auf das echte System. OpenAI gab an, die Schwachstellen offengelegt zu haben und neue Schutzmaßnahmen zu testen. Der Vorfall zeigt, dass KI-gesteuerte Systeme im echten Einsatz deutlich anfälliger sind als viele Entwickler glauben.
GPT-5.6 profitiert massiv vom Super-Hacker
Die Ergebnisse wirken sich direkt auf GPT-5.6 aus. OpenAI nutzte die von GPT-Red generierten Angriffsdaten beim Training von GPT-5.6 Sol. Das Ergebnis: Auf dem schwersten Benchmark für direkte Prompt-Injection sinkt die Fehlerrate um das Sechsfache im Vergleich zum besten Produktionsmodell von vor vier Monaten. Gegenüber älteren GPT-5-Modellen fielen weniger als 23 Prozent von GPT-Reds stärksten Angriffen durch.
Das ist ein signifikanter Fortschritt, aber keine endgültige Lösung. Prompt-Injection bleibt eine grundlegende Schwachstelle von Sprachmodellen, weil diese Systeme Instruktionen und Inhalte nicht trennen können. Sämtliche Anweisungen, egal ob vom Entwickler oder aus einer fremden Webseite, werden als ein einziger Token-Strom verarbeitet.
Warum GPT-Red unter Verschluss bleibt
OpenAI wird GPT-Red nicht veröffentlichen. Das Modell bleibt strikt intern, damit seine Angriffsfähigkeiten nicht in die Hände echter Angreifer gelangen. Forscher Choquette-Choo betonte, dass es nicht trivial sei, einen Super-Angreifer mit diesem Ansatz zu trainieren. Dennoch räumen andere Experten ein, dass das Prinzip des automatisierten Red-Teaming von anderen Laboren reproduzierbar ist.
Jessica Ji, KI-Sicherheitsanalysin am Georgetown CSET, warnte zudem, dass GPT-Red Schwächen habe. Es sei schlecht bei langwierigen, mehrstufigen Angriffen und beim Verstecken von Instruktionen in Bildern. Menschliche Expertise bleibe unverzichtbar. OpenAI selbst betont, dass GPT-Red menschliche Red-Teamer nicht ersetzen soll, sondern ergänzt. Das Unternehmen nutzt weiterhin externe und interne menschliche Tester sowie Echtzeit-Monitoring.
Was das für die KI-Sicherheit bedeutet
Die Veröffentlichung von GPT-Red markiert einen Wendepunkt in der KI-Sicherheit. Bisherige Red-Teaming-Methoden waren langsam, teuer und unvollständig. CrowdStrike dokumentierte in seinem Global Threat Report 2026, dass Angreifer im Jahr 2025 Prompt-Injection gegen über 90 Organisationen einsetzten. Eine Zero-Click-Schwachstelle in Microsoft 365 Copilot zeigte, dass ein einziger manipulierter E-Mail-Inhalt ausreichte, um einem KI-Agenten den Zugriff auf interne Dateien und deren Übertragung an einen externen Server zu entlocken.
Die Idee, KI für die Sicherheit von KI einzusetzen, ist nicht neu. Anthropic trainierte bereits Modelle gegen eigene Schwachstellen. Doch OpenAI geht mit der Skalierung von GPT-Red einen Schritt weiter. Das Unternehmen spricht von einem Sicherheits-Flywheel: Die heutigen Modelle stärken die Sicherheit der morgigen. Wenn dieser Ansatz funktioniert, könnte die KI-Sicherheit erstmals mit der KI-Fähigkeit mithalten. Die Frage bleibt jedoch, ob Angreifer denselben Ansatz nutzen werden, um noch effektivere Angriffe zu entwickeln.