Verschlüsseltes Denken geknackt: KI-Reasoning-Schwachstelle trifft alle Anbieter
Eine neue Studie offenbart eine fundamentale Schwachstelle, die alle großen KI-Anbieter betrifft. Anthropic, OpenAI und Google verschlüsseln die Gedankengänge ihrer Modelle, bevor sie an Nutzer gesendet werden. Ein Forscherteam zeigt nun: Diese Verschlüsselung lässt sich mit einem erstaunlich einfachen Trick umgehen. Die Konsequenzen reichen von Datenlecks bis zur Umgehung von Sicherheitsfiltern.
Was sind verschlüsselte Reasoning-Blöcke?
Wenn ChatGPT, Claude oder Gemini komplexe Fragen beantworten, durchlaufen sie einen internen Denkprozess, das sogenannte Chain-of-Thought. Statt diesen Prozess offen zu zeigen, verpacken die Anbieter die Zwischenschritte in verschlüsselte Datenblöcke. Nutzer sehen lediglich eine zusammenfassende Antwort, nicht die echten Überlegungen. Die Verschlüsselung sollte geistiges Eigentum schützen und gleichzeitig verhindern, dass sensible Informationen nach außen dringen. Zudem erschwert sie die sogenannte Destillation, bei der Konkurrenten das Wissen eines Modells absaugen.
Der Trick: Schwächere Modelle als Schlüssel
Die Forscher um Alexander Panfilov entdeckten jedoch eine architektonische Schwachstelle. Die verschlüsselten Blöcke sind innerhalb eines Anbieter-Ökosystems vollständig austauschbar. Sie funktionieren sessionsübergreifend, kontenübergreifend und sogar modellübergreifend. Das bedeutet konkret: Wer einen verschlüsselten Denkprozess eines starken Modells wie GPT-5.6 Sol in ein schwächeres Modell derselben Familie einspeist, bekommt den Inhalt unverschlüsselt zurück. Das stärkere Modell muss dabei nicht einmal direkt angegriffen werden. Die Forscher demonstrierten den Angriff erfolgreich bei Anthropic, OpenAI und Google.
Darüber hinaus scannten die Forscher 315.320 verschlüsselte Reasoning-Blöcke aus öffentlichen Repositories. Darin fanden sie 367 personenbezogene Daten und 182 Zugangsdaten. Entwickler hatten diese Blöcke unwissentlich mitveröffentlicht, weil sie keinen Zugriff auf den Inhalt hatten.
Vier Angriffsvektoren auf einen Streich
Die Schwachstelle eröffnet gleich vier Angriffswege. Erstens umgeht sie Anti-Destillation-Mechanismen und ermöglicht den Diebstahl des proprietären Denkprozesses einer KI. Zweitens erlaubt sie großflächige Extraktion privater Nutzerdaten aus scheinbar harmlosen Datenpaketen. Drittens werden gefährliche Inhalte sichtbar, die das Modell in seiner sichtbaren Antwort korrekt abgelehnt hatte. Viertens, und das ist besonders heimtückisch, können Angreifer unsichtbare Prompt-Injections direkt in verschlüsselte Blöcke einbetten und damit öffentliche Agenten-Systeme vergiften, ohne dass Nutzer etwas merken.
Ein globales Verschlüsselungsproblem
Bereits im Mai 2026 hatte der Kryptograf Matthew Green von der Johns Hopkins University die Hypothese aufgestellt, dass die Anbieter einen einzigen globalen Schlüssel verwenden. Seither bestätigten unabhängige Forscher diese Annahme. Im Juni 2026 zeigte Will Smidlein, dass verschlüsselte Blöcke kontenübergreifend zwischen verschiedenen Nutzern ausgetauscht werden können. Die neue Studie liefert nun den umfassenden Beweis: Alle drei großen Anbieter verwenden anscheinend einen einzigen Schlüssel für ihr gesamtes Ökosystem.
Was bedeutet das für Nutzer und Entwickler?
Für Teams, die Prompt-Logs veröffentlichen oder Agenten betreiben, lautet die klare Empfehlung: Verschlüsselte Reasoning-Blöcke als lesbar behandeln, bis der Anbieter das Gegenteil bestätigt. Alles, was bereits in öffentlichen Repositories gelandet ist, sollte umgehend auditiert werden. Die Autoren haben Responsible Disclosure betrieben und konkrete kryptografische Lösungen vorgeschlagen. Ob und wann Patches folgen, steht jedoch noch offen. Bis dahin bleibt die sogenannte geschützte Privatsphäre der KI-Gedankengänge eine Illusion. Auch der jüngst gezeigte KI-Sicherheitsindex hatte bereits gezeigt, dass kein Labor mehr als C+ erreicht. Die neue Schwachstelle unterstreicht diese Bewertung zusätzlich, ähnlich wie der Claude Code Auto-Modus, der ebenfalls Fragen zur Sicherheit aufwirft.
Hinweis: Dieser Artikel wurde mit Unterstützung von Künstlicher Intelligenz erstellt und von einem Menschen redaktionell geprüft.