KI-Sicherheitslücke: Cisco zeigt, wie Chatbots nach wenigen Nachfragen klappen

von Marcel Buchholz 28. Mai 2026 3 Min. Lesezeit News, Software & Entwicklung

Wer KI-Modelle auf Sicherheit prüft, schickt meist einen einzigen bösen Prompt und misst, ob das Modell ihn blockt. Eine neue Cisco-Studie zeigt jetzt, dass dieser Ansatz dramatisch falsch liegt. Wenn Angreifer einfach weiterfragen, brechen die Schutzmechanismen fast aller Modelle zusammen. Die Erfolgsquote klettert von 13 auf bis zu 92 Prozent.

Was Cisco herausgefunden hat

Das Sicherheitsforschungsteam von Cisco hat 15 führende KI-Modelle getestet, darunter GPT-5.4 von OpenAI, Claude von Anthropic, Gemini 3 Pro von Google und Grok 4.1 Fast von xAI. Zunächst schickten die Forscher rund 30.000 einzelne Angriffs-Prompts an die Modelle. Danach ließen sie fast 7.000 Mehrfach-Angriffe über mehr als 1.400 Gespräche laufen.

Dabei zeigte sich ein klares Bild. Im Einzeltest blockten die Modelle durchschnittlich 87 Prozent der Angriffe. Im Gesprächsverlauf jedoch stieg die Durchbruchrate massiv an. Googles Gemini 3 Pro beispielsweise kletterte von 18 auf 73 Prozent. Grok 4.1 Fast erreichte sogar 88 Prozent Erfolgsquote. Zudem hielt sich Anthropic-Claude relativ stabil im Bereich von 11 bis 16 Prozent.

Warum Mehrfach-Angriffe so effektiv sind

Die Forscher identifizierten fünf Hauptstrategien, mit denen Angreifer die Schutzmechanismen umgehen. Die erste Methode heißt Informationszerlegung. Dabei wird ein schädlicher Wunsch in harmlose Einzelteile aufgeteilt und über mehrere Runden wieder zusammengesetzt. Gegen Mistral Large-2 erreichte diese Taktik 95 Prozent Erfolgsquote.

Die zweite Strategie nutzt kontextuelle Mehrdeutigkeit. Vage Formulierungen verwirren die Sicherheitsfilter und erzielen bis zu 94,78 Prozent Trefferquote. Die dritte Methode arbeitet mit schrittweiser Eskalation. Ein harmloser Einstieg wird Zug um Zug ausgeweitet, bis das Modell schädliche Inhalte produziert. Die vierte Taktik basiert auf Rollenspielen, bei denen fiktive Kontexte geschaffen werden. Die fünfte Methode ist die Neuformulierung abgelehnter Anfragen, bis eine Variante durchrutscht.

Wichtig ist dabei die Erkenntnis, dass diese Techniken nicht besonders raffiniert sind. Sie ahmen einfach nach, wie Menschen ohnehin kommunizieren. Kontext aufbauen, Nachfragen, umformulieren. Die Modelle sind nicht gegen exotische Hacks anfällig, sondern gegen schlichte Beharrlichkeit.

Offene und geschlossene Modelle gleichermaßen betroffen

Eine frühere Cisco-Studie hatte bereits acht Open-Weight-Modelle untersucht, darunter Qwen3-32B, DeepSeek v3.1, Llama 3.3-70B-Instruct und Mistral Large-2. Auch dort zeigte sich das gleiche Muster. Mistral Large-2 kletterte von knapp 22 Prozent im Einzeltest auf über 92 Prozent im Gespräch. Die Lücke zwischen Einzel- und Mehrfachtest betrug bei Qwen über 73 Punkte.

Die neue Studie zeigt nun, dass das Problem nicht auf Open-Source-Modelle beschränkt ist. Auch proprietäre Modelle von OpenAI, Google und Anthropic klappen unter anhaltendem Druck. Die Schwäche ist eine strukturelle Eigenschaft der aktuellen KI-Generation.

Ein einzelner Schalter ändert alles

Besonders erhellend war ein Detail bei Grok 4.1 Fast. Ohne Reasoning-Modus erreichten Angreifer 88 Prozent Durchbruchrate. Mit eingeschaltetem Reasoning fiel der Wert auf weniger als die Hälfte. Ein einziger Konfigurations-Schalter sorgte also für einen Unterschied von über 40 Prozentpunkten. Weder auf Benchmark-Seiten noch auf Modellkarten war dieser Unterschied dokumentiert.

Für Unternehmen bedeutet das eine klare Botschaft. Die Standard-Sicherheitsbenchmarks spiegeln nicht wider, wie Modelle unter realen Angriffen abschneiden. Wer einen Chatbot oder KI-Agenten einsetzt, muss Mehrfach-Tests durchführen, nicht nur Einzel-Prompt-Prüfungen.

Was Unternehmen jetzt tun sollten

Das Cisco-Team schlägt drei konkrete Schritte vor. Erstens sollten Hersteller bei jedem Modellrelease die Erfolgsquoten nach Angriffsstrategie veröffentlichen. Zweitens sollen Deployment-Entscheidungen auf den Top-drei-Verfahren basieren, mit einer Drei-Punkte-Schwelle für Rückschritte. Drittens fordern die Forscher eine manuelle Überprüfung für jedes Modell, bei dem die Lücke zwischen Einzel- und Mehrfachtest über 15 Punkte beträgt. In der aktuellen Studie würde diese Regel mehr als die Hälfte der getesteten Modelle zur genaueren Prüfung zwingen.

Zudem empfehlen Experten, zusätzliche Guardrails um die Basismodelle zu legen. Diese senken das Risiko, beseitigen es aber nicht. Amy Chang, Leiterin der KI-Bedrohungsforschung bei Cisco, warnt deutlich. Der Blast-Radius eines fehlgeleiteten KI-Agenten könne verheerender sein als ein Softwarefehler. Unternehmen müssten daher ihre Risikotoleranz genauso bewerten wie bei traditioneller Softwareentwicklung.

Auch regulatorisch gewinnt das Thema an Bedeutung. Der EU AI Act fordert in Artikel 15 adversielle Robustheitstests. Die NIST-KI-Risikomanagement-Richtlinien gehen in die gleiche Richtung. Allerdings spezifiziert keines der Frameworks bisher, dass Mehrfach-Tests zwingend erforderlich sind. Genau diese Lücke muss geschlossen werden, damit Sicherheitszertifikate auch in der Praxis Bestand haben.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.