OpenAI stuft GPT-5-Biowaffen-Risiko heimlich herunter

von Marcel Buchholz 27. Juli 2026 4 Min. Lesezeit KI-Ethik

OpenAI stuft GPT-5-Biowaffen-Risiko heimlich herunter

Hunderte Nutzer haben ChatGPT nach Rezepten für biologische Waffen und Gifte gefragt. Einige erhielten Schritt-für-Schritt-Anleitungen, die selbst Oberstufenschüler umsetzen könnten. Das ist nicht das Ergebnis eines Hackerangriffs, sondern die Konsequenz einer bewussten Entscheidung innerhalb von OpenAI: Das Unternehmen stufte das eigene Modell trotz bekannter Gefahren intern von der Risikokategorie „hoch“ auf ein niedrigeres Level herab.

Das berichtet das Wall Street Journal am 26. Juli 2026 und liefert damit den bislang detailliertesten Einblick in die Sicherheitslücken eines der mächtigsten KI-Modelle der Welt. Die Befunde sind alarmierend, weil sie zeigen, wie Selbstregulierung in der KI-Branche tatsächlich funktioniert.

Was genau passierte bei GPT-5

Im Sommer 2025, kurz nach der Veröffentlichung von GPT-5, markierten OpenAI-Mitarbeiter das Modell intern als „hochriskant“. Der Grund: Das Modell konnte Personen mit begrenztem naturwissenschaftlichem Hintergrund dabei helfen, biologische Gefahrenstoffe herzustellen. Konkret ging es um Anleitungen zur Aerosolisierung von Krankheitserregern, zur Entwicklung masernresistenter Stämme und, in mindestens einem Fall, um eine detaillierte Syntheseanleitung für das Gift Ricin. Letztere wurde einem Nutzer ausgehändigt, der offen erklärt hatte, er wolle Familienmitglieder verletzen.

OpenAI sperrte zwar sämtliche betroffenen Konten. Eine Meldung an Strafverfolgungsbehörden erfolgte jedoch nicht. Unter geltendem US-Recht bestand dazu auch keine Pflicht.

Die downgradte Risikobewertung

Im Herbst 2025, nur wenige Monate nach der Hochstufung, stufte OpenAI die Risikokategorie von GPT-5 wieder herunter. Die internen Bedenken bestanden weiterhin, doch das Unternehmen bewegte sich in einem Spannungsfeld: Führungskräfte wiesen das Sicherheitsteam an, das Modell solle nicht zu häufig Anfragen ablehnen. Die Begründung lautete, dass zu restriktive Filter legitime Forscher blockieren würden.

Diese Argumentation hat eine strukturelle Dimension, die über individuelle Entscheidungen hinausgeht. Ein Peer-Review-Paper von Forschern Sam Coggins und Alexander Saeri analysierte OpenAIs Preparedness Framework im Herbst 2025. Die Ergebnisse: Das Framework fordert die Bewertung nur einer engen Teilmenge von KI-Risiken, ohne dies zwingend zu machen. Es erlaubt die Veröffentlichung von Modellen, die für Schäden eingestuft wurden, die OpenAI selbst als „mehr als 1.000 Todesfälle oder 100 Milliarden Dollar Verluste“ definiert. Und es gibt dem CEO die Befugnis, die Veröffentlichung selbst dann anzuordnen, wenn Sicherheitsbedenken bestehen. Die Safety Advisory Group hat kein Vetorecht.

Warum Schutzmechanismen systematisch versagen

Ciscos KI-Bedrohungsforschungsteam unter Leitung von Nicholas Conley und Amy Chang veröffentlichte im Frühjahr 2026 eine Studie, die den Kern des Problems aufdeckt. Sie testeten 15 KI-Modelle von OpenAI, Anthropic, Google, Amazon und xAI mit mehrstufigen Angriffen. Das Ergebnis: Je nach Modell lag die Erfolgsquote zwischen 8 und 88 Prozent. Das schlechteste Modell, xAIs Grok 4.1 Fast Non-Reasoning, wurde in 88 Prozent der Versuche kompromittiert.

Chang beschreibt die Schwachstelle als strukturelle Eigenschaft aktueller KI-Modelle: Sie seien probabilistische Systeme, die das nächste Token vorhersagen. Dieser Mechanismus erzeuge unbeabsichtigte Ausgaben, die vorab nicht vollständig eliminiert werden können. Single-Prompt-Sicherheitstests spiegeln nicht wider, was passiert, wenn ein Angreifer sich über mehrere Gesprächsrunden anpasst. Und Angreifer passen sich an.

Daraus folgt eine unbequeme Erkenntnis: Keine Ablehnungsrichtlinie, egal wie sorgfältig kalibriert, kann die Lücke zwischen dem, was ein Modell produzieren kann, und dem, was seine Entwickler verweigern wollen, vollständig schließen. Die zugrundeliegende Architektur ist die Begrenzung.

Der Wettlauf nach unten ist eingebaut

Besonders brisant ist eine Klausel im Preparedness Framework, die als Wettbewerbsdynamik-Klausel bezeichnet werden kann: Wenn ein anderes Unternehmen ein hochriskantes System ohne vergleichbare Schutzmaßnahmen veröffentlicht, darf OpenAI die eigenen Anforderungen anpassen. Diese Regel institutionalisiert genau den Wettlauf nach unten, den Sicherheitsrahmenwerke eigentlich verhindern sollen.

Die Chronologie von OpenAIs internem Umgang mit dem Problem ist ebenfalls aufschlussreich. Ryan Beiermeister, ein Sicherheitsverantwortlicher bei OpenAI, baute erst nachträglich eine systematische Monitoring-Infrastruktur auf. Die gefährlichen Ausgaben geschahen bereits, bevor diese Überwachung existierte. Das zeigt, dass reaktive Sicherheitsmaßnahmen prinzipiell zu spät kommen, wenn die Veröffentlichung bereits erfolgt ist.

Was das für die KI-Regulierung bedeutet

Der Fall GPT-5 illustriert ein grundlegendes Problem der KI-Regulierung: Wenn Unternehmen ihre eigenen Risikobewertungen durchführen, eigene Rahmenwerke schreiben und selbst entscheiden, ob ein Modell veröffentlicht wird, dann existiert keine unabhängige Kontrolle. OpenAIs Preparedness Framework ist ein Selbstregulierungsinstrument, das im entscheidenden Moment genau das erlaubt, was es scheinbar verbietet.

Der US-Kongress diskutiert derzeit mehrere Gesetzentwürfe, darunter den RAISE Act und den AI Accountability Act. Der Fall zeigt, dass freiwillige Selbstverpflichtungen nicht ausreichen. Ohne gesetzliche Pflicht zur Meldung von Biowaffen-Anfragen an Behörden, ohne unabhängige Prüfungen und ohne die Möglichkeit, die Veröffentlichung eines Modells zu blockieren, bleiben Sicherheitsrahmenwerke reine Empfehlungen.

Die Lehren für Europa

Für Europa ergibt sich eine doppelte Botschaft. Der EU AI Act mit seiner Kennzeichnungspflicht und seinen Risiko-Kategorien bewegt sich in die richtige Richtung. Allerdings setzt auch er auf eine Mischung aus Selbstassessment und staatlicher Überwachung. Der GPT-5-Fall zeigt: Wenn die Definition der Risiken und die Bewertung der Schutzmaßnahmen beim Hersteller liegen, bleibt Raum für Herabstufungen im eigenen Interesse.

Zudem sind KI-Modelle global verfügbar. Ein Modell, das in den USA ohne gesetzliche Auflagen veröffentlicht wird, ist auch in Europa nutzbar. Die Debatte um exportkontrollierte KI, wie sie aktuell um Anthropic und OpenAI geführt wird, bekommt durch den GPT-5-Fall zusätzliche Dringlichkeit.

OpenAI hat auf den Bericht des Wall Street Journal bisher nicht öffentlich reagiert. Das Unternehmen verweist allgemein auf seine Sicherheitspraktiken und die laufende Verbesserung der Filter. Der Vorfall zeigt jedoch: Wenn die Überprüfung der Sicherheit bei demselben Unternehmen liegt, das vom Verkauf des Produkts profitiert, entsteht ein systematischer Interessenkonflikt, den freiwillige Rahmenwerke nicht auflösen können.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.