Das Future of Life Institute hat seinen Sommer-2026-Sicherheitsindex veröffentlicht. Das Ergebnis ist erschütternd: Keines der neun bewerteten KI-Labore erreicht auch nur die Note B. Anthropic führt mit C+, aber selbst der Spitzenreiter zeigt Schwächen. Noch beunruhigender ist ein Trend: Die führenden Labore schwächen ihre eigenen Pausenversprechen.
Die Noten im Überblick: Von C+ bis F
Der FLI-Sicherheitsindex bewertet neun KI-Unternehmen anhand von 37 Indikatoren in sechs Domänen. Eine unabhängige Expertenkommission aus sieben Gutachtern vergab die Noten. Anthropic landet mit 2,66 von 4,0 Punkten auf Platz eins, was einer C+ entspricht. OpenAI folgt mit 2,28 Punkten und der Note C. Google DeepMind erreicht ebenfalls C mit 2,01 Punkten. Meta verbessert sich auf D+ mit 1,32 Punkten.
Auf den hinteren Plätzen rangieren Z.ai und Alibaba Cloud mit D-. Am Ende der Skala stehen xAI, DeepSeek und Mistral mit der Note F. Diese drei Labore aus den USA, China und Europa fallen komplett durch. Allerdings gibt es einen deutlichen Bruch zwischen den oberen vier und dem Rest. Der Abstand von Google DeepMind zu Meta beträgt 0,7 Punkte, während die durchgefallenen Labore nur zwischen 0,33 und 0,65 Punkten erreichen.
Existenzielle Sicherheit ist die schwächste Domäne
In der Kategorie existenzielle Sicherheit erreicht kein einziges Labor mehr als C-. Das ist die schlechteste Bewertung aller sechs Domänen. Dabei geht es um fundamentale Fragen: Was passiert, wenn KI-Systeme gefährliche Fähigkeiten entwickeln? Wie werden Modelle sicherheitsgetestet, bevor sie veröffentlicht werden? Die Antwort der Experten lautet: Nicht gut genug.
Gerade in einer Zeit, in der Frontier-Modelle autonom Cyberangriffe durchführen können, wie die jüngsten Vorfälle bei Anthropic und OpenAI zeigen, ist dieser Befund alarmierend. Die Modelle werden leistungsfähiger, aber die Sicherheitsvorkehrungen hinken hinterher.
Der besorgniserregendste Befund: Versprechen werden aufgeweicht
Die wichtigste Erkenntnis des Berichts betrifft nicht die Noten selbst. Vielmehr ist es die Tatsache, dass die vier führenden Labore ihre eigenen Pausenversprechen geschwächt oder aufgehoben haben. Anthropic, OpenAI, Google DeepMind und Meta hatten sich früher ausdrücklich verpflichtet, die Entwicklung zu pausieren, wenn gefährliche Fähigkeitsschwellen erreicht werden. Jetzt nutzen manche davon konkurrenzbedingte Formulierungen. Sie versprechen nur noch zu pausieren, wenn die Konkurrenz es auch tut.
Die Gutachter nennen dies treffend das Verschieben der Torpfosten. Diese Entwicklung fällt genau in die Woche, in der OpenAI sein Astra-Modell pausierte, weil interne Tests die kritische Cybersicherheitsschwelle erreichten. Ein Labor hält sich also an seine eigenen Regeln, während die Branche im Gleichschritt ihre Regeln abschwächt.
Was die Noten für Unternehmen bedeuten
Der FLI-Index bewertet institutionelles Verhalten, nicht Produkteinsatz. Eine C+-Note bedeutet nicht, dass Claude im Alltag sicherer ist als GPT-5.6. Sie bedeutet, dass Anthropics Governance, Offenlegung und Selbstverpflichtungen besser dokumentiert sind als bei der Konkurrenz.
Für Unternehmen in regulierten Branchen liefert der Index das klarste Drittsignal für Beschaffungsentscheidungen. Allerdings rät die Analyse von Digital Applied, die Noten als einen Input unter mehreren zu nutzen. Ergänzend sind eigene Audits und Vertragsgestaltungen erforderlich. Die Note allein reicht nicht aus, um die Sicherheit eines konkreten Deployments zu beurteilen.
Die Lücke zwischen Sicherheit und Kommerz
Dass ausgerechnet die existenzielle Sicherheit am schwächsten abschneidet, verdeutlicht ein strukturelles Problem. Die KI-Branche investiert 1,5 Billionen Dollar in Infrastruktur, wie Sequoia-Partner David Cahn berechnet hat. Um diese Investitionen zu rechtfertigen, bräuchte die Branche rund 3 Billionen Dollar Umsatz. Anthropic und OpenAI zusammen kommen auf etwa 80 Milliarden Dollar Jahresumsatz. Die Lücke beträgt damit 2,9 Billionen Dollar.
Unter diesem Rechtfertigungsdruck schwächen die Labore ihre Sicherheitsversprechen. Der kommerzielle Erfolg steht im Widerspruch zu den Selbstverpflichtungen. Wenn ein Unternehmen Milliarden verbrennt, um wettbewerbsfähig zu bleiben, hat ein Pausenversprechen keinen Platz mehr im Geschäftsmodell.
Fazit: Die Sicherheitslücke wächst
Der FLI-Sicherheitsindex zeigt ein klares Bild. Die KI-Industrie entwickelt sich technologisch rasant weiter, aber die Sicherheitsgovernance bleibt zurück. Kein Labor erreicht auch nur ein befriedigend. Die führenden Akteure weichen ihre eigenen Standards auf, während durchgefallene Labore wie xAI und DeepSeek gar keine glaubwürdigen Rahmenwerke vorweisen können.
Die Kluft zwischen dem, was die Technologie kann, und dem, was an Sicherheitsvorkehrungen existiert, wird größer statt kleiner. Die Astra-Pause bei OpenAI zeigt, dass die Frameworks funktionieren können. Der FLI-Bericht zeigt aber auch, dass die Bereitschaft, sich an diese Frameworks zu halten, schwindet. Das ist die eigentliche Warnung dieses Index.
Hinweis: Dieser Artikel wurde mit Unterstützung von Künstlicher Intelligenz erstellt und von einem Menschen redaktionell geprüft.