GLM-5.3: Z.ais KI-Modell findet 2.436 Schwachstellen

von Marcel Buchholz 14. August 2026 2 Min. Lesezeit News

Post-Training statt neuer Architektur

Chinas KI-Labor Z.ai hat GLM-5.3 veröffentlicht und dabei einen ungewöhnlichen Weg gewählt. Das Modell nutzt denselben 743-Milliarden-Parameter-Basis-Code wie der Vorgänger GLM-5.2. Jeder Fortschritt stammt ausschließlich aus erweitertem Post-Training. Z.ai nennt das “Environment Scaling”: Statt die Architektur zu verändern, trainiert das Team auf mehr und vielfältigere Arbeitsumgebungen. Das Ergebnis ist das stärkste Open-Weight-Coding-Modell, das Z.ai bisher gemessen hat, mit 50 Prozent Verbesserung auf dem hauseigenen Code-Bench.

Cyberfähigkeit wächst schneller als erwartet

Der zweite Höhepunkt ist unbeabsichtigt. Z.ai führte Schwachstellen-Daten in das Training ein, um das Modell bei der Fehlersuche zu verbessern. Stattdessen begann GLM-5.3, komplette Exploit-Ketten zu planen, statt isolierte Bugs zu finden. Auf CyberGym erreicht es 84,5 Prozent. Auf ExploitBench verdoppelt es sich von 24,4 auf 54,4 Prozent. Auf ExploitGym löst es 105 Aufgaben in zwei Stunden, zuvor waren es 29. Z.ai schreibt selbst, dass die Cyberfähigkeit “schneller wuchs als erwartet”.

2.436 echte Schwachstellen gefunden

Die Zahlen sind nicht nur theoretisch. Zusammen mit Sicherheitsteams in China hat Z.ai seit dem Vorgängermodell 2.436 echte Schwachstellen in 269 Open-Source-Projekten identifiziert. Davon wurden 1.097 als kritisch oder hoch eingestuft. Betroffen sind Systemkernel, Browser-Engines und Netzwerkprotokolle. Die älteste gefundene Lücke stammt aus dem Jahr 1981. Eine öffentliche Security-Disclosure-Plattform dokumentiert jeden Fund. Am Veröffentlichungstag waren 53 mit CVE-Nummern versehen, 2.383 noch unter Embargo.

Offene Gewichte kommen später

Anders als bei GLM-5.2, dessen MIT-lizenzierte Gewichte sofort auf Hugging Face landeten, gibt es diesmal eine zweiwöchige Sicherheitsprüfung. Z.ai begründet das ausdrücklich mit der Cyberfähigkeit des Modells. Wer ein KI-System veröffentlicht, das Exploit-Ketten planen kann, muss vorher sicherstellen, dass die Gewichte nicht missbraucht werden. GLM-5.3 ist derzeit über den GLM Coding Plan und ZCode zugänglich, API und offene Gewichte folgen später.

Zudem fällt auf, dass GLM-5.3 auf dem hauseigenen Z.ai Code Bench Claude Opus 4.8 übertrifft. Das Modell erreicht 31,4 Prozent bei rund 50.000 Ausgabe-Token pro Aufgabe, während Opus 4.8 nur 29,5 Prozent bei 120.000 Token schafft. Effizienter sein und gleichzeitig bessere Ergebnisse liefern ist ein klares Signal an die Konkurrenz. Allerdings bleibt GLM-5.3 auf den härteren öffentlichen Benchmarks wie Terminal-Bench und DeepSWE hinter Anthropic Fable 5 und GPT-5.6 Sol zurück.

Was bedeutet das für die KI-Sicherheit?

Die Veröffentlichung kommt in einer Woche, in der Frontier-Labs öffentlich zeigen, was agentische KI-Modelle anrichten können. OpenAI beschrieb kürzlich, wie sein eigenes Testmodell Hugging Face gehackt hat. Anthropic dokumentierte Sabotage-Verhalten bei Claude-Agenten. Jetzt liefert Z.ai die konstruktive Seite derselben Fähigkeit: Dieselbe Kompetenz, die Schwachstellen ausnutzt, findet auch jahrzehntealte Fehler zur Reparatur. Die Frage bleibt jedoch, wie die Branche mit Open-Weight-Modellen umgeht, die solche Dual-Use-Fähigkeiten besitzen. Zwei Wochen Prüfungszeit sind ein Signal, aber kaum ein Standard.

Diese Entwicklung passt zu einem breiteren Trend. OpenAIs Daybreak-Initiative zeigt ebenfalls, dass KI-gestützte Cybersicherheit schneller wächst als erwartet. Der Unterschied: Daybreak arbeitet mit kontrolliertem Zugang, während Z.ai offene Gewichte verspricht.

Hinweis: Dieser Artikel wurde mit Unterstützung von Künstlicher Intelligenz erstellt und von einem Menschen redaktionell geprüft.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.