Tencent Hy3: Chinas offenes KI-Modell schlägt GPT-5.5 bei Agenten-Aufgaben

von Marcel Buchholz 07. Juli 2026 3 Min. Lesezeit KI & Wirtschaft

Tencent hat die Vollversion von Hy3 veröffentlicht, einem 295-Milliarden-Parameter-Modell unter Apache-2.0-Lizenz. Das Besondere: Es schlägt geschlossene Konkurrenten bei Agenten-Benchmarks und läuft auf einem einzigen Server.

Was ist Hy3 und warum ist es anders?

Hy3 ist ein Mixture-of-Experts-Modell mit 295 Milliarden Parametern. Davon aktiviert es nur 21 Milliarden pro Token. Zusätzlich kommt ein 3,8-Milliarden-Parameter Multi-Token-Prediction-Layer für schnellere Generierung zum Einsatz. Das Kontextfenster beträgt 256.000 Token.

Die Architektur verteilt 192 Experten auf 64 Schichten. Pro Vorwärtsdurchlauf wählt das Modell die acht besten Experten aus. Dadurch erreicht Hy3 frontier-nahe Leistung bei einem Bruchteil der Rechenkosten. Wer das Modell selbst hosten will, braucht nur einen einzigen 8-GPU-Knoten mit H200- oder H20-Karten.

Außerdem entschied sich Tencent bewusst gegen ein noch größeres Modell. Jenseits einer bestimmten Skalierung steigen Latenz und Infrastrukturkosten schneller als die Leistung. Hy3 positioniert sich als pragmatische Alternative für Unternehmen, die Frontier-KI selbst betreiben wollen.

Apache 2.0: Die Lizenz, die alles verändert

Die Vorgängerversion von Hy3 kam im April noch unter einer restriktiveren Lizenz. Diese schloss die Europäische Union, Großbritannien und Südkorea aus. Für Unternehmen in diesen Regionen war eine Nutzung rechtlich unmöglich.

Mit Apache 2.0 ändert sich das grundlegend. Jeder kann die Gewichte herunterladen, anpassen und produktiv einsetzen. Das gilt auch für kommerzielle Anwendungen. Die Open-Source-Community reagierte sofort: Forscher bezeichneten die Lizenzänderung als eigentliche Schlagzeile der Veröffentlichung.

Tencent bietet Hy3 zudem zwei Wochen lang kostenlos über OpenRouter an. Das senkt die Einstiegshürde auf null.

Benchmarks: Wo Hy3 glänzt und wo es abfällt

Die Benchmark-Ergebnisse zeigen ein klares Bild. Auf FrontierScience-Olympiad erreicht Hy3 74,8 Punkte und übertrifft damit GPT-5.5 mit 73,8 und GLM-5.2 mit 72,5. BrowseComp steht bei 84,2 und damit auf Augenhöhe mit Claude Opus 4.8 und GPT-5.5.

Bei Agenten-Aufgaben dominiert Hy3 die offene Konkurrenz. DeepSearchQA erreicht 91,0 Punkte. Auf MCP-Atlas, einem Benchmark für Tool-Orchestrierung, kommt es auf 79,1. ClawEval und AA-LCR bestätigen das Bild: Hy3 ist das stärkste offene Modell für Such- und Werkzeug-Aufgaben.

Doch bei Coding sieht es anders aus. GLM-5.2 führt SWE-bench Verified mit 84,2 zu 78,0. Terminal Bench 2.1 steht bei 81 zu 71,7. DeepSWE liegt bei 46,2 zu 28,0. Hier zeigt sich: Das fast dreimal so große GLM-5.2 hat bei reinen Programmieraufgaben die Nase vorn.

Zuverlässigkeit statt Benchmarks: Tencents wahre Botschaft

Interessanter als die Benchmark-Zahlen ist, was Tencent in den Vordergrund stellt. Die Halluzinationsrate sank von 12,5 auf 5,4 Prozent. Fehler bei gesundem Menschenverstand fielen von 25,4 auf 12,7 Prozent. Multi-Turn-Fehler gingen von 17,4 auf 7,9 Prozent zurück.

Diese Zahlen zielen auf Unternehmen ab, die von blendenden Demos enttäuscht wurden. Ein Modell, das zuverlässig funktioniert, ist mehr wert als eines, das in Laboren brilliert und in der Praxis erfindet. Tencent betont außerdem die Konsistenz über verschiedene Agent-Frameworks hinweg. Egal ob Claude Code, Cline oder KiloCode: Die Leistung schwankt nur um wenige Punkte.

Die Wirtschaftlichkeitsrechnung

Hy3 benötigt im FP8-Format unter 300 GB Speicher. GLM-5.2 braucht dafür etwa 744 GB. Das halbiert nicht nur die Hardware-Kosten, sondern auch den Stromverbrauch und die Latenz pro Anfrage. Für Unternehmen, die KI selbst betreiben wollen, ist das ein entscheidender Unterschied.

Tencents Nachricht lautet: Man muss nicht das größte Modell haben, um frontier-nah zu sein. Man braucht das Modell, das am besten zur eigenen Infrastruktur und den eigenen Anwendungsfällen passt. Hy3 zielt auf Agenten-Workloads ab, bei denen Such-, Tool- und Orchestrierungsfähigkeiten wichtiger sind als reine Codingleistung.

Was bedeutet das für den KI-Markt?

Die Veröffentlichung von Hy3 unter Apache 2.0 beschleunigt einen Trend. Immer mehr leistungsfähige Modelle werden offen verfügbar. Unternehmen müssen nicht mehr zwingend auf geschlossene APIs angewiesen sein. Die Frage verschiebt sich von “Können offene Modelle mithalten?” zu “Welches offene Modell passt zu welchem Anwendungsfall?”

Zudem zeigt Tencents Entscheidung, die EU-Lizenzbeschränkung aufzuheben, dass der europäische Markt ernst genommen wird. Regulierung und Datenschutz sind keine Hindernisse mehr, sondern Teil der Produktstrategie.

Der Wettbewerb zwischen geschlossenen und offenen Modellen wird 2026 nicht enden. Aber Hy3 macht deutlich, dass die Lücke bei Agenten-Aufgaben praktisch geschlossen ist.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.