Qwen3.7-Max: Als KI 35 Stunden lang sich selbst überlassen wurde, passierte etwas Unerwartetes

von Marcel Buchholz 23. Mai 2026 3 Min. Lesezeit News, Software & Entwicklung

Alibabas neuestes KI-Modell hat einen Test bestanden, der die Branche aufhorchen lässt. 35 Stunden lang arbeitete Qwen3.7-Max vollkommen autonom an einem Kernel-Optimierungsproblem. Dabei rief es über 1.100 Werkzeuge auf und führte 432 Testläufe durch. Das Ergebnis ist eine zehnfache Beschleunigung gegenüber der Referenzimplementierung. Zuvor war unklar, ob KI-Agenten solche Dauerläufe ohne menschliches Eingreifen überhaupt durchhalten können.

Was Qwen3.7-Max anders macht

Das Modell aus dem Qwen-Team von Alibaba richtet sich gezielt an Agenten-Aufgaben. Anders als frühere Qwen-Versionen ist Qwen3.7-Max ausschließlich über die Alibaba Cloud Model Studio API verfügbar. Zuletzt hatte Alibaba seine Modelle als Open-Source bereitgestellt. Mit Qwen3.5-397B-A17B endete diese Tradition im Februar 2026. Nun also ein proprietäres Flaggschiff, das sich auf vier Kernszenarien konzentriert: Codierung als Agent von Frontend-Prototypen bis zu komplexen Multi-File-Projekten, Automatisierung von Büroaufgaben mit externen Werkzeugen, lang andauernde autonome Ausführungen und konsistente Leistung über verschiedene Agenten-Frameworks hinweg.

Der 35-Stunden-Test: Kernel-Optimierung ohne Vorwissen

Besonders bemerkenswert ist der Kernel-Benchmark. Das Team setzte Qwen3.7-Max auf einen Cloud-Server mit T-Head-ZW-M890-Beschleunigern, einer eigenen Chip-Plattform aus Alibabas Halbleiter-Sparte. Die Aufgabe lautete: Optimiere einen hardwarebasierten Attention-Kernel für die Open-Source-Inferenz-Software SGLang. Das Modell hatte keinerlei Vorwissen über diese Chip-Architektur. Weder Messdaten noch Dokumentation noch Beispielcode standen zur Verfügung. Lediglich die bestehende Referenzimplementierung in der Programmiersprache Triton diente als Ausgangspunkt.

Über rund 35 Stunden ununterbrochener Arbeit kompilierte das Modell, maß, überarbeitete und fing Kompilierungsfehler eigenständig ab. Insgesamt 1.158 Werkzeugaufrufe und 432 Testläufe absolvierte der Agent. Am Ende stand eine durchschnittliche zehnfache Beschleunigung der Kernel-Ausführung im Vergleich zur Referenz. Konkurrenten kamen auf deutlich weniger: GLM 5.1 erreichte 7,3-fach, Kimi K2.6 erzielte 5-fach und DeepSeek V4 Pro schaffte 3,3-fach. Der Vorgänger Qwen3.6-Plus brachte es auf magere 1,1-fach.

Training mit drei unabhängigen Bausteinen

Technisch setzt Qwen3.7-Max auf einen Trainingsansatz, den das Team erstmals mit Qwen3.5 einführte. Jede Trainingaufgabe zerfällt in drei unabhängige Komponenten: die eigentliche Aufgabe, die Werkzeugumgebung und den Validator, der das Ergebnis prüft. Diese Aufspaltung ermöglicht freies Kombinieren. Dadurch erlernt das Modell Strategien, die nicht nur in einer spezifischen Umgebung funktionieren, sondern universell übertragbar sind. Auf den Benchmarks QwenClawBench und CoWorkBench liefert das Modell nahezu identische Ergebnisse, unabhängig davon, welches Test-Framework es durchläuft.

KI überwacht sich selbst: 1.618 Betrugsversuche aufgeflogen

Zusätzlich nutzte das Team Qwen3.7-Max als Aufpasser während des eigenen Trainings. Über 86 Stunden lang überwachte das Modell Trainingsläufe für Software-Engineering-Aufgaben. Dabei führte es mehr als 10.000 Überprüfungen durch und suchte gezielt nach Tricks, mit denen KI-Modelle ihre Belohnungen manipulieren. Solches Reward Hacking kann beispielsweise darin bestehen, korrekte Antworten direkt von GitHub zu kopieren. Qwen3.7-Max verfasste 13 neue Erkennungsregeln und flaggte 1.618 Fälle. Dieser Selbstüberwachungsansatz zeigt, dass KI-Modelle zunehmend auch die Rolle von Kontrollinstanzen übernehmen können.

Einordnung und Ausblick

Der Benchmark-Showdown offenbart einen Trend. Modelle, die vorzeitig aufgaben, beendeten ihre Sitzungen nach fünf aufeinanderfolgenden Runden ohne Werkzeugaufrufe von selbst. Autonome Ausdauer wird also zur messbaren Eigenschaft. Auf dem standardisierten KernelBench L3 produziert Qwen3.7-Max beschleunigte Kernel in 96 Prozent der Fälle. Anthropic Opus 4.6 liegt leicht davor mit 98 Prozent. Der Abstand schrumpft. Allerdings bleibt Qwen3.7-Max proprietär. Wer offene Gewichte sucht, muss auf ältere Modelle zurückgreifen. Alibabas Strategiewechsel weg von Open-Source hin zu API-exklusiven Angeboten spiegelt einen Branchentrend wider. Immer mehr Anbieter verriegeln ihre leistungsstärksten Modelle hinter bezahlten Schnittstellen. Ob sich das langfristig durchsetzt, wird der Markt entscheiden.

Die Fähigkeit, 35 Stunden ohne menschliches Eingreifen autonom zu arbeiten, markiert einen Wendepunkt für KI-Agenten. Was bisher theoretisch möglich schien, beweist nun ein realer Dauerlauf. Wenn Modelle wie Qwen3.7-Max ihre eigenen Trainingsprozesse überwachen, verschwimmt zudem die Grenze zwischen Werkzeug und Kontrollinstanz. Die Frage lautet künftig nicht mehr, ob KI-Agenten lange Aufgaben bewältigen können, sondern wer deren Ergebnisse noch verifiziert.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.