MiniMax M3: Erstes Open-Source-Modell mit 1 Million Tokens

von Marcel Buchholz 01. Juni 2026 3 Min. Lesezeit Software & Entwicklung

Das chinesische Unternehmen MiniMax hat sein neues Flaggschiff-Modell M3 veröffentlicht. Damit zieht ein offenes Modell erstmals mit den geschlossenen Spitzenreitern gleich. Der Clou: eine Million Tokens Kontextfenster, frontier-Level bei Coding und native Multimodalität in einem einzigen Modell. Diese Kombination war bisher proprietären Systemen vorbehalten.

MSA-Aufmerksamkeit macht den Unterschied

Der technische Durchbruch beruht auf einer neuen Aufmerksamkeitsvariante namens MiniMax Sparse Attention, kurz MSA. Klassische Aufmerksamkeitsmechanismen vergleichen jedes Token mit jedem anderen. Daher wachsen die Rechenkosten quadratisch zur Eingabelänge. MSA umgeht dieses Problem, indem es nur ausgewählte Segmente berechnet statt aller Token-Paare. Der zwischengespeicherte Kontext wird in Blöcke aufgeteilt. Ein vorgelagerter Filterschritt entscheidet, welche Blöcke tatsächlich relevant sind. Nur diese gehen in die vollständige Berechnung ein.

Zudem ändert MSA die GPU-Berechnungslogik. Statt für jede Anfrage einzeln passende Blöcke aus dem Speicher zu laden, werden Blöcke sequenziell verarbeitet. Alle Anfragen, die denselben Block brauchen, werden gebündelt. Jeder Block muss nur einmal gelesen werden, und zwar in einem zusammenhängenden Zugriffsmuster statt verstreuter Sprünge. Dadurch läuft die Implementierung mehr als viermal schneller als konkurrierende Open-Source-Alternativen.

Ergebnisse auf Proprietär-Niveau

Auf dem Software-Entwicklungs-Benchmark SWE-Bench Pro erreicht M3 59 Prozent. Das platziert das Modell vor GPT-5.5 und Gemini 3.1 Pro, jedoch knapp hinter Opus 4.7. Bei autonomen Websuchen legt M3 sogar mit 83,5 Punkten auf BrowseComp vor, während Opus 4.7 auf 79,3 Punkte kommt. Anthropic hat zwischenzeitlich Opus 4.8 veröffentlicht, das etwas stärkere Werte liefert.

Auf Terminalaufgaben und Werkzeugnutzung landet M3 ebenfalls im proprietären Bereich. Um echte Entwickler-Workflows besser abzubilden, hat MiniMax eine Simulator-Umgebung gebaut. Sie ahmt typische Verhaltensmuster nach: Anforderungen verfeinern, Lösungsansätze diskutieren, auf Zwischenergebnisse reagieren und Aufgaben über mehrere Kontexte hinweg bearbeiten. Dadurch trainiert das Modell mit Mehr-Runden-Zusammenarbeit statt nur mit einzelnen Prompts.

Stundenlange Autonomie in der Praxis

MiniMax beschreibt drei interne Experimente, die zeigen, wie die Fähigkeiten zusammenwirken. Im ersten Test sollte M3 selbstständig ein Paper über LLM-Feinabstimmung reproduzieren. Das Modell arbeitete fast zwölf Stunden ohne Eingriff, erstellte 18 Commits und 23 Abbildungen und bestätigte die zentralen Ergebnisse der Vorlage.

Im zweiten Experiment optimierte M3 einen Rechenkern für Matrixmultiplikationen auf Nvidia-Hopper-GPUs. Erfahrene Teams brauchen dafür normalerweise ein bis zwei Wochen. M3 erhielt nur eine Aufgabenbeschreibung, ein Benchmark-Skript und ein nicht funktionstüchtiges Code-Gerüst. Nach etwa 24 Stunden steigerte das Modell die Hardware-Auslastung von 7,6 auf 71,3 Prozent. Andere getestete Modelle gaben nach wenigen Dutzend Versuchen auf, während M3 mehrere Plateaus überwand und seine beste Lösung erst beim 145. Versuch erreichte.

Im dritten Test, PostTrainBench, trainierte M3 vier Basismodelle selbstständig, synthetisierte Daten und evaluierte Ergebnisse. Es landete knapp hinter Opus 4.7 und GPT-5.5, jedoch deutlich vor den restlichen Modellen.

Preise und Verfügbarkeit

M3 ist über die MiniMax-API verfügbar. Anfragen bis 512.000 Eingabe-Token kosten den Standardtarif, längere Kontexte werden teurer berechnet. Ein Denkmodus lässt sich pro Anfrage ein- oder ausschalten. Der Token-Plan beginnt bei 20 Dollar monatlich für rund 1,7 Milliarden Tokens und reicht bis 120 Dollar für 9,8 Milliarden Tokens. Modellgewichte und ein technischer Bericht werden innerhalb der nächsten zehn Tage auf Hugging Face und GitHub veröffentlicht.

Darüber hinaus hat MiniMax seine hauseigene Agenten-App MiniMax Code aktualisiert, die ebenfalls Open-Source gehen soll. Etwa drei Monate zuvor hatte das Unternehmen M2.7 veröffentlicht, ein Modell, das laut MiniMax aktiv an seiner eigenen Entwicklung beteiligt war und 30 bis 50 Prozent der Arbeitsabläufe im internen RL-Team übernahm.

Die Botschaft ist klar: Offene Modelle holen auf. Mit M3 beweist MiniMax, dass der Abstand zu proprietären Systemen immer kleiner wird. Wenn ein freies Modell bei Coding-Aufgaben vor GPT-5.5 liegt und ein Millionen-Token-Kontext beherrscht, verschiebt sich die Diskussion um Open versus Closed deutlich.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.