DeepSeek V4-Flash-0731: Chinas günstiges KI-Modell schlägt das eigene Pro-Modell

von Marcel Buchholz 01. August 2026 3 Min. Lesezeit News

DeepSeek V4-Flash schlägt das eigene Pro-Modell

Chinas KI-Labor DeepSeek hat am 31. Juli 2026 die offizielle Version seines V4-Flash-Modells veröffentlicht und damit einen Paukenschlag gelandet. Das aktualisierte DeepSeek-V4-Flash-0731 übertrifft auf allen agentischen Benchmarks das teurere V4-Pro-Modell und das zu einem Bruchteil der Kosten. Außerdem unterstützt das Modell nun nativ das Responses-API-Format und ist vollständig mit OpenAIs Codex kompatibel.

Was sich geändert hat und was nicht

Die wichtigste Erkenntnis vorab: DeepSeek hat die Architektur nicht angerührt. V4-Flash-0731 basiert weiterhin auf 284 Milliarden Parametern als Mixture-of-Experts-Modell, von denen 13 Milliarden pro Token aktiviert werden. Der Kontext umfasst eine Million Token. Die Leistungssteigerung stammt ausschließlich aus verbessertem Post-Training, nicht aus einem neuen Design.

Zudem bringt das Modell das DSpark-Modul für spekulative Dekodierung mit. Das beschleunigt die Ausgabe um 60 bis 85 Prozent im Vergleich zur Baseline. Die Gewichte stehen unter MIT-Lizenz auf Hugging Face zum Download bereit.

Benchmarks: Flash schlägt Pro

Die Benchmark-Ergebnisse lesen sich wie ein Umsturz von innen. Auf Terminal Bench 2.1 erreicht V4-Flash-0731 einen Score von 82,7, während das teurere V4-Pro-Preview nur auf 72,1 kommt. Damit liegt DeepSeeks günstigstes Modell vor GLM-5.2 mit 81,0 und nur knapp hinter Claude Opus 4.8 bei 85,0.

Auf NL2Repo springt der Wert von 39,4 auf 54,2. Cybergym klettert von 38,7 auf 76,7. DeepSWE, der anspruchsvollste Coding-Benchmark, steigt von mageren 7,3 auf 54,4. Toolathlon-Verified erreicht 70,3 nach vorherigen 49,7. Jeder dieser Werte übertrifft das eigene Pro-Modell.

Allerdings stammen alle Zahlen von DeepSeek selbst, basierend auf einem unveröffentlichten Harness. Unabhängige Validierung steht noch aus.

Preisdruck: 0,14 Dollar pro Million Token

Der wahre Sprengsatz liegt in der Preisgestaltung. DeepSeek verlangt 0,14 Dollar pro Million Eingabe-Token bei Cache-Miss und 0,28 Dollar pro Million Ausgabe-Token. Damit kostet V4-Flash-0731 etwa ein Drittel von V4-Pro bei 0,87 Dollar Ausgabe-Preis. Im Vergleich zu westlichen Anbietern ist der Abstand noch drastischer: GPT-5.6 Sol liegt bei 5 beziehungsweise 30 Dollar, Claude Fable 5 bei 10 beziehungsweise 50 Dollar.

Die Veröffentlichung erfolgt nur einen Tag nach OpenAIs 80-prozentiger Preissenkung für GPT-5.6 Luna auf 0,20 Dollar Eingabe und 1,20 Dollar Ausgabe. DeepSeeks Flash-Modell unterbietet selbst diesen reduzierten Preis deutlich. Das Timing legt nahe, dass DeepSeek entweder bereits auf die OpenAI-Preissenkung reagiert oder gezielt den Nachrichtenzyklus dominieren wollte.

Codex-Kompatibilität als strategischer Hebel

Neben den Benchmarks und dem Preis ist die native Responses-API-Unterstützung die dritte wichtige Neuerung. Die meisten agentischen Werkzeuge und Coding-Tools setzen mittlerweile auf OpenAIs Responses-API-Format. Modelle, die nur Chat Completions sprechen, benötigen eine Adapter-Schicht. DeepSeek V4-Flash spricht das Format nun direkt und veröffentlicht Konfigurationsanleitungen für die Codex-Integration.

Das ist Teil einer breiteren Strategie chinesischer Anbieter: Anstatt den Chatbot-Markt zu erobern, positionieren sie sich als günstigere Backend-Option für bestehende Agent-Frameworks. GLM-5.2 von Zhipu und Kimi K3 von Moonshot verfolgen denselben Ansatz.

Selbsthosting bleibt Herausforderung

Für Selbsthoster gibt es gute und schlechte Nachrichten. Die MIT-Lizenz erlaubt kommerziellen Einsatz ohne Einschränkungen. Allerdings bleiben selbst bei aggressiver Quantisierung die Hardware-Anforderungen hoch. Die 3-Bit-Version benötigt etwa 103 GB Arbeitsspeicher, die 8-Bit-Version 162 GB. Full-Precision-Serving empfiehlt DeepSeek einen 4x-GB300-Knoten. Für kleinere Teams bleibt die API die praktischere Wahl.

Was als Nächstes kommt

DeepSeek hat bereits angekündigt, dass die offizielle V4-Pro-Version in Kürze folgt. Zudem deutet vieles darauf hin, dass ein weiterer Preis- und Leistungsschub vor Jahresende ansteht. Die KI-Branche befindet sich in einem Beschleunigungswettlauf, bei dem chinesische Labore die Preisgestaltung nach unten drücken, während westliche Anbieter auf Fähigkeiten und Sicherheit setzen.

Für Entwicklerinnen und Entwickler, die agentische Workloads betreiben, ändert V4-Flash-0731 die Rechnung grundlegend. Nahezu Frontier-Leistung zu einem Zwanzigstel des Preises von Claude Opus 4.8 macht viele Anwendungen plötzlich wirtschaftlich tragfähig, die vorher prohibitiv teuer waren.

Hinweis: Dieser Artikel wurde mit Unterstützung von Künstlicher Intelligenz erstellt und von einem Menschen redaktionell geprüft.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.