DeepSeek-V4: Open-Source-KI fordert proprietäre Modelle heraus
DeepSeek hat mit der Version 4 seines Sprachmodells einen neuen Meilenstein gesetzt. Das chinesische Unternehmen bietet ein Open-Weight-Modell an, das mit einem Sechstel der Kosten proprietäre Konkurrenten herausfordert. Die Leistungswerte sind beeindruckend. Doch die Geschichte hinter dem Modell ist jedoch mindestens genauso interessant wie die Benchmarks.
Leistung zu einem Bruchteil der Kosten
DeepSeek-V4 erreicht auf mehreren Benchmarks Ergebnisse, die mit GPT-5.4 und Claude Opus 4.6 vergleichbar sind. Das Besondere: Das Training kostete lediglich einen Bruchteil der Summen, die westliche Labore für ähnliche Modelle aufwenden. Zudem gibt DeepSeek an, die Trainingskosten auf etwa 5,6 Millionen Dollar begrenzt zu haben. Ein Betrag, der im Vergleich zu den hundert Millionen Dollar teuren Trainingsläufen von OpenAI und Anthropic verschwindend gering wirkt.
Allerdings bleibt die Frage, ob diese Zahlen der Realität entsprechen. Westliche Geheimdienste werfen DeepSeek vor, die Kosten durch den Einsatz von destillierten Daten westlicher Modelle künstlich niedrig zu halten. Die Methode der Destillation ermöglicht es nämlich, die Leistung teurer Modelle auf billigere Architekturen zu übertragen, wie auch Reuters berichtet.
Open-Weight als strategisches Instrument
DeepSeek veröffentlicht die Modellgewichte unter einer modifizierten MIT-Lizenz. Das ermöglicht weitgehende kommerzielle Nutzung. Jedoch gibt es Einschränkungen für Plattformen mit mehr als 100 Millionen monatlich aktiven Nutzern. Diese müssen DeepSeek-V4 namentlich in ihrer Benutzeroberfläche erwähnen.
Die Open-Weight-Strategie dient jedoch nicht nur der Community, sondern auch der geopolitischen Positionierung. China nutzt Open-Source-KI als Instrument, um technologische Abhängigkeiten vom Westen zu reduzieren. DeepSeek-V4 ist dabei das prominenteste Beispiel. Auch unser Bericht zu DeepSeeks Marktposition zeigt diese Entwicklung.
Die Architektur hinter DeepSeek-V4
DeepSeek-V4 nutzt eine Mixture-of-Experts-Architektur mit 685 Milliarden Parametern. Davon werden pro Token jedoch nur 37 Milliarden aktiviert. Darüber hinaus unterstützt das Modell eine Kontextlänge von 128.000 Token. In der Code-Erstellung übertrifft es Claude Opus 4.6 auf dem SWE-Bench Verified Benchmark.
Darüber hinaus unterstützt das Modell eine Kontextlänge von 128.000 Token. Daher ermöglicht es die Verarbeitung umfangreicher Dokumente und Codebasen in einem einzigen Durchlauf. Entwickler können ganze Projekte als Kontext bereitstellen, ohne auf Teilausschnitte beschränkt zu sein.