Nvidia hat die Details seiner Vera-Rubin-Plattform veröffentlicht, und die Zahlen sind beeindruckend. Die neue Chip-Generation verspricht bis zu 10x niedrigere Kosten pro Token im Vergleich zu Blackwell. Damit würde sich die Ökonomie der gesamten KI-Industrie verändern, denn Inferenz-Kosten bestimmen mittlerweile, welche Anwendungen überhaupt wirtschaftlich betrieben werden können.
Vera Rubin: Sechs Chips gleichzeitig
Vera Rubin ist kein einzelner Chip, sondern ein komplett integriertes System aus sechs Komponenten: der Rubin GPU mit 336 Milliarden Transistoren, dem Vera CPU auf Arm-Basis, NVLink 6 Switch, ConnectX-9 SuperNIC, BlueField-4 DPU und Spectrum-6 Ethernet. Nvidia liefert damit den kompletten Rechenzentren-Stack aus einer Hand. Ein NVL72-Rack fasst 72 Rubin GPUs und 36 Vera CPUs, verbunden mit 260 TB/s Skalierungsbandbreite. Die Gesamtleistung liegt bei 50 Petaflops FP4. Die Ultra-Variante für 2027 verdoppelt das auf 100 Petaflops.
Dazu kommt Rubin CPX, eine inferenzspezifische Variante mit 128 GB GDDR7 und 30 Petaflops, die speziell für Millionen-Token-Kontextfenster konzipiert ist. Ein NVL144 CPX-Rack liefert 8 Exaflops, was es zur Inferenz-Factory für eine Welt macht, in der KI-Agenten ununterbrochen laufen.
Warum 10x billigere Tokens die Regeln ändern
Auf Blackwell-Hardware kostet die Inferenz eines grossen Sprachmodells etwa 0,01 bis 0,03 Dollar pro 1.000 Token. Vera Rubin senkt das auf 0,001 bis 0,003 Dollar. Bei diesen Preisen werden Anwendungen wirtschaftlich, die bisher zu teuer waren: autonomer Kundenservice, der 24/7 läuft, kontinuierliche Code-Überprüfung oder Finanzanalysen in Echtzeit. Der Wechsel von einer KI als Abfrage-Tool hin zu einer KI als permanenter Infrastruktur wird genau diese Kostenreduktion vorausgesetzt.
Nvidia argumentiert, dass sich die Kennzahl von Token-Kosten hin zu Intelligence per Dollar verschiebt. Inferenz ist die Betriebseinnahme, Post-Training der Multiplikator. Je fähiger das Modell, desto höher der Wert jedes einzelnen Tokens. Vera Rubin senkt nicht nur die Kosten, sondern ermöglicht auch häufigere Post-Training-Zyklen, ohne die Budgets zu sprengen.
Die ASIC-Bedrohung wächst schneller
Doch Nvidia hat ein Problem. Custom-AI-ASICs wachsen 2026 um 44,6 Prozent, fast dreimal schneller als die 16,1 Prozent der Handels-GPUs. Googles TPU v7 Ironwood, Amazons Trainium 3, Microsofts Maia 200 und Metas MTIA repraesentieren Milliarden an F&E-Aufwaenden mit einem einzigen Ziel: die Abhaengigkeit von Nvidia zu reduzieren. Die fuenf Kunden, die rund 50 Prozent von Nvidias Rechenzentrenumsatz ausmachen, sind genau die fuenf, die eigene Chips bauen.
Nvidias Antwort lautet Full-Stack-Integration. Wer ein NVL72-Rack kauft, kauft Prozessor, Speicher, CPU, Netzwerk und Sicherheitsinfrastruktur als einziges integriertes System. Die Wechselkosten sind nicht der Austausch eines Chips, sondern der Austausch der gesamten Architektur. Dennoch setzen Hyperscaler weiterhin auf Eigenentwicklungen, weil jede Reduktion der Nvidia-Abhaengigkeit Milliarden spart.
Post-Training als zentrale Workload
Nvidia positioniert Vera Rubin explizit für den agentic Post-Training-Workload. Nach dem Pre-Training lernt das Modell nicht mehr aus Rohdaten, sondern durch Reinforcement Learning: es probiert Aufgaben aus, bekommt bewertet und aktualisiert seine Gewichte. Dieser Zyklus läuft kontinuierlich, weil sich die Einsatzumgebung der Agenten staendig aendert. Prime Intellect optimiert bereits seine RL-Sandbox-Infrastruktur für Vera-CPUs und meldet 30 Prozent höheren Durchsatz als auf x86-Architekturen. Perplexity transferiert Gewichte Billionen-Parameter-Modelle in unter zwei Sekunden zwischen Trainings- und Inferenzknoten.
Was Vera Rubin für die Praxis bedeutet
Fuer KI-Unternehmen verändert Vera Rubin die Kalkulation grundlegend. Wenn Token-Kosten um den Faktor 10 sinken, dann werden Agenten-Pipelines wirtschaftlich, die bisher auf dem Reißbrett blieben. Dauerhaft laufende KI-Assistenten, die selbststaendig Code schreiben, testen und deployen, werden von einem Kostenfaktor zu einer Standard-Infrastrukturkomponente. Die NVIDIA Nemotron 3 Ultra, ein 550-Milliarden-Parameter-MoE-Modell, erzielte auf Vera Rubin bereits 71,7 Prozent auf SWE-bench verified, was zeigt, dass die Plattform nicht nur auf dem Papier ueberzeugt.
Die Frage ist nicht mehr, ob Token günstiger werden, sondern wie schnell die Branche sich an die neue Preisstruktur anpasst. Wer heute auf Blackwell-Infrastruktur plant, muss Vera Rubin in seinen Roadmap einbauen. Die ersten Systeme sollen im Herbst 2026 bei acht Cloud-Partnern ausgeliefert werden, darunter AWS, Google Cloud, Microsoft Azure und Oracle Cloud. Die Zeichen stehen auf einen Preis-Krieg, bei dem nicht Nvidia, sondern die Custom-ASICs den Takt vorgeben.