Google arbeitet an einem Server-Chip, der Googles KI-Modell Gemini direkt in die Hardware einbrennt. Das Projekt mit dem internen Namen „Frozen v2“ verspricht eine bis zu zehnfache Effizienzsteigerung gegenüber aktuellen Tensor Processing Units und könnte die Art, wie KI-Infrastruktur funktioniert, grundlegend verändern.
Was ist Frozen v2 und warum ist es anders?
Bisherige KI-Chips sind Universalrechner. Sie laden ein Modell in den Speicher und führen es aus. Diese Flexibilität kostet jedoch Strom und Zeit. Frozen v2 geht einen radikal anderen Weg: Die Architektur von Gemini wird direkt in den Schaltkreis geätzt. Das bedeutet, der Chip ist kein flexibler Taschenrechner mehr, sondern ein spezialisiertes Gerät, das auf genau eine Modellstruktur zugeschnitten ist.
Der Unterschied ist entscheidend. Aktuelle Chips müssen bei jeder Anfrage neu berechnen, welche Recheneinheiten aktiviert werden und wie Daten zwischen Tausenden parallelen Kernen fließen. Frozen v2 hat diese Entscheidungen bereits in Silizium gegossen. Mehrere Rechenschritte, die ein Standard-Chip als getrennte Speicherzugriffe ausführt, verschmelzen zu einem einzigen Hardware-Befehl.
Warum Google jetzt handelt
Das Projekt ist keine akademische Übung. Google läuft aus Rechenleistung. Alphabet-Chef Sundar Pichai sagte im April 2026 offen, das Unternehmen sei „compute constrained in the near term“. Google Cloud hat bereits externe Kunden abgewiesen, weil die eigene KI-Infrastruktur nicht ausreicht. Dieser Kapazitätsengpass kostet messbaren Umsatz.
Dazu kommt ein fundamentales Problem der KI-Infrastruktur. Speicherzugriffe von externen Chips verbrauchen bis zu zweihundertmal mehr Energie als die eigentlichen Rechenoperationen. Ein großes Sprachmodell mit Milliarden von Parametern passt nicht in den kleinen Zwischenspeicher eines Chips. Die Daten müssen ständig hin- und hergeschoben werden. Frozen v2 löst dieses Problem, indem es genug On-Chip-Speicher vorsieht, um das gesamte Modell lokal zu halten. Die Folge: nahezu keine externen Speicherzugriffe mehr.
Architektur statt Gewichte: Der kluge Kompromiss
Es gab bereits einen Vorläufer. Das ursprüngliche „Frozen“-Projekt unter Leitung von Google DeepMind-Chefwissenschaftler Jeff Dean wollte die trainierten Gewichte von Gemini direkt in den Chip brennen. Das wäre extrem effizient gewesen, hätte aber einen Haken gehabt. Ein Chip, der auf eine einzige Modellversion festgelegt ist, wird mit dem nächsten Gemini-Update sofort obsolet. Die Entwicklungskosten eines solchen ASICs liegen im Millionenbereich, lange bevor überhaupt produziert wird.
Frozen v2 zieht eine entscheidende Trennlinie. Die Architektur eines neuronalen Netzes ist etwas anderes als seine Gewichte. Die Architektur umfasst die Anzahl der Transformer-Blöcke, die Attention-Heads pro Block, die Dimensionen der Feed-Forward-Schichten und die Normalisierungsmethode. Diese Struktur ändert sich selten, meist nur wenn ein Labor sein Modell grundlegend umbaut. Die Gewichte hingegen ändern sich mit jedem Update.
Indem Frozen v2 die Architektur festlegt, aber die Gewichte aktualisierbar lässt, gewinnt Google Effizienz ohne sich die Flexibilität zu verbauen. Künftige Gemini-Versionen laufen auf derselben Hardware, solange die grundlegende Struktur erhalten bleibt. Wie viel der Architektur tatsächlich verdrahtet wird, ist laut Berichten noch nicht endgültig entschieden.
Die Konkurrenz schläft nicht
Google ist mit diesem Ansatz nicht allein. Das Startup Taalas verkauft bereits Chips, auf denen Modellarchitektur und Gewichte direkt aufgedruckt sind. Taalas spricht von 17.000 Tokens pro Sekunde, gegenüber etwa 150 pro Nutzer auf einem Top-Nvidia-GPU. Zudem braucht Taalas keinen teuren High-Bandwidth-Speicher, was die aktuelle Speicherkrise der KI-Branche entschärfen würde.
OpenAI entwickelt seinen eigenen Inferenz-Chip „Jalapeño“ mit Broadcom. Anthropic lässt bei Samsung in 2nm-Fertigung produzieren. Nvidia dominiert weiterhin den Markt, aber der Trend zu kundenspezifischer KI-Silizium ist unübersehbar. Der Unterschied von Frozen v2 ist die Tiefe der Integration: kein Chip für beliebige Modelle, sondern Silizium, das mit der Modellstruktur verschmilzt.
Die Risiken: Starrheit und unbestätigtes Projekt
Der offensichtlichste Nachteil ist die Starrheit. KI entwickelt sich rasant. Ein Chip, der auf die heutige Gemini-Architektur optimiert ist, könnte 2028 bereits veraltet aussehen. Google versucht das abzufedern, indem die Gewichte aktualisierbar bleiben. Die Architektur ist jedoch festgelegt.
Dazu kommt, dass Google das Projekt nicht offiziell bestätigt hat. Ein Sprecher sagte lediglich, die Teams experimentierten mit hocheffizienten Ideen und nicht jedes Labor-Projekt erreiche die Produktion. Der 2028-Zeitplan ist ein berichtetes Ziel, keine bestätigte Roadmap. Die Effizienzangaben von sechs- bis zehnfach beruhen auf Projektionen der Ingenieure, nicht auf unabhängigen Benchmarks.
Was Frozen v2 für die KI-Branche bedeutet
Trotz der Unsicherheiten sendet das Projekt ein klares Signal. Der Wettlauf um kundenspezifische KI-Chips bewegt sich von „jedes Modell laufen“ zu „ein Modell mit dem Metall verschmelzen“. Wenn Google das umsetzt, müssen Wettbewerber reagieren. Die Implikationen reichen weit über Google hinaus.
Effizienz ist aktuell das wichtigste Thema in der KI-Infrastruktur. Jede eingesparte Watt auf Data-Center-Skala bedeutet Geld. Ein Chip, der für ein Modell optimiert ist, lässt viel Overhead eines universellen Chips weg. Die niedrige Latenz eignet sich besonders für Echtzeit-Anwendungen wie Sprachassistenten, wo Verzögerung der Feind ist.
Strategisch vertieft Frozen v2 Googles Bestrebungen, die Abhängigkeit von Nvidia weiter zu reduzieren. Google baut bereits eigene TPUs, um Kosten zu senken und Lieferketten zu diversifizieren. Ein Gemini-spezifischer Chip treibt diese Eigenständigkeit auf eine neue Stufe. Alphabet-Aktien stiegen nach dem Bericht um bis zu 3,7 Prozent. Der Markt erkennt das Potenzial, auch wenn die Umsetzung noch Jahre entfernt ist.