Gemini 3.5 Pro Neustart: Google wirft Basisarchitektur weg und beginnt von vorn

von Marcel Buchholz 16. Juli 2026 3 Min. Lesezeit News, Software & Entwicklung

Google DeepMind hat eine Entscheidung getroffen, die in der KI-Branche für Aufsehen sorgt: Das Unternehmen hat die Basisarchitektur von Gemini 3.5 Pro komplett verworfen und von Grund auf neu aufgebaut. Der Starttermin rückt auf den 17. Juli, doch die eigentliche Geschichte ist, was hinter den Kulissen passiert ist.

Warum Google ein fast fertiges Modell wegwarf

Das ursprüngliche Gemini 3.5 Pro basierte auf der Architektur von Gemini 2.5 Pro. In internen Tests bei Vertex AI zeigten sich jedoch strukturelle Schwächen, die sich nicht durch Nachtraining beheben ließen. Rekursive Werkzeugaufrufe brachen zusammen, komplexe SVG-Szenen ließen sich nicht konsistent generieren, und die mathematische Schlussfolgerungskette erreichte nicht das Niveau der Konkurrenz. Google traf daraufhin eine ungewöhnliche Entscheidung: Das Unternehmen startete das Pre-Training komplett neu.

Dabei handelt es sich nicht um einen kleinen Eingriff. Pre-Training ist die teuerste Phase bei der Entwicklung eines Frontier-Modells. Die Entscheidung, einen nahezu fertigen Basislauf zu verwerfen, bedeutet, dass Googles eigene Ingenieure den Abstand zu GPT-5.6 Sol und Claude Fable 5 als strukturell einschätzten, nicht als feinjustierbar. Sundar Pichai hatte auf der Google I/O am 19. Mai noch erklärt, die Modelle kämen im nächsten Monat. Dieser Monat verging ohne Release.

Was das neu aufgebaute Modell können soll

Berichten zufolge bringt Gemini 3.5 Pro drei Kernfunktionen mit: ein Kontextfenster von 2 Millionen Tokens, einen Deep-Think-Modus für mehrstufige logische Probleme und autonome Workflow-Fähigkeiten für mehrstufige Coding-Aufgaben. Allerdings bestätigt Google keine dieser Angaben offiziell. Weder eine Model Card noch eine Preisseite noch ein API-Endpunkt existieren zum jetzigen Zeitpunkt.

Das Kontextfenster von 2 Millionen Tokens verdient besondere Beachtung. Unabhängige Studien zeigen, dass die Reasoning-Qualität bei Frontier-Modellen typischerweise 30 bis 40 Prozent vor der angegebenen Grenze deutlich nachlässt. Bei Gemini 3.1 Pro fiel die Mehrbereichs-Kontext-Recall-Qualität bereits nach 128.000 Tokens spürbar ab. Die entscheidende Frage ist also nicht, ob das Modell 2 Millionen Tokens akzeptiert, sondern ob es über diesen Bereich hinweg zuverlässig schlussfolgert.

Flash hält die Stellung während Pro neu gebaut wird

Während Gemini 3.5 Pro neu aufgebaut wird, trägt Gemini 3.5 Flash die Produktionslast. Google hat Flash offiziell bestätigt: 76,2 Prozent auf Terminal-Bench 2.1, 83,6 Prozent auf MCP Atlas und 84,2 Prozent auf CharXiv Reasoning. Damit schlägt Flash das ältere Gemini 3.1 Pro in allen drei Benchmarks, und zwar viermal schneller bei 1,50 Dollar pro Million Input-Tokens und 9 Dollar pro Million Output-Tokens.

Unternehmen wie Salesforce nutzen Flash bereits produktiv in Agentforce-Integrationen, da Agenten-Plattformen Tausende von Modellaufrufen pro Workflow benötigen. Flash bietet die dafür notwendige Geschwindigkeit und Kostenstruktur. Pro soll hingegen die tiefe, mehrstufige Reasoning übernehmen, die Flash aufgrund seiner auf Geschwindigkeit optimierten Architektur bewusst zurückstellt.

Der Wettbewerb wartet nicht

Die Verzögerung von Gemini 3.5 Pro kommt in einer Woche, in der GPT-5.6 Sol öffentlich zugänglich wurde und Grok 4.5 am selben Tag startete. DeepSeek V4 zielt auf Mitte Juli für sein stabiles Release ab. Drei der meistbeobachteten Modell-Events des Jahres konvergieren in derselben Woche. Ein weiterer Slip würde die Geschichte einer Firma erzählen, die ein Problem korrekt diagnostizierte, aber die Dauer der Lösung unterschätzte.

Interessant ist auch die regulatorische Dimension: Gemini 3.5 Pro ist derzeit das einzige große Frontier-Modell, das keinen Regierungs-Zugangsbeschränkungen unterliegt. GPT-5.6 Sol brauchte 13 Tage für eine Regierungsprüfung, und Fable 5 war für 20 Tage komplett gesperrt. Dieser Verfügbarkeitsvorteil könnte für Unternehmen bedeutsam werden, die keine regulatorischen Hürden bei der Modellauswahl in Kauf nehmen möchten.

Was Entwickler jetzt tun können

Bis Google die Model Card veröffentlicht, sollten Entwickler Gemini 3.5 Pro als Beobachtungsliste behandeln, nicht als Planungsabhängigkeit. Wer vor dem 17. Juli liefern muss, hat mit Flash eine brauchbare Alternative. Teams, die zwingend mehrstufige Reasoning und Langkontext-Analyse benötigen, warten am besten auf die ersten unabhängigen Benchmarks nach dem Release.

Die wahre Bedeutung der Geschichte liegt ohnehin nicht in den Benchmarks, sondern in der Entscheidung selbst: Google hielt den eigenen Abstand zur Konkurrenz für groß genug, um hundert Millionen Dollar an Rechenzeit und Wochen an Marktvorsprung aufs Spiel zu setzen. Ob dieser Einsatz aufgeht, zeigt sich am 17. Juli oder an dem Tag, an dem die Model Card endlich veröffentlicht wird.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.