Google DeepMind hat am Dienstag drei neue Gemini-Modelle vorgestellt und dabei eine Nachricht versteckt, die wichtiger ist als alle drei Releases zusammen: Das Training für Gemini 4 hat bereits begonnen. Während das lang erwartete Flaggschiff Gemini 3.5 Pro weiterhin auf sich warten lässt, rückt Googles nächste Modellgeneration in den Fokus.
Gemini 3.6 Flash: Mehr Leistung, weniger Token
Das neue Gemini 3.6 Flash ersetzt das kurzlebige Gemini 3.5 Flash, das erst im Mai auf der Google I/O erschienen war. Der wichtigste Fortschritt liegt nicht in roher Leistung, sondern in Effizienz. Laut dem unabhängigen Artificial Analysis Index verbraucht 3.6 Flash 17 Prozent weniger Ausgabe-Token als sein Vorgänger bei vergleichbaren Aufgaben. Im DeepSWE-Coding-Benchmark sinkt der Token-Verbrauch sogar um bis zu 65 Prozent.
Dabei wird das Modell nicht langsamer, sondern schneller. In der DeepSWE-Prüfung steigt der Wert von 37 auf 49 Prozent. MLE Bench klettert von 49,7 auf 63,9 Prozent. Die Computer-Use-Fähigkeit, also die Möglichkeit von KI, grafische Benutzeroberflächen zu bedienen, verbessert sich auf 83 Prozent im OSWorld-Test. Googles Wissenstand springt zudem von Januar 2025 auf März 2026, was einen gewaltigen Sprung bei aktuellen Informationen bedeutet.
Preise sinken, Agenten werden erschwinglich
Für Entwickler besonders relevant sind die neuen Token-Preise. Eingabe-Token kosten weiterhin 1,50 Dollar pro Million. Ausgabe-Token fallen jedoch von 9,00 auf 7,50 Dollar pro Million. In typischen Agenten-Workflows, die oft zwischen einer und 3,5 Millionen Token pro Aufgabe verbrauchen, summieren sich diese Ersparnisse schnell. Google-Chef Sundar Pichai betonte auf der Google I/O 2026, dass über 375 Cloud-Kunden jeweils mehr als eine Billion Token im vergangenen Jahr verarbeitet haben. Unternehmen mit vergleichbaren Workloads könnten durch den Wechsel zu Flash-Modellen mehr als eine Milliarde Dollar jährlich sparen.
Der technische Grund für die Ersparnis ist bemerkenswert. Google beschreibt 3.6 Flash nicht einfach als schlankeres Modell, sondern als eines, das Aufgaben in weniger Zwischenschritten erledigt. Weniger Reasoning-Schritte bedeuten weniger Tool-Aufrufe und weniger Kontext, der erneut gesendet werden muss. In Agenten-Schleifen spart das nicht nur Token, sondern auch Zeit.
Flash-Lite: Schnell und günstig für die Masse
Neben 3.6 Flash veröffentlichte Google auch Gemini 3.5 Flash-Lite. Dieses Modell zielt auf Durchsatz ab und erreicht 350 Ausgabe-Token pro Sekunde. Damit ist es das schnellste Modell der 3.5-Serie. Die Preise liegen bei 0,30 Dollar für Eingabe- und 2,50 Dollar für Ausgabe-Token pro Million. Allerdings sind das leicht höhere Preise als beim Vorgänger 3.1 Flash-Lite mit 0,25 und 1,50 Dollar.
Dafür liefert Flash-Lite deutliche Qualitätssprünge. Im Terminal-Bench 2.1 steigt der Wert von 31 auf 54 Prozent. Im SWE-Bench Pro schlägt es das ältere Gemini 3 Flash mit 54,2 zu 49,6 Prozent. Besonders interessant: Google rollt Flash-Lite bereits in der Google-Suche aus, wo es KI-Overviews verbessern soll.
Flash Cyber: Googles erstes KI-Sicherheitsmodell
Die dritte Neuerscheinung ist Gemini 3.5 Flash Cyber, Googles erstes KI-Modell, das speziell auf Cybersicherheit getrimmt ist. Es soll Schwachstellen in Code finden und beheben, und das zu einem Bruchteil der Kosten von Modellen wie Anthropics Claude Mythos. Allerdings ist das Modell nicht öffentlich verfügbar. Zugang erhalten ausschließlich Regierungen und vertrauenswürdige Partner über einen begrenzten Pilot in Googles CodeMender-Agenten. Google begründet dies mit der doppelten Natur solcher Modelle, die auch für Angriffe missbraucht werden könnten.
Gemini 3.5 Pro bleibt verschoben, Gemini 4 im Training
Die größte Nachricht versteckt sich zwischen den Zeilen. Gemini 3.5 Pro, das auf der Google I/O für Juni angekündigt war, bleibt weiterhin ohne Veröffentlichungstermin. Bloomberg berichtete am 16. Juli unter Berufung auf zehn aktuelle und ehemalige Google-Mitarbeiter, dass das Modell interne Coding-Benchmarks nicht erreichte. Googles Antwort auf dieses Problem ist radikal: Statt 3.5 Pro weiter zu optimieren, hat das Team bereits mit dem Pre-Training von Gemini 4 begonnen, dem ehrgeizigsten Trainingslauf in der Geschichte von DeepMind.
Das ist ein klares Signal. Wenn ein Unternehmen die aufwendigste und irreversibelste Phase der Modellentwicklung startet, hat es entschieden, dass das Problem architektonischer Natur ist und nicht durch Fine-Tuning oder bessere Trainingsdaten gelöst werden kann. Google setzt also nicht auf Reparatur, sondern auf einen Neustart.
Was das für die KI-Branche bedeutet
Googles Drei-Modell-Strategie zeigt, wo der Markt gerade steht. Die Frontliga um OpenAI, Anthropic und Meta kämpft um die höchste Leistung, während Google die Infrastruktur für die Agenten-Ökonomie aufbaut. Flash-Modelle sind nicht mehr nur Lückenfüller, sondern das Rückgrat von Agenten-Systemen, die in Unternehmen laufen. Computer-Use als Standardfunktion bedeutet, dass KI grafische Oberflächen direkt bedienen kann, ohne dass Entwickler eigene Integrationen bauen müssen.
Die Verschiebung von 3.5 Pro bei gleichzeitigem Start von Gemini 4 zeigt zudem, dass der Wettlauf um Frontier-Modelle längst nicht entschieden ist. Anthropic und OpenAI haben in den letzten Monaten erheblich aufgeholt. Googles Antwort besteht nicht darin, ein schwaches Flaggschiff auf den Markt zu drücken, sondern die Basis komplett neu zu bauen. Ob diese Strategie aufgeht, wird sich erst Ende 2026 oder Anfang 2027 zeigen.
Weitere Artikel: Gemini 3.5 Pro Verzögerung: Google verliert 225 Milliarden | Google Frozen v2: Wenn Gemini zum Silizium wird | KI-Preiskrieg: OpenAI, Anthropic und Google liefern sich das größte Gefecht um Token-Preise