DiffusionGemma: Wie Google KI-Texte viermal schneller macht

von Marcel Buchholz 11. Juni 2026 3 Min. Lesezeit Uncategorized

Google hat am 10. Juni 2026 DiffusionGemma vorgestellt, ein offenes experimentelles KI-Modell, das Texterzeugung grundlegend anders angeht. Statt Wörter nacheinander wie auf einer Schreibmaschine zu tippen, generiert DiffusionGemma ganze Textblöcke gleichzeitig. Das Ergebnis: bis zu viermal schnellere Texterzeugung auf dedizierten GPUs. Zudem ist das Modell unter der freien Apache-2.0-Lizenz verfügbar.

Was ist Text-Diffusion und warum ist sie schneller

Herkömmliche Sprachmodelle wie GPT-4 oder Gemini arbeiten autoregressiv. Sie erzeugen Text Token für Token, von links nach rechts, Wort für Wort. Das ist wie Tippen auf einer Schreibmaschine: Jeder Buchstabe muss warten, bis der vorherige fertig ist. DiffusionGemma macht etwas völlig anderes. Es startet mit einer Leinwand voller zufälliger Platzhalter und verfeinert sie in mehreren Durchläufen, bis ein kohärenter Text entsteht. Das Prinzip kennt man von Bildgeneratoren wie Stable Diffusion, die aus visuellem Rauschen schrittweise ein klares Bild formen. Auf einen Text übertragen bedeutet das: Das Modell generiert 256 Token parallel pro Durchlauf.

Die Zahlen hinter DiffusionGemma

DiffusionGemma ist ein 26-Milliarden-Parameter-Modell mit Mixture-of-Experts-Architektur. Dabei aktiviert es nur 3,8 Milliarden Parameter pro Inferenz. Das Modell erreicht über 1.000 Token pro Sekunde auf einem einzelnen NVIDIA H100 und mehr als 700 Token pro Sekunde auf einer GeForce RTX 5090. Zum Vergleich: Typische autoregressive Modelle liegen bei 100 bis 300 Token pro Sekunde auf vergleichbarer Hardware. Quantisiert passt DiffusionGemma in 18 GB VRAM, also auf handelsübliche High-End-Consumer-GPUs.

Bidirektionale Aufmerksamkeit als Vorteil

Weil DiffusionGemma alle Token gleichzeitig verarbeitet, kann jedes Token auf alle anderen zugreifen. Diese bidirektionale Aufmerksamkeit eröffnet neue Möglichkeiten, die autoregressive Modelle nicht bieten. Code-Infilling, also das Ergänzen von Code-Lücken, funktioniert deutlich besser, weil das Modell den Kontext vor und nach der Lücke gleichzeitig berücksichtigt. Ebenso bei Sudoku: Unsloth hat DiffusionGemma erfolgreich auf Sudoku-Programmierung feinabgestimmt, eine Aufgabe, bei der autoregressive Modelle scheitern, weil jedes Token von zukünftigen Token abhängt.

Die Grenzen des Ansatzes

Google selbst warnt: DiffusionGemma ist experimentell. Die Gesamtqualität der Ausgabe liegt unter der von Gemma 4, dem Standardmodell für Produktionseinsatz. Der Grund liegt in der Natur der Diffusion: Ein falsches Token in einem Textblock kann den gesamten Block unbrauchbar machen, während ein fehlerhaftes Pixel in einem Bild kaum stört. Zudem verschwendet Diffusion Ressourcen, wenn nur wenige Token benötigt werden. Für lange Antworten ist die Parallelität ein Vorteil, für kurze Anfragen ein Nachteil. Außerdem verringert sich der Geschwindigkeitsvorteil bei hoher Parallelität im Cloud-Betrieb, weil autoregressive Modelle dort durch Batching bereits effizient arbeiten.

Warum lokal der Unterschied zählt

Der eigentliche Anwendungsfall von DiffusionGemma ist die lokale Inferenz. Auf einem einzelnen Accelerator, der nur einen Benutzer bedient, bleibt die Rechenleistung bei autoregressiven Modellen oft ungenutzt. Die Speicherbandbreite wird zum Flaschenhals, während der Prozessor wartet. DiffusionGemma dreht dieses Verhältnis um: Statt Speicherbandbreite zu limitieren, wird Rechenleistung zum limitierenden Faktor. Das passt zu aktueller Hardware, die mehr Rechenleistung als Speicherbandbreite bietet. Anwendungen wie Inline-Editing, schnelle Iteration in Entwicklungsumgebungen und Echtzeit-Code-Vervollständigung profitieren besonders davon.

Ökosystem und Verfügbarkeit

Google hat DiffusionGemma mit breiter Industriestruktur begleitet. Die Modellgewichte sind auf Hugging Face verfügbar. vLLM, MLX und Hugging Face Transformers unterstützen das Modell bereits. Nvidia hat Optimierungen für RTX-4090, RTX-5090 und H100 bereitgestellt. Unsloth bietet Fine-Tuning-Tutorials an, und Googles eigenes Hackable-Diffusion-Toolkit ermöglicht experimentelle Anpassungen. Offizieller Support für llama.cpp ist ebenfalls angekündigt. Die Apache-2.0-Lizenz erlaubt kommerzielle Nutzung ohne Einschränkungen.

Fazit: Ein Paradigmenwechsel mit Fragezeichen

DiffusionGemma ist kein Ersatz für Gemma 4. Es ist ein Experiment, das zeigt, dass Text-Diffusion auf großer Skala funktioniert und lokale Inferenz dramatisch beschleunigen kann. Der Geschwindigkeitsvorteil von viermal mehr Token pro Sekunde ist beeindruckend, die Qualitätsabstriche sind real. Dennoch markiert DiffusionGemma einen Wendepunkt: Erstmals ist ein großes Text-Diffusionsmodell offen verfügbar, auf Consumer-Hardware lauffähig und von einem großen Technologieunternehmen unterstützt. Wenn die Qualität in künftigen Versionen steigt, könnte Text-Diffusion der lokale Gegenentwurf zur Cloud-Dominanz autoregressiver Modelle werden.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.