ChatGPT Images 2.0: OpenAI definiert KI-Bildgenerierung neu
OpenAI hat eine neue Version seines Bildgenerierungsmodells vorgestellt. ChatGPT Images 2.0 bringt jedoch nicht nur bessere Bildqualität, sondern auch eine fundamentale technische Neuerung. Das Modell denkt jetzt, bevor es zeichnet, wie auch OpenAI bestätigt.
Das Reasoning-Prinzip kommt in die Bildgenerierung
Die wichtigste Änderung bei ChatGPT Images 2.0 betrifft die Arbeitsweise des Modells. Während frühere Bildgenerierungsmodelle als reine Blackboxes funktionierten und auf einen Prompt sofort ein Bild ausgaben, Allerdings verfolgt die neue Version einen agentischen Ansatz. Wenn Nutzer den sogenannten Thinking-Modus aktivieren, plant das Modell zunächst die Struktur des Bildes. Zudem nutzt es Web-Suche für aktuelle Kontextinformationen und reasoningt sich durch die Komposition, bevor der erste Pixel gerendert wird.
Diese Herangehensweise ermöglicht Ergebnisse, die weit über einfache Illustrationen hinausgehen. Während einer Pressevorführung demonstrierte das Team die Fähigkeit, eine komplexe PowerPoint-Datei hochzuladen und daraus ein professionelles Poster zu generieren. Daher gibt es nicht nur den Inhalt korrekt wieder, sondern behält auch die richtigen Logos und den spezifischen Stil der Originaldatei bei.
Mehrsprachigkeit als zentrale Stärke
Ein Kritikpunkt an KI-Bildgenerierung war die mangelnde Fähigkeit, lesbare Textpassagen darzustellen. OpenAI spricht bei Images 2.0 von einem Quantensprung in diesem Bereich. Das Modell kann jetzt vollständige Infografiken, wissenschaftliche Diagramme, Menüs, Landkarten und sogar Magazine mit korrekt gerenderten Textpassagen erstellen.
Besonders bemerkenswert ist die Unterstützung für nicht-lateinische Schriften. Japanisch, Koreanisch, Chinesisch, Hindi und Bengali werden mit hoher Detailgenauigkeit dargestellt. OpenAI beschreibt das Modell als Polyglotten, der Text nicht nur übersetzt, sondern in den visuellen Kontext korrekt integriert. Auch unser Bericht zum neuen Bildmodell zeigt diese Entwicklung.
Serienkonsistenz und Manga-Fähigkeiten
Für Kreative besonders interessant: Aus einem einzigen Prompt können bis zu acht unterschiedliche Bilder erstellt werden. Die denselben visuellen Stil und dieselben Charaktere beibehalten. Diese Konsistenz über Serien hinweg war bisher nur mit erheblichem manuellem Aufwand und externen Tools erreichbar.
Das neue System ermöglicht nämlich die Erstellung vollständiger Manga-Sequenzen, Kinderbuchillustrationen oder Social-Media-Kampagnen, die alle aus einem kreativen Ursprung stammen. Die Rede ist von einem fundamentalen Shift in der Art und Weise, wie OpenAI visuelle Medien betrachtet. Bilder sind eine Sprache, keine Dekoration.