GPT-Live: OpenAI macht ChatGPT zum ersten Full-Duplex-Sprachassistenten

von Marcel Buchholz 10. Juli 2026 2 Min. Lesezeit News

OpenAI stellt mit GPT-Live eine neue Generation von Sprachmodellen vor, die ChatGPT zum ersten Mal gleichzeitig zuhören und sprechen lässt. Die Full-Duplex-Architektur beendet das starre Walkie-Talkie-Prinzip bisheriger Sprachassistenten und macht Gespräche mit KI deutlich natürlicher.

Wie GPT-Live funktioniert

Bisherige Sprach-KI-Systeme arbeiteten nach einem einfachen Prinzip: Der Nutzer spricht, die KI wartet, dann antwortet. Selbst OpenAIs eigener Advanced Voice Mode aus dem Jahr 2024 blieb an dieses turnbasierte Modell gebunden. Kurze Denkpausen oder Hintergrundgeräusche führten oft zu unpassenden Unterbrechungen. GPT-Live bricht mit diesem Muster. Die neue Architektur verarbeitet Eingabe und Ausgabe kontinuierlich und gleichzeitig, wie OpenAI in seinem Blog erläutert. Zudem kann das Modell Delegationsaufgaben an GPT-5.5 im Hintergrund übergeben, während das Gespräch an der Oberfläche weiterläuft. Nutzer wählen zwischen drei Denkstufen: Instant, Medium und High.

Drei Generationen Sprach-KI im Vergleich

Wie VentureBeat berichtet, durchläuft OpenAI mit GPT-Live bereits die dritte Generation seiner Sprachtechnologie. Die erste Generation nutzte eine Kaskade aus drei Modellen: Sprache-zu-Text, Sprachmodell, Text-zu-Sprache. Informationen gingen zwischen den Schritten verloren, und die Antworten klangen holprig. Advanced Voice Mode fasste alles in ein Modell zusammen, blieb aber beim strikten Abwechseln. GPT-Live löst beide Probleme: Es hört nicht nur besser zu, sondern nickt auch mit kurzen Bestätigungen wie “Mhm” oder “Verstanden”, während der Nutzer noch spricht. Das Ergebnis wirkt deutlich weniger wie eine Maschine und deutlich mehr wie ein echtes Gespräch.

Was sich für Nutzer ändert

Die praktischen Verbesserungen sind spürbar. Hintergrundlärm in einem Café führt nicht mehr zu Fehlreaktionen. Denkpausen werden nicht mehr als Gesprächsende interpretiert. Auf Wunsch zeigt ChatGPT Voice jetzt auch visuelle Karten für Wetter, Aktienkurse oder Sportergebnisse während des Gesprächs an. Die neun Stimmen von ChatGPT wurden für GPT-Live neu gemastert. zahlende Nutzer erhalten GPT-Live-1 als Standard, Gratis-Nutzer bekommen die kleinere GPT-Live-1 mini. Mehr als 150 Millionen Menschen nutzen bereits wöchentlich die Sprachfunktionen von ChatGPT.

Die Herausforderung: Wenn KI wie ein Freund klingt

Je menschlicher eine Stimme wirkt, desto eher baut Nutzer Vertrauen auf. Genau darin liegt auch ein Risiko. OpenAI betont, dass GPT-Live voreingestellte Stimmen nutzt und keine realen Personen imitiert. Zusätzliche Sicherheits-Trainings und Echtzeit-Schutzmechanismen sollen riskante Gespräche erkennen und Krisenressourcen einblenden. Dennoch warnen Kritiker wie Signals Meredith Whittaker davor, dass Chatbots keine Freunde sind. Mit Konkurrenten wie ElevenLabs und einer wachsenden Zahl von Sprachagenten-Startups bleibt der Markt umkämpft. Auch Amazon arbeitet an einem Alexa-Neubau mit ähnlicher Technologie.

Was das für die Zukunft bedeutet

GPT-Live ist mehr als ein Feature-Update. Die Trennung von Sprachschicht und Denkschicht ist ein architektonischer Wechsel, der OpenAI ermöglicht, die Intelligenz der Sprachassistenz zu aktualisieren, ohne das Stimmmodell neu zu trainieren. Das Unternehmen spricht bereits von einer Zukunft, in der Spracheingabe statt Tippen zur Standard-Interaktion wird. Ob Nutzer tatsächlich dauerhaft mit einer KI sprechen wollen, die nie aufhört zuzuhören, bleibt die offene Frage. Die Antwort darauf wird nicht nur OpenAIs nächste Produkte bestimmen, sondern auch die Richtung der gesamten Branche.

MB

Marcel Buchholz

Autor bei AIWavez. Die Zukunft von heute: Alles über Künstliche Intelligenz.