OpenAI baut ChatGPT Voice aus: Mehr Apps, mehr KI, mehr Möglichkeiten

OpenAI baut den Sprachmodus von ChatGPT deutlich aus. Was ursprünglich vor allem als Möglichkeit gedacht war, mit ChatGPT ein natürliches Gespräch zu führen, entwickelt sich immer stärker zu einer vollständigen Bedienoberfläche für den KI-Assistenten.
Seit dem 23. September 2026 kann ChatGPT Voice nun auch Plugins und verbundene Apps verwenden. Gleichzeitig hatte OpenAI bereits Anfang September leistungsfähigere Modelle für komplexere Aufgaben im Sprachmodus freigeschaltet. Damit kann Voice inzwischen deutlich mehr, als lediglich gesprochene Fragen zu beantworten.
Plugins lassen sich jetzt per Sprache verwenden
Die größte Neuerung ist die Unterstützung von Plugins innerhalb von ChatGPT Live.
Während eines Sprachgesprächs kann ChatGPT nun auf Plugins und Apps zugreifen, die mit dem eigenen Konto verbunden und für den jeweiligen Tarif freigeschaltet sind.
Dadurch können beispielsweise verbundene Dienste in eine Unterhaltung einbezogen werden.
Je nach Plugin könnte man ChatGPT also beispielsweise bitten:
Informationen aus einem verbundenen Dienst zu suchen
Dokumente oder Nachrichten zusammenzufassen
Daten aus Apps abzurufen
unterstützte Aktionen auszuführen
oder Informationen aus mehreren Quellen miteinander zu kombinieren
Welche Möglichkeiten tatsächlich zur Verfügung stehen, hängt vom jeweiligen Plugin, dem eigenen Tarif, der Region und den verbundenen Konten ab.
Einfach sprechen statt tippen
Das Spannende daran ist weniger das Plugin selbst, sondern die Art, wie man es verwendet.
Statt einen Befehl einzutippen, kann man die Aufgabe nun einfach aussprechen.
Ein Beispiel könnte so aussehen:
„Suche in meinen verbundenen Dateien nach dem letzten Projektbericht und fasse mir die wichtigsten Punkte zusammen.“
ChatGPT kann anschließend das passende Plugin beziehungsweise die verbundene App verwenden und die Antwort während des Gesprächs wieder vorlesen.
Gleichzeitig erscheint die Antwort weiterhin als Text im Chat. Man kann also zuhören und parallel auf dem Display mitlesen.
Sicherheitsabfragen bleiben auf dem Bildschirm
Ganz ohne Kontrolle funktioniert das allerdings nicht.
Wenn ein Plugin eine Aktion durchführen möchte, für die eine zusätzliche Bestätigung erforderlich ist, muss diese weiterhin auf dem Bildschirm bestätigt werden.
Eine einfache gesprochene Zustimmung reicht dafür nicht aus.
Das ist durchaus sinnvoll. Schließlich soll nicht versehentlich eine Aktion ausgeführt werden, nur weil ChatGPT während eines Gesprächs ein „Ja“ falsch interpretiert hat.
Auch bestehende Berechtigungen ändern sich durch Voice nicht.
Hat ein Plugin keinen Zugriff auf bestimmte Daten oder wurde eine Verbindung im Konto beziehungsweise innerhalb eines Unternehmens gesperrt, kann Voice diese Einschränkungen nicht umgehen.
Auch Free und Go können Plugins mit Voice nutzen
Die Neuerung bleibt nicht ausschließlich den teuersten ChatGPT-Tarifen vorbehalten.
Laut OpenAI können auch Nutzer der Free- und Go-Tarife Voice zusammen mit den Plugins verwenden, die ihr jeweiliger Tarif unterstützt.
Welche Plugins angezeigt werden, unterscheidet sich allerdings je nach:
Tarif
Region
Konto
Workspace
Plugin
und verfügbarer ChatGPT-Oberfläche
Es kann deshalb durchaus sein, dass zwei Nutzer unterschiedliche Plugin-Auswahlen sehen.
Voice kann jetzt stärkere Modelle hinzuziehen
Plugins sind allerdings nur die Hälfte der aktuellen Erweiterung.
Bereits seit dem 9. September 2026 kann ChatGPT Voice bei anspruchsvolleren Aufgaben auf GPT-5.6 oder GPT-6 Astra zurückgreifen.
Der eigentliche Sprachdialog wird weiterhin von den GPT-Live-Modellen getragen.
Wenn jedoch beispielsweise eine komplexe Recherche oder tiefergehendes Reasoning erforderlich ist, kann Voice ein leistungsfähigeres Modell hinzuziehen.
Damit wird der Sprachmodus wesentlich flexibler.
Eine einfache Frage muss nicht mit demselben Aufwand verarbeitet werden wie eine komplizierte Analyse.
Modell und Reasoning lassen sich auswählen
OpenAI hat außerdem die Steuerung von Voice stärker an den normalen Text-Chat angeglichen.
Nutzer können für unterstützte Modelle auswählen, welches Modell verwendet werden soll und wie viel Reasoning-Aufwand für eine Aufgabe eingesetzt wird.
Die verfügbaren Modelle hängen dabei vom jeweiligen Tarif ab.
Damit verschwindet zunehmend die frühere Trennung zwischen:
„Ich schreibe mit ChatGPT“
und
„Ich spreche mit ChatGPT.“
Beide Varianten greifen immer stärker auf dieselben Fähigkeiten zurück.
GPT-Live bleibt das Herzstück
Die Grundlage des aktuellen Sprachmodus ist weiterhin GPT-Live.
OpenAI hatte GPT-Live im Juli 2026 eingeführt. Kostenpflichtige ChatGPT-Nutzer verwenden dabei GPT-Live-1, während Free-Nutzer auf GPT-Live-1 mini zugreifen.
Ein wesentlicher Unterschied zu älteren Voice-Versionen besteht darin, dass GPT-Live gleichzeitig zuhören und sprechen kann.
Dadurch kann man ChatGPT während einer Antwort unterbrechen oder direkt weiterreden, ohne jedes Mal darauf warten zu müssen, dass die KI vollständig ausgesprochen hat.
Das macht Gespräche deutlich natürlicher.
Text, Bilder und Sprache in einem Chat
Auch die Grenzen zwischen den verschiedenen Eingabeformen verschwinden.
Während eines Live-Gesprächs kann man weiterhin Text eingeben und – sofern für das Konto unterstützt – Bilder hinzufügen.
ChatGPT kann anschließend wieder per Sprache antworten.
Man muss also keinen neuen Chat starten, nur weil man zwischendurch etwas zeigen oder eintippen möchte.
Auch Websuche und unterstützte visuelle Ergebnisse können innerhalb von Live verwendet werden.
Damit wird Voice zunehmend zu einer vollständigen Alternative zur klassischen Bedienung per Tastatur.
ChatGPT Voice kommt auch in Work
Noch einen Schritt weiter geht OpenAI mit ChatGPT Work.
Voice steht inzwischen auch dort auf Web und Mobilgeräten zur Verfügung.
Nutzer können ChatGPT per Sprache beispielsweise anweisen:
Dokumente zu erstellen
Präsentationen anzulegen
Tabellen zu erstellen
verbundene Apps zu verwenden
oder Aufgaben im Browser auszuführen
Wird das Sprachgespräch beendet, während eine Aufgabe noch läuft, kann diese anschließend im Textmodus weitergeführt werden.
Damit wird Sprache erstmals zu einer richtigen Steuerungsmöglichkeit für längere Arbeitsabläufe.
Ein Gespräch könnte künftig eine komplette Aufgabe erledigen
Die Richtung, in die OpenAI geht, wird damit ziemlich deutlich.
Früher war Voice hauptsächlich dafür gedacht, Fragen zu stellen und Antworten zu erhalten.
Inzwischen könnte ein Gespräch beispielsweise so aussehen:
„Finde die neuesten Zahlen aus meinen verbundenen Daten, fasse die wichtigsten Veränderungen zusammen und erstelle daraus eine Präsentation.“
ChatGPT könnte dabei ein Plugin beziehungsweise eine verbundene App nutzen, die Informationen analysieren und anschließend über Work eine Präsentation erstellen.
Die Sprache dient dann lediglich als Bedienoberfläche für eine deutlich komplexere Aufgabe.
Aber nicht jedes Voice-Erlebnis kann alles
OpenAI bietet weiterhin mehrere Sprachmodi an.
Live ist der aktuelle, auf GPT-Live basierende Modus und unterstützt unter anderem Plugins, Websuche, Memory sowie Text und Bilder.
Daneben gibt es weiterhin Advanced und Standard.
Ein wichtiger Unterschied:
Live unterstützt derzeit keine Live-Videoübertragung oder Bildschirmfreigabe.
Wer diese Funktionen benötigt und dafür berechtigt ist, muss weiterhin den älteren Advanced-Modus verwenden.
Die Nutzung bleibt je nach Tarif begrenzt
Voice ist weiterhin nicht bei allen Tarifen unbegrenzt verfügbar.
Zum aktuellen Stand gelten beispielsweise:
Go: bis zu 3 Stunden GPT-Live-1 mini
Plus: bis zu 3 Stunden GPT-Live-1
Pro für 100 US-Dollar: bis zu 15 Stunden GPT-Live-1
Pro für 200 US-Dollar: unbegrenzte GPT-Live-1-Nutzung
Für Free-Nutzer gibt es einen begrenzten Zugang zu GPT-Live-1 mini.
Die Limits werden über einen rollierenden Zeitraum von 24 Stunden berechnet und können sich zukünftig natürlich noch ändern.
Fazit
ChatGPT Voice entwickelt sich gerade ziemlich schnell weiter.
Mit der Unterstützung von Plugins und verbundenen Apps ist Sprache nicht länger nur eine bequemere Möglichkeit, eine Frage einzugeben.
Voice kann jetzt auf externe Dienste zugreifen und – abhängig von den jeweiligen Berechtigungen – sogar Aktionen auslösen.
Gleichzeitig können GPT-5.6 und GPT-6 Astra bei schwierigeren Aufgaben Recherche und Reasoning übernehmen, während GPT-Live weiterhin für das eigentliche Gespräch zuständig ist.
Damit nähert sich OpenAI einem ziemlich interessanten Ziel:
Man öffnet ChatGPT irgendwann nicht mehr, um etwas einzutippen.
Man sagt einfach, was erledigt werden soll.
Und ChatGPT kümmert sich im Hintergrund darum, welches Modell, welches Plugin und welche verbundene App dafür gebraucht werden.