For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Hauptnavigation

Audio und Stimme

Starte mit GPT-Live für Sprachdialoge oder wähle eine API für eine andere Audioaufgabe.

Starte mit GPT-Live, wenn du eine neue Anwendung für Sprachdialoge entwickelst. Es kann gleichzeitig sprechen und zuhören und das Gespräch fortführen, während ein Backend-Agent nachdenkt, Werkzeuge nutzt oder eine Aufgabe erledigt.

Stelle mit dem WebRTC-Schnellstart die Verbindung für dein erstes Gespräch her und schreibe anschließend einen kurzen Live-Prompt. Wenn du bereits eine Realtime-Anwendung oder einen textbasierten Agenten hast, folge dem Leitfaden Zu GPT-Live migrieren.

Einen anderen Ablauf für Audio wählen

Verwende die Realtime API, wenn du ihr Modell für Sitzungen und Werkzeuge benötigst. Für Transkription, Übersetzung oder Sprachgenerierung ohne Dialogagenten wählst du unten die passende spezialisierte API.

Was du erstellen möchtestHier geht’s losWas du steuern kannst
Ein Speech-to-Speech-Agent, der das Realtime-Modell für Sitzungen und Werkzeuge nutztRealtime APIAudiogesprächsbeiträge, Sitzungszustand, Werkzeuge und Unterbrechungen.
Eine Sprachschnittstelle für einen bestehenden textbasierten AgentenSprachagentenSprache in Text umwandeln, den Ablauf des textbasierten Agenten ausführen und anschließend Text in Sprache umwandeln.
Ein Transkript einer AudiodateiDateien transkribierenDatei-Uploads, begrenzte Anfragen und unterstützte Transkriptformate.
Live-Untertitel ohne Sprachausgabe des AssistentenLive-TranskriptionAudio-Streaming und Ereignisse mit schrittweisen Transkriptaktualisierungen.
Kontinuierliche Übersetzung gesprochener SpracheLive-ÜbersetzungEine dedizierte Übersetzungssitzung statt eines Dialogzyklus mit einem Sprachagenten.
Vertonung oder generierte SpracheText in Sprache umwandelnText, Stimme und Ausgabeformat.
Audioeingabe oder -ausgabe in einer bestehenden Chat-AppAudio in Chat CompletionsBegrenzte multimodale Chat-Anfragen.

Anwendungen mit Sprachfunktionen entwickeln

Vergleiche Architekturen im Leitfaden Sprachagenten. Beginne mit dem Leitfaden zum Formulieren von Prompts für GPT-Live oder Realtime. Nutze anschließend die gemeinsamen Leitfäden zu den Themen Benutzerdefinierte Stimmen, Evaluierung und Kosten optimieren. Jeder Leitfaden unterscheidet zwischen modell- oder API-spezifischen Verhaltensweisen.

Eine Verbindung wählen

Starte für Audio im Browser mit WebRTC. Verwende für serverseitige Audiopipelines WebSockets. Informationen zu Telefonanrufen findest du unter Telefonie und SIP. Über eine serverseitige Steuerverbindung kann ein vertrauenswürdiges Backend eine Mediensitzung überwachen und steuern.

Wähle auf jeder Seite zu einer Verbindungsart deine API aus. Auch wenn GPT-Live und Realtime denselben Transport nutzen, sind ihre Handshakes, Zugangsdaten und Ereignisformate nicht austauschbar. Voraussetzungen und Anweisungen zum Setup findest du im jeweiligen Verbindungsleitfaden.

Deine bestehende Anwendung um Audio erweitern

Die Beispiele für Chat Completions findest du jetzt unter Audio in Chat Completions. Für den Einstieg in die Entwicklung eines Sprachagenten im Browser nutze den WebRTC-Schnellstart für GPT-Live.