Starte mit GPT-Live, wenn du eine neue Anwendung für Sprachdialoge entwickelst. Es kann gleichzeitig sprechen und zuhören und das Gespräch fortführen, während ein Backend-Agent nachdenkt, Werkzeuge nutzt oder eine Aufgabe erledigt.
Stelle mit dem WebRTC-Schnellstart die Verbindung für dein erstes Gespräch her und schreibe anschließend einen kurzen Live-Prompt. Wenn du bereits eine Realtime-Anwendung oder einen textbasierten Agenten hast, folge dem Leitfaden Zu GPT-Live migrieren.
Einen anderen Ablauf für Audio wählen
Verwende die Realtime API, wenn du ihr Modell für Sitzungen und Werkzeuge benötigst. Für Transkription, Übersetzung oder Sprachgenerierung ohne Dialogagenten wählst du unten die passende spezialisierte API.
| Was du erstellen möchtest | Hier geht’s los | Was du steuern kannst |
|---|---|---|
| Ein Speech-to-Speech-Agent, der das Realtime-Modell für Sitzungen und Werkzeuge nutzt | Realtime API | Audiogesprächsbeiträge, Sitzungszustand, Werkzeuge und Unterbrechungen. |
| Eine Sprachschnittstelle für einen bestehenden textbasierten Agenten | Sprachagenten | Sprache in Text umwandeln, den Ablauf des textbasierten Agenten ausführen und anschließend Text in Sprache umwandeln. |
| Ein Transkript einer Audiodatei | Dateien transkribieren | Datei-Uploads, begrenzte Anfragen und unterstützte Transkriptformate. |
| Live-Untertitel ohne Sprachausgabe des Assistenten | Live-Transkription | Audio-Streaming und Ereignisse mit schrittweisen Transkriptaktualisierungen. |
| Kontinuierliche Übersetzung gesprochener Sprache | Live-Übersetzung | Eine dedizierte Übersetzungssitzung statt eines Dialogzyklus mit einem Sprachagenten. |
| Vertonung oder generierte Sprache | Text in Sprache umwandeln | Text, Stimme und Ausgabeformat. |
| Audioeingabe oder -ausgabe in einer bestehenden Chat-App | Audio in Chat Completions | Begrenzte multimodale Chat-Anfragen. |
Anwendungen mit Sprachfunktionen entwickeln
Vergleiche Architekturen im Leitfaden Sprachagenten. Beginne mit dem Leitfaden zum Formulieren von Prompts für GPT-Live oder Realtime. Nutze anschließend die gemeinsamen Leitfäden zu den Themen Benutzerdefinierte Stimmen, Evaluierung und Kosten optimieren. Jeder Leitfaden unterscheidet zwischen modell- oder API-spezifischen Verhaltensweisen.
Eine Verbindung wählen
Starte für Audio im Browser mit WebRTC. Verwende für serverseitige Audiopipelines WebSockets. Informationen zu Telefonanrufen findest du unter Telefonie und SIP. Über eine serverseitige Steuerverbindung kann ein vertrauenswürdiges Backend eine Mediensitzung überwachen und steuern.
Wähle auf jeder Seite zu einer Verbindungsart deine API aus. Auch wenn GPT-Live und Realtime denselben Transport nutzen, sind ihre Handshakes, Zugangsdaten und Ereignisformate nicht austauschbar. Voraussetzungen und Anweisungen zum Setup findest du im jeweiligen Verbindungsleitfaden.
Deine bestehende Anwendung um Audio erweitern
Die Beispiele für Chat Completions findest du jetzt unter Audio in Chat Completions. Für den Einstieg in die Entwicklung eines Sprachagenten im Browser nutze den WebRTC-Schnellstart für GPT-Live.