GPT-Live führt ein gesprochenes Gespräch, während ein Backend-Agent Informationen nachschlägt, Werkzeuge verwendet und Aufgaben erledigt. Es kann gleichzeitig zuhören und sprechen. Diese Fähigkeit heißt Vollduplex. Aufgaben an das Backend zu übergeben, heißt Delegation: Das Gespräch kann weitergehen, während diese Aufgaben ausgeführt werden.
Zum Beispiel kann eine Person nach einer Bestellung fragen, ein Detail ergänzen, während das Backend den Status prüft, und das Ergebnis hören, sobald es vorliegt. Du wählst das Backend-Modell oder den Backend-Agenten unabhängig vom Sprachmodell. Realtime verwendet ein einziges Modell für Sprache, logisches Denken und die Auswahl von Werkzeugen.
Die beiden Komponenten verstehen
- GPT-Live führt das Gespräch. Es hört zu, spricht und entscheidet, wann es das Backend um Hilfe bittet. Gib ihm einen kurzen Prompt, der den Gesprächsstil vorgibt und festlegt, wann es Aufgaben delegieren soll.
- Das Backend erledigt delegierte Aufgaben. Verwende bei der Responses-Delegation ein unterstütztes Responses-Modell. Bei der clientseitigen Delegation kannst du beliebige Modelle, Agenten-Harnesses oder Dienste anbinden, die deine Anwendung ausführt. Das Backend zieht Schlussfolgerungen, verwendet Werkzeuge und liefert Ergebnisse zurück, die GPT-Live mitteilt. Hinterlege hier detaillierte Anweisungen, Geschäftsregeln und Arbeitsabläufe mit Werkzeugen.
Deine Anwendung ist für Berechtigungen, Bestätigungen, die Ausführung privater Funktionen und den dauerhaften Aufgabenstatus zuständig. Eine Unterbrechung der Sprachausgabe bricht die Arbeit im Backend nicht automatisch ab. Unter Sprachagenten findest du einen Vergleich von GPT-Live mit Realtime und Sprachanwendungen mit verketteten Verarbeitungsschritten.
Ausführungsart für das Backend wählen
Beginne mit der Responses-Delegation, wenn ein verwaltetes Backend passt: GPT-Live ruft dein konfiguriertes Responses-Modell auf, übermittelt den Gesprächskontext und gibt Ergebnisse zurück. Wähle die clientseitige Delegation, wenn deine Anwendung die Ausführung im Backend, den Kontext oder die an GPT-Live übermittelten Ergebnisse steuern muss.
Unter Delegationsmodus wählen findest du einen Vergleich und Details zur Konfiguration. Wähle den Modus beim Erstellen der Sitzung. Um den Modus zu wechseln, starte eine neue Sitzung.
Verbindung für deine erste Sitzung herstellen
Beginne mit dem WebRTC-Schnellstart für GPT-Live. Das Beispiel für Browser und Server verbindet Mikrofoneingabe und Lautsprecherausgabe mit einem Responses-Backend, das das Web durchsuchen kann.
Du brauchst ein Mikrofon, eine über HTTPS oder localhost bereitgestellte Browserseite und einen vertrauenswürdigen Server mit einem API-Schlüssel für ein OpenAI-Projekt. Bewahre den Schlüssel auf dem Server auf.
- Schreibe einen kurzen Gesprächsprompt, der GPT-Live vorgibt, wann es das Backend um Hilfe bitten soll.
- Folge dem Schnellstart, um Mikrofon, Audiowiedergabe und Ereigniskanal im Browser anzubinden. Dein Server erstellt die Sitzung und tauscht das Verbindungsangebot des Browsers gegen eine Antwort aus.
- Warte auf
session.started, sprich dann und höre dir die Antwort an. Stelle eine Frage, die aktuelle Informationen erfordert, um das Backend mit Websuche auszuprobieren. - Beende das Gespräch und schließe die Sitzung, um die abschließenden Nutzungsdaten zu erfassen und die Verbindung freizugeben.
Prüfe sowohl das gesprochene Gespräch als auch das Backend-Ergebnis. Ein Ereignis zum Sitzungsstart bestätigt den Start. Wenn du dir eine Antwort anhörst und das Suchergebnis prüfst, überprüfst du damit unterschiedliche Teile der Anwendung.
GPT-Live-Sprachsitzungen werden nach Dauer sekundengenau abgerechnet. Den aktuellen Preis findest du unter Modellpreise. Die Nutzung des Backend-Modells und der Werkzeuge wird separat abgerechnet. Unter Kosten optimieren erfährst du, wie die Nutzung erfasst wird und wie du Kosten senken kannst.
Verbindung wählen
- WebRTC für Sprachanwendungen im Browser. Medienspuren übertragen Audio, ein Datenkanal überträgt JSON-Ereignisse.
- WebSockets für serverseitige Audiointegrationen. Der primäre Socket überträgt Audio und Steuerungsereignisse.
- Serverseitige Steuerung für den Backend-Zugriff auf eine bestehende Sitzung. Eine Sideband-Verbindung überträgt Ereignisse, während Audio weiterhin über die primäre Verbindung läuft.
- Telefonie und SIP für Möglichkeiten zur Telefonieintegration und Hinweise zu Anbietern.
Partnerintegrationen
Wenn deine Anwendung mit LiveKit, Twilio, Telnyx oder Daily/Pipecat entwickelt wurde, beginne mit der Übersicht der Partnerintegrationen, um eine Verbindung für deinen bestehenden Medienpfad zu wählen.
Weiterentwickeln
- Unter Prompts für GPT-Live formulieren erfährst du, wie du den Gesprächsstil und das Delegationsverhalten gestaltest.
- Unter Delegation und Werkzeuge erfährst du, wie du Werkzeuge anbindest und die Backend-Latenz reduzierst.
- Unter Sitzungen verwalten erfährst du, wie du Kontext, Transkripte und den Lebenszyklus von Sitzungen verwaltest.
- Wähle unter Zu GPT-Live migrieren einen Migrationspfad für deinen Realtime- oder textbasierten Agenten.
- Unter Sprachagenten evaluieren erfährst du, wie du Gesprächs- und Aufgabenergebnisse testest.