GPT-Live gère la conversation orale pendant qu’un agent backend recherche des informations, utilise des outils et accomplit des tâches. Il peut écouter tout en parlant, une capacité appelée full duplex. Confier du travail au backend s’appelle la délégation : la conversation peut se poursuivre pendant l’exécution de ce travail.
Par exemple, un utilisateur peut poser une question sur une commande, ajouter une précision pendant que le backend vérifie son état, puis entendre le résultat lorsqu’il est prêt. Vous choisissez le modèle ou l’agent backend indépendamment du modèle vocal ; Realtime utilise un seul modèle pour la parole, le raisonnement et la sélection des outils.
Comprenez les deux composantes
- GPT-Live gère la conversation. Il écoute, parle et décide quand solliciter le backend. Donnez-lui un court prompt qui définit le style de conversation et les situations dans lesquelles déléguer.
- Le backend gère les tâches déléguées. Avec la délégation à Responses, utilisez un modèle Responses pris en charge. Avec la délégation au client, connectez n’importe quel modèle, harnais d’agent ou service exécuté par votre application. Le backend raisonne, utilise des outils et renvoie les résultats que GPT-Live communique ensuite. Placez les instructions détaillées, les règles métier et les workflows d’utilisation des outils dans le backend.
Votre application gère les autorisations, les confirmations, l’exécution des fonctions privées et la persistance de l’état des tâches. Interrompre la parole n’annule pas automatiquement le travail du backend. Consultez Agents vocaux pour comparer GPT-Live à Realtime et aux applications vocales reposant sur une chaîne de traitement.
Choisissez comment exécuter le backend
Commencez par la délégation à Responses si un backend géré convient à vos besoins : GPT-Live appelle le modèle Responses que vous avez configuré, fournit le contexte de la conversation et renvoie les résultats. Choisissez la délégation au client lorsque votre application doit contrôler l’exécution du backend, le contexte ou les résultats transmis à GPT-Live.
Consultez Choisissez un mode de délégation pour comparer les modes et connaître les détails de configuration. Choisissez le mode lors de la création de la session ; pour en changer, démarrez une nouvelle session.
Connectez votre première session
Commencez par le guide de démarrage rapide de GPT-Live avec WebRTC. Son exemple de code pour le navigateur et le serveur connecte l’entrée du microphone et la sortie des haut-parleurs, avec un backend Responses capable d’effectuer des recherches web.
Vous avez besoin d’un microphone, d’une page ouverte dans le navigateur et servie via HTTPS ou localhost, ainsi que d’un serveur de confiance disposant d’une clé API de projet OpenAI. Conservez la clé sur le serveur.
- Rédigez un court prompt de conversation qui indique à GPT-Live quand solliciter le backend.
- Suivez le guide de démarrage rapide pour connecter le microphone, la lecture audio et le canal d’événements du navigateur. Votre serveur crée la session et échange l’offre de connexion du navigateur contre une réponse.
- Attendez
session.started, puis parlez et écoutez la réponse. Posez une question qui nécessite des informations à jour pour essayer le backend de recherche web. - Terminez la conversation et fermez la session pour récupérer les données d’utilisation finales et libérer la connexion.
Vérifiez à la fois la conversation orale et le résultat du backend. Un événement de démarrage de session confirme le démarrage ; écouter une réponse et vérifier le résultat de recherche permet de valider des parties distinctes de l’application.
Les sessions vocales GPT-Live sont facturées à la durée, par seconde. Consultez les tarifs du modèle pour connaître le tarif en vigueur. L’utilisation du modèle backend et des outils est facturée séparément. Consultez Optimisation des coûts pour comprendre le calcul de l’utilisation et découvrir comment réduire les coûts.
Choisissez une connexion
- WebRTC pour les applications vocales dans le navigateur. Les pistes multimédias transportent l’audio ; un canal de données transporte les événements JSON.
- WebSockets pour les intégrations audio côté serveur. Le socket principal transporte l’audio et les événements de contrôle.
- Contrôles côté serveur pour permettre au backend d’accéder à une session existante. Une connexion auxiliaire transporte les événements, tandis que l’audio reste sur la connexion principale.
- Téléphonie et SIP pour les options d’intégration téléphonique et les recommandations propres aux fournisseurs.
Intégrations partenaires
Pour les applications créées avec LiveKit, Twilio, Telnyx ou Daily/Pipecat, commencez par la vue d’ensemble des intégrations partenaires pour choisir une connexion adaptée à votre circuit multimédia existant.
Poursuivez le développement
- Définissez le style de conversation et le comportement de délégation à l’aide du guide Conception de prompts pour GPT-Live.
- Connectez des outils et réduisez la latence du backend à l’aide du guide Délégation et outils.
- Gérez le contexte, les transcriptions et le cycle de vie des sessions à l’aide du guide Gestion des sessions.
- Choisissez une voie de migration pour votre agent Realtime ou textuel dans le guide Migrez vers GPT-Live.
- Testez les résultats des conversations et des tâches à l’aide du guide Évaluation des agents vocaux.