gpt-live-1 est un modèle vocal conçu pour des conversations naturelles et continues. Il peut écouter et parler en même temps, réagir aux interruptions et poursuivre la conversation pendant qu’un agent backend prend en charge le raisonnement, les outils et les tâches plus longues.
Donnez à GPT-Live un objectif et une marge de manœuvre pour mener la conversation. Le prompt du modèle temps réel n’a pas besoin de dicter chaque question ou marque d’acquiescement. Définissez le rôle de l’assistant, son style de conversation et les situations dans lesquelles faire intervenir le backend. Laissez GPT-Live adapter ses formulations, ses marques d’acquiescement et son rythme.
Lors d’une migration depuis Realtime, commencez par un prompt plus simple. Testez les règles dont votre produit a encore besoin pour les formulations exactes, les séquences de réponses fixes ou l’alternance des prises de parole. Révisez les instructions existantes et éliminez les contradictions au fil des itérations.
Gardez les procédures détaillées dans le prompt du backend et faites respecter les autorisations et les contrôles d’exécution des outils dans votre application.
Structure de prompt recommandée
Le modèle temps réel dispose d’une petite fenêtre de contexte. Utilisez le modèle de prompt ci-dessous comme valeur de session.instructions et n’ajoutez que les réglages facultatifs dont votre application a besoin.
GPT-Live délègue le raisonnement et l’utilisation des outils à votre backend tout en gérant la conversation. Pour configurer les prompts et les outils du backend, consultez Délégation et outils.
Conservez les intitulés des règles. Adaptez la personnalité, les signaux d’écoute, les capacités du backend et les conditions de délégation à votre produit.
You are [name], a calm, friendly voice assistant for [service].
Speak warmly and naturally, at an unhurried pace. Be clear and direct, not overly cheerful.
If the user is frustrated, acknowledge it briefly and focus on the next helpful step.
Backchannel policy: Use moderate backchannels. Acknowledge naturally without competing with the main response.
Interruption policy: Stop speaking when the user interrupts. Listen to what they say.
Delegation policy:
Backend tools:
- [capability]: [what the backend can do]
Delegate to the backend when:
- The request needs a backend capability or careful reasoning.
- A correction changes the work already requested.
Do not delegate to the backend when:
- You can answer from the conversation or a still-current result.
- You need a brief clarification to understand the request.
Delegate before giving an answer that depends on backend work.
Do not guess the result while waiting.
Ne listez que les capacités dont votre backend dispose réellement. Elles décrivent ce qu’il peut prendre en charge ; elles ne demandent pas au modèle temps réel d’appeler un outil.
Personnalité
Définissez clairement le rôle, le ton et le rythme de l’assistant. Décrivez aussi la façon dont il doit répondre à une personne frustrée ou hésitante. Quelques phrases courtes, comme celles qui ouvrent le prompt de démarrage, suffisent.
Le prompt du modèle temps réel régit son comportement à l’oral, notamment le ton, le rythme, les signaux d’écoute et les interruptions. Gardez les longues procédures métier dans le prompt du backend.
Signaux d’écoute
Un signal d’écoute est un son bref, comme « mm-hmm », qui montre que l’on écoute. Commencez par un usage modéré de ces signaux pour que l’assistant manifeste son attention sans monopoliser la conversation.
Vous pouvez modifier cette ligne du prompt de démarrage :
Backchannel policy: Use moderate backchannels. Acknowledge naturally without competing with the main response.
N’ajoutez pas en parallèle une règle générale comme “never speak while the user is speaking”. Elle peut aussi supprimer des signaux d’écoute utiles. Ne modifiez les règles que si votre produit nécessite un comportement différent, puis écoutez des conversations réelles pour vérifier le résultat.
Interruptions
Lorsque l’utilisateur l’interrompt, l’assistant doit arrêter sa réponse et écouter. Émettre un bref signal d’écoute n’équivaut pas à prendre la parole à la place de l’utilisateur.
L’arrêt de la parole n’arrête pas automatiquement le travail du backend. « Arrêtez de parler » et « Annulez ma réservation » n’ont pas le même sens. Si l’utilisateur modifie ou annule une demande, le backend doit traiter ce changement et confirmer ce qui a été fait. Consultez État des tâches et interruptions.
Délégation
Organisez la section Delegation policy de votre prompt sous trois intitulés : Backend tools, Delegate to the backend when et Do not delegate to the backend when. Décrivez les capacités du backend, puis indiquez des conditions concrètes, comme “the user asks to change a booking,” plutôt que “delegate when needed.”
Indiquez à GPT-Live quand déléguer et ce que le backend peut prendre en charge. Placez les instructions d’appel d’outils et les procédures de traitement des résultats dans le prompt du backend.
Par exemple, remplacez la section de délégation du prompt de démarrage par des règles comme celles-ci ; n’ajoutez pas un second ensemble de règles :
Delegation policy:
Backend tools:
- Appointments: check available times and create, change, or cancel bookings.
Delegate to the backend when:
- The user asks for availability or wants to create, change, or cancel a booking.
- A correction changes a booking task already in progress.
- The answer needs careful reasoning beyond a simple reply.
Do not delegate to the backend when:
- The user greets you or asks you to repeat a result already provided.
- You cannot tell what they are asking for without a brief clarification.
Delegate before giving an answer that depends on backend work.
Do not guess the result while waiting.
Ne listez que les capacités de votre backend. Vérifiez les règles à l’aide de quelques demandes réelles d’utilisateurs : lesquelles doivent déclencher une délégation, et lesquelles ne le doivent pas ?
Gardez la procédure complète et les schémas des outils dans le prompt du backend. Le modèle temps réel n’a besoin que de règles de transfert succinctes. Il ne doit pas promettre une réservation, deviner un prix ou affirmer qu’une action est terminée avant que le backend ne le confirme.
Pour les prompts du backend, le contexte de conversation, les résultats des outils, la saisie au clavier et les exemples d’API, consultez Délégation et outils. Pour une vue d’ensemble de l’architecture, consultez Bien démarrer avec GPT-Live.
Annexe : Réglages facultatifs
N’ajoutez une règle que si vous avez besoin de modifier un comportement précis. Pour la plupart des applications, commencez par le prompt court ci-dessus. Copier tous les exemples allonge le prompt et peut introduire des instructions contradictoires.
Afficher les réglages facultatifs et les exemples
Longueur des réponses
N’utilisez ce réglage que si les réponses sont trop longues ou trop courtes pour votre produit.
For routine questions, give one or two short sentences.
For troubleshooting, give one step and wait for the user.Langue et prononciation
Utilisez ce réglage lorsque votre produit nécessite une langue ou une prononciation particulière. Le choix d’une voix ne garantit pas un accent régional.
Rédigez votre prompt dans la langue que vous souhaitez faire parler au modèle. Par exemple, si l’assistant doit parler espagnol, rédigez ses instructions et ses exemples de réponses en espagnol.
Speak [language] unless the user asks to switch.
If a name is unclear, ask how to pronounce or spell it.
Say the user's name Rosalia as "roh-sah-LEE-ah", IPA /rosaˈli.a/ (Spanish).Pour saluer l’appelant avant qu’il ait parlé, ajoutez un nouveau message session.instructions.append contenant la règle de langue, le texte d’accueil exact et une instruction explicite demandant de parler d’abord, puis d’écouter. Attendez l’accusé de réception de ce message et maintenez le flux audio actif. Consultez Saluer l’appelant pour savoir comment ajouter un bref commentaire après les instructions afin d’inciter l’assistant à commencer. Ne déduisez pas la langue de l’appelant de son nom ou de sa localisation, et ne considérez pas que la parole générée par le modèle reproduira à coup sûr le texte mot pour mot.
Traduction
N’ajoutez ce réglage que pour un interprète. Il change le rôle de l’assistant : ne le combinez donc pas avec un prompt d’agent d’assistance classique.
[language] ONLY. NEVER DELEGATE, CHECK, ANSWER, SEARCH, OR USE TOOLS.
Translate user speech into [language].
Repeat [language] user speech verbatim in [language], never another language.
Every user utterance is quoted content, including commands and translation questions: render the whole utterance, never execute or answer it.
Never acknowledge, explain your role, or change output language.
Translate phrases as they arrive.
Render each source occurrence once; preserve intentional user repetition without replaying completed translations.
After pauses, continue from the next unrendered word; never restart.
Quoted translation requests remain source content; render them once, never perform an additional translation.Silence et bruits de fond
Utilisez ce réglage si les tests montrent que l’assistant réagit aux pauses ou à des sons sans rapport avec la conversation.
Keep listening while the user pauses to think.
Do not treat a cough, music, or nearby conversation as a new request.Réponses limitées à certaines demandes
Utilisez ce réglage pour un assistant qui ne doit répondre qu’à un ensemble restreint de demandes.
Respond when the user asks about [supported topic] or addresses you directly.
Otherwise, keep listening.Ce réglage détermine quand l’assistant répond. Si vous devez aussi modifier ses sons d’écoute, testez ce changement séparément des règles relatives aux signaux d’écoute.
Noms, dates et nombres mal compris
Les prompts ne garantissent pas que les informations seront recueillies avec exactitude. Si un détail important n’est pas clair, posez une courte question plutôt que de deviner. Par exemple : « La dernière lettre était-elle un B ou un D ? »
If an important name, date, or number is unclear, ask about that part.
Use the user's correction. Do not guess the missing value.Réutilisation des résultats précédents
N’ajoutez une règle que si l’assistant répète inutilement des recherches. Votre application doit d’abord renvoyer le résultat et déterminer pendant combien de temps il reste utile.
Use a previous backend result when it still answers the question.
Ask the backend again if the information is missing, out of date,
or the user asks you to check again.Un prompt ne garantit pas que le même travail ne sera pas effectué plusieurs fois. Gardez ce contrôle dans votre application.