For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

Criação de prompts para modelos Realtime

Crie e teste prompts para modelos de voz Realtime.

Escolha o modelo Realtime que você está usando no desenvolvimento. Para o GPT-Live, consulte Criação de prompts para o GPT-Live.

gpt-realtime-2 é nosso modelo de voz com raciocínio mais avançado para aplicações de fala para fala com baixa latência. Ele pode pensar antes de falar, seguir instruções com mais confiabilidade, usar uma janela de contexto maior e chamar ferramentas com mais precisão do que os modelos anteriores de tempo real.

Para aproveitar essas melhorias, crie prompts com objetivos mais claros. Defina explicitamente as responsabilidades do assistente, os pontos de decisão, o comportamento de chamada de ferramentas e os mecanismos de proteção: o que ele deve fazer, quando deve fazer e o que deve evitar.

Comece de forma simples. Não sobrecarregue o prompt logo de início. Comece com um prompt mínimo, execute avaliações e só então adicione instruções para os comportamentos que falharem nos testes.

Escolha um modelo

Modelo Quando usar Foco na criação de prompts
gpt-realtime-2

Você precisa do melhor desempenho em raciocínio, uso de ferramentas e cumprimento de instruções em tempo real.

Ajuste o esforço de raciocínio, os preâmbulos, as políticas de uso de ferramentas, a captura exata de entidades e o estado em sessões longas.

gpt-realtime-1.5Você precisa de um modelo de fala para fala rápido e confiável, sem raciocínio.

Siga a estrutura básica de prompts em tempo real e teste comportamentos sensíveis à latência.

Guia de criação de prompts para o Realtime 2.0

Use gpt-realtime-2 quando o agente de voz precisar de recursos mais avançados de raciocínio, seleção de ferramentas, tratamento exato de entidades ou manutenção de estado em sessões longas. Comece com reasoning.effort: "low", teste o comportamento padrão dos preâmbulos e defina claramente quando exigir confirmação antes de ações de escrita.

O que mudou no Realtime 2

Crie prompts para o Realtime 2 como um agente de voz com raciocínio, não como um bot de voz básico.

MudançaO que isso significa para os prompts
RaciocínioPermita que o modelo raciocine internamente em tarefas complexas antes de falar ou chamar ferramentas. Use preâmbulos para evitar silêncios desconfortáveis ou falas desnecessárias.
A precisão do prompt é ainda mais importanteSubstitua orientações genéricas como "seja prestativo" por regras claras de acionamento, ação e exceção: quando agir, o que fazer e quando não fazer.
Conflitos entre instruções têm um custo maiorRemova regras sobrepostas com always, never, only e must, a menos que sejam realmente necessárias. Defina a prioridade quando houver conflito entre regras.
É mais fácil orientar o comportamento no uso de ferramentasEspecifique quando o assistente deve agir imediatamente, pedir informações que faltam, confirmar detalhes que exigem alta precisão, tentar novamente após uma falha ou escalonar o caso.
Os preâmbulos são um comportamento de primeira classeO modelo pode falar breves atualizações antes de processos mais longos de raciocínio ou uso de ferramentas. Oriente quando os preâmbulos devem aparecer, quão curtos devem ser e quando omiti-los.
Janela de contexto ampliadagpt-realtime-2 amplia a janela de contexto em tempo real de 32 mil para 128 mil tokens, tornando-o mais adequado para sessões longas e prompts de sistema maiores.

Os preâmbulos não são a cadeia de pensamento oculta. São breves atualizações faladas, como "Vou verificar esse pedido agora." Não peça ao modelo que revele seu raciocínio privado.

Use seções curtas com títulos. O modelo deve conseguir encontrar rapidamente as instruções relevantes.

# Role and Objective

# Personality and Tone

# Language

# Reasoning

# Message Channels

# Preambles

# Verbosity

# Tools

# Unclear Audio

# Entity Capture

# Long Context Behavior

# Escalation

Nem todo caso de uso precisa de todas as seções. Adicione as seções relevantes para o seu produto.

Defina o esforço de raciocínio

gpt-realtime-2 pode oferecer um raciocínio mais profundo em troca de maior latência. Use o menor nível de raciocínio que ainda dê ao assistente inteligência suficiente para o fluxo de trabalho.

Comece com low para a maioria dos agentes de voz em produção. Aumente ou diminua o nível conforme a complexidade da tarefa, a tolerância à latência e o custo de uma falha.

EsforçoQuando usarExemplo
minimalA menor latência possível é a prioridade e a tarefa é simples.Comandos de casa inteligente, temporizadores, consultas simples ao calendário.
lowVocê precisa de respostas rápidas e raciocínio básico.Atendimento ao cliente, consulta de pedidos, perguntas simples sobre políticas.
mediumO assistente precisa raciocinar para realizar tarefas com várias etapas.Suporte técnico, diagnósticos, roteamento complexo.
highUm raciocínio mais profundo melhora significativamente as chances de sucesso.Fluxos de trabalho que exigem alta precisão, decisões de escalonamento, tarefas com restrições.
xhighO raciocínio máximo compensa a latência e o custo adicionais.Planejamento complexo, triagem crítica, orquestração de ferramentas em situações de alto risco.

Além da configuração da API, oriente o modelo sobre quando e quanto raciocinar.

## Reasoning

- For direct answers, simple lookups, and short confirmations, respond quickly and do not reason.
- For multi-step tasks, tool decisions, troubleshooting, or escalation, reason before acting.
- Do not perform extended reasoning when the user's audio is unclear; ask for clarification instead.

Use preâmbulos com propósito

Preâmbulos são breves atualizações faladas que mantêm a sensação de que o agente de voz está respondendo enquanto raciocina, consulta informações ou chama uma ferramenta. Quando bem usados, tranquilizam o usuário ao mostrar que o assistente está trabalhando. Quando mal usados, tornam-se falas desnecessárias e aumentam a latência percebida.

gpt-realtime-2 gera preâmbulos por padrão. Comece testando o comportamento padrão. Se ele não corresponder à experiência desejada para o seu produto, ajuste-o explicitamente.

Linha do tempo da geração e reprodução de preâmbulos

## Preambles

Use short preambles only when they help the user understand that work is happening.

### When to use a preamble

Use a preamble when:

- you are about to call a tool that may take noticeable time;
- you need to reason through a multi-step request;
- you are checking records, availability, account state, or policy details;
- you are preparing an escalation or handoff;
- silence would make the assistant feel unresponsive.

When a preamble is needed, output it immediately before substantive reasoning or tool use.

### When to not use a preamble

Do not use a preamble when:

- the answer is direct and can be given immediately;
- the user is only confirming, correcting, or declining something;
- the audio is unclear and you need clarification;
- the latest audio is silence, background noise, hold music, TV audio, or side conversation;
- the tool call is lightweight and the user would not benefit from an update.

### Preamble style

When using a preamble:

- keep it natural, calm, and concise;
- vary the wording across turns;
- describe the action, not the internal reasoning;
- avoid filler.

Avoid phrases like:

- "Let me think..."
- "Hmm..."
- "One moment while I process that..."
- "I am now going to access the tool..."

### Preamble length

Use one short sentence.

Do not exceed two short sentences unless the user needs an explanation before a high-impact action.

### Prefer

- "I'll check that order now."
- "I'll look up your appointment details."
- "I'll verify that before we make any changes."
- "I'll check the policy and then give you the next step."
- "I'll pull that up so we can make sure it's the right account."

### Avoid

- "Let me think about that for a second."
- "Please wait while I process your request."
- "I'm going to use my tools now."
- "Interesting question. I will reason through this carefully."

Controle o tamanho das respostas

gpt-realtime-2 segue melhor as orientações de tamanho quando o prompt especifica o nível de detalhe para cada tipo de tarefa. Em vez de dizer ao modelo "seja conciso", defina o que significa ser conciso no contexto: respostas diretas, resultados de ferramentas, solução de problemas, comparações e escalonamentos podem exigir respostas de tamanhos diferentes.

## Verbosity

- Direct answers: Use 1-2 short sentences.
- Clarifying questions: Ask one question at a time.
- Tool results: Summarize the result first, then give only the next useful action.
- Product or option comparisons: Include key differences, tradeoffs, and who each option fits.
- Troubleshooting: Give one step at a time unless the user asks for the full procedure.
- Escalations: Briefly explain why escalation is needed and what will happen next.

Exemplo:

Usuário: Qual plano devo escolher?

Assistente: Se você quer o menor custo, escolha o Basic. Se precisa de permissões de equipe e faturamento compartilhado, escolha o Pro. Se a revisão de conformidade ou os controles administrativos forem importantes, escolha o Empresas.

Defina o comportamento das ferramentas

gpt-realtime-2 tem melhor desempenho em chamadas de ferramentas, mas o comportamento ainda depende de como o prompt e as especificações das ferramentas são definidos. Se o prompt não definir quando agir, perguntar, confirmar ou se recuperar de falhas, o assistente poderá chamar ferramentas cedo demais, fazer perguntas desnecessárias ou repetir chamadas que falharam.

Defina o grau de proatividade nas chamadas de ferramentas

Uma proatividade alta funciona bem para ações somente leitura e de baixo risco. Uma proatividade baixa é melhor quando as ferramentas modificam dados, geram efeitos externos ou dependem de identificadores exatos.

Tipo de ferramentaComportamento padrão
Consulta somente leitura e de baixo riscoChame a ferramenta quando a intenção e os campos obrigatórios estiverem claros.
Somente leitura com identificador exatoConfirme o identificador antes da consulta.
Comunicação visível ao usuárioPrepare um rascunho ou resumo antes de enviar.
Alterações na contaConfirme antes de chamar a ferramenta.
Compras, cancelamentos, pagamentosConfirme o valor, o alvo da ação e a consequência antes de chamar a ferramenta.
Ações irreversíveis ou de alto impactoConfirme explicitamente e ofereça encaminhamento quando apropriado.

Use esse padrão equilibrado quando houver uma combinação de ações de leitura e gravação. Adapte-o ao seu caso de uso.

## Tools

Use only the tools explicitly provided in the current tool list. Do not invent, assume, simulate, or rename tools.

For read-only tools:

- Call the tool when the user's intent is clear and all required fields are available.
- Do not ask for confirmation unless the lookup depends on a high-precision identifier or there is meaningful risk of using the wrong record.
- Ask a clarification question only if a required field is missing, ambiguous, or conflicting.

For write tools or external actions:

- Summarize the intended action before calling the tool.
- Include the key consequence, such as what will be changed, sent, canceled, ordered, or charged.
- Ask for confirmation.
- Do not call the tool until the user clearly confirms.

For exact identifiers:

- Treat order IDs, tracking numbers, account numbers, confirmation codes, phone numbers, and email addresses as high precision.
- Normalize only when the field type is clear.
- Confirm the final value before account-specific lookups, validation, or write actions.

After tool calls:

- Only say an action was completed after the tool call succeeds.
- If the tool fails, explain the failure briefly, avoid raw errors, and give the user a clear next step.

Exemplo de alto risco:

Usuário: Cobre o saldo restante no meu cartão.

Ruim:

Assistente: Fiz a cobrança no seu cartão.

Bom:

Assistente: Só para confirmar, você quer que eu cobre $248.16 no cartão cadastrado para quitar o saldo restante. Posso prosseguir?

Recupere-se de falhas nas ferramentas

Falhas nas ferramentas fazem parte da conversa. Uma boa recuperação deve explicar o que aconteceu e indicar ao usuário um próximo passo claro.

Não trate todas as falhas da mesma forma. O comportamento de recuperação deve depender do tipo de ferramenta, do modo de falha e do impacto para o usuário. Algumas falhas devem ser tratadas silenciosamente com uma nova tentativa. Outras exigem pedir ao usuário que esclareça algo, corrija um identificador, confirme uma nova ação ou escolha um caminho alternativo.

## Tool Failures

If a tool call fails:

1. Briefly explain what failed in user-friendly language.
2. Do not blame the user or expose raw tool errors.
3. If the failure may be due to an exact identifier, read back the value used and ask the user to correct it.
4. If the failure may be temporary, offer to retry once.
5. If the same failure happens repeatedly, offer an alternate path or escalation.

Do not repeatedly call the same tool with the same arguments after failure.

Do not ask for a different identifier until you have first checked whether the captured value was correct.

Ruim:

Assistente: Algo deu errado.

Bom:

Assistente: Não encontrei uma correspondência para O R D traço 3 1 2 5 B 2 3. Entendi alguma parte errado?

Mantenha a disponibilidade das ferramentas sincronizada

Os modelos Realtime são proativos em ajudar. Se o prompt mencionar uma ferramenta que não está realmente disponível, ou se a lista de ferramentas não corresponder ao prompt, o modelo poderá inventar um nome de ferramenta ou fingir que concluiu a ação.

Por exemplo, se o prompt fizer referência a lookup_order, mas a ferramenta fornecida se chamar search_orders, o modelo poderá chamar o nome errado ou simular a ação.

## Tool Availability

Use only the tools that are explicitly provided in the current tool list.

Do not invent, assume, or simulate tools. If a tool is mentioned in the instructions but is not present in the tool list, treat it as unavailable.

If the user requests an action that requires an unavailable tool:

1. Do not pretend to complete the action.
2. Briefly explain that the tool is not available.
3. Offer the closest supported next step.

Only say an action was completed after the relevant tool call succeeds.

Use o metaprompt de auditoria de prompts no apêndice para revisar os prompts de produção em busca de contradições, ferramentas ausentes e instruções frágeis.

Lide com silêncio e áudio de fundo

Agentes de voz tendem a responder por padrão. Em produção, eles costumam ouvir áudio que não deveria receber uma resposta falada, como silêncio, ruído de fundo, música de espera, áudio de TV ou conversas paralelas.

Use uma ferramenta de espera sem operação quando o assistente precisar ficar em silêncio e continuar ouvindo. A ferramenta dá ao modelo uma ação válida que não envolve fala, em vez de fazê-lo dizer coisas como "Estou aqui" ou "Não entendi".

Design da ferramenta:

{
  "name": "wait_for_user",
  "description": "Call this when the latest audio does not need a spoken response, such as silence, background noise, hold music, TV audio, side conversation, or speech not addressed to the assistant. This tool helps end the turn without a spoken reply.",
  "parameters": {
    "type": "object",
    "properties": {},
    "required": []
  }
}

Combine-a com instruções no prompt:

## Handling Silence and Background Noise

If the latest audio is silence, background noise, hold music, TV audio, side conversation, or speech not addressed to you, call `wait_for_user`.

Do not respond conversationally after calling this tool.

Do not say "I'm here," "I didn't catch that," "Take your time," or "Let me know when you're ready."

Resume normal responses only when the user clearly addresses you or asks for help.

Use isso para áudio que não é dirigido ao assistente, não para solicitações pouco claras do usuário. Se o usuário estiver claramente falando com o assistente, mas o conteúdo for ininteligível, peça esclarecimentos.

Use os canais de mensagem de forma intencional

gpt-realtime-2 pode produzir mensagens intermediárias visíveis ao usuário no canal commentary e respostas finais voltadas ao usuário no canal final. Use instruções específicas para cada canal quando o comportamento depender de onde aparece.

CanalVisível ao usuário?Usado para
commentarySimPreâmbulos e chamadas de ferramentas.
finalSimMensagem final voltada ao usuário.

Por exemplo, as chamadas de ferramentas ocorrem no canal commentary. Se você quiser que o assistente diga algo antes, durante ou depois de usar ferramentas, especifique esse comportamento em relação ao canal commentary.

Before calling tools in the commentary channel, briefly tell the user what you are doing.

gpt-realtime-2 pode emitir várias fases de resposta em um único turno. Na saída da API, essa distinção é representada pelo evento response.done, que inclui um valor de phase indicando se o conteúdo é commentary ou a resposta final.

Você pode usar esse campo para tratar cada fase de forma diferente no seu aplicativo. Por exemplo, commentary pode ser reproduzido ou exibido como uma breve atualização intermediária, enquanto final_answer pode ser reservado para a resposta concluída do assistente.

response.output[0].phase: "commentary"
response.output[1].phase: "final_answer"

Lide com áudio pouco claro

O modelo só deve agir com base em áudio que consiga entender com confiança. Se o áudio não estiver claro, o modelo deve fazer uma pergunta breve para pedir esclarecimentos, em vez de tentar adivinhar.

Não deixe o modelo inferir palavras ausentes, chamar ferramentas, capturar entidades, gerar preâmbulos ou gastar tempo de raciocínio interno tentando reconstruir o que o usuário pode ter dito.

## Unclear Audio

- Only respond to clear audio or text.
- If the user's audio is not clear, ask for clarification using a short English phrase such as "Sorry, could you repeat that clearly?"
- Don't repeat the same unclear-audio clarification twice.
- Treat audio as unclear if it is ambiguous, noisy, silent, unintelligible, partially cut off, or if you are unsure of the exact words the user said.
- Do not guess what the user meant from unclear audio.
- Do not reason when the audio is unclear.
- Do not provide a preamble or call tools in the commentary channel when the audio is unclear.

Exemplo:

Áudio do usuário: "Consulte o pedido três um-" [interrompido]

Ruim:

Assistente: Vou consultar o pedido 31 agora.

Bom:

Assistente: Ouvi apenas parte do número do pedido. Você poderia repetir dígito por dígito?

Capture entidades com exatidão

Muitos fluxos de trabalho em tempo real dependem de valores exatos: IDs de pedidos, códigos de rastreamento, endereços de e-mail, códigos de confirmação, números de contas, números de sinistros, IDs de chamados, referências de suporte e números de telefone.

A interação por voz dificulta isso. Os usuários falam rápido, agrupam números de formas diferentes, soletram partes dos valores, usam expressões de preenchimento, corrigem o que disseram no meio da fala ou pronunciam caracteres com sons parecidos. Um único dígito errado pode fazer uma consulta falhar ou retornar a conta errada.

Capture entidades com cautela. Colete um valor por vez, normalize apenas o que estiver claro, confirme valores que exigem alta precisão antes de chamar ferramentas e permita retomar o fluxo após cada correção.

Colete uma entidade por vez

Quando um fluxo de trabalho precisar de vários valores, colete um por vez. Isso evita que os campos se misturem, especialmente em conversas por voz.

## Entity Collection Order

Collect required values one at a time.

- Ask for only the next missing value.
- Do not ask for multiple values in the same turn.
- Before asking, check whether the value was already provided earlier in the conversation or the session.
- If a possible value already exists, confirm it with the user before using it.

Example:

"I see tracking number ABC-54321 from earlier. Should I use that one, or do you have a different tracking number?"

Do not call tools until the current value has been collected, validated, and confirmed.

Lide com caracteres soletrados

Use esta abordagem quando os usuários soletrarem IDs, códigos, nomes ou endereços de e-mail, um caractere por vez. A forma falada é a entrada, não o valor final.

## Spelled-Out Characters

When a user dictates an ID, code, or email character by character, treat the spoken sequence as one compact value. Preserve explicitly spoken separators like dash, dot, underscore, slash, or plus; otherwise do not add spaces or separators.

Examples:

- "A B C one two three" -> "ABC123"
- "B C dash nine eight seven" -> "BC-987"
- "J O H N at example dot com" -> "john@example.com"

Do not insert spaces between spelled-out characters unless the user explicitly says the value contains spaces.

Normalize números falados com cuidado

No caso de identificadores numéricos, os usuários podem dizer os dígitos individualmente, agrupá-los ou falar números por extenso. Se o campo esperar uma sequência numérica contínua, converta em dígitos os números falados que estiverem claros.

## Spoken Number Handling

Convert spoken numbers into digits when collecting numeric identifiers.

Examples:

- "one two three four" -> "1234"
- "one twenty three" -> "123"
- "one nineteen" -> "119"
- "ninety nine eleven" -> "9911"
- "nine thousand nine hundred eleven" -> "9911"

If multiple interpretations are plausible, ask the user to clarify before using the value.

Example:

"I heard either 119 or 1-19. Could you repeat the number digit by digit?"

Confirme os identificadores exatos antes de chamar ferramentas

IDs de pedidos, códigos de rastreamento, números de contas, números de sinistros, códigos de confirmação e identificadores semelhantes são campos que exigem alta precisão. Confirme-os antes de usá-los em uma chamada de ferramenta.

No caso de identificadores numéricos, repita o valor dígito por dígito. Ler o valor como um número inteiro pode ocultar erros.

Exemplo:

Assistente: Só para confirmar, ouvi 8... 3... 5... 2... 1. Está certo?

Se o usuário corrigir um caractere ou dígito, repita o valor corrigido completo antes de chamar a ferramenta.

Exemplo:

Assistente: Entendi. Tenho aqui 8... 3... 5... 7... 1. Está correto?

## Exact Identifier Confirmation

Before calling tools with high-precision identifiers:

- Confirm the final normalized value with the user.
- Read numeric identifiers back digit by digit.
- Do not use guessed, partial, or ambiguous values.
- If the user corrects the value, repeat the full corrected value before calling the tool.

Confirme e-mails caractere por caractere

Endereços de e-mail são valores importantes. Pontos, hífens, sublinhados, letras repetidas e nomes com sons parecidos podem causar falhas na consulta de contas ou fazer com que mensagens sejam enviadas para o endereço errado.

Peça ao usuário para soletrar o endereço de e-mail:

Assistente: Você poderia soletrar o endereço de e-mail caractere por caractere para eu ter certeza de que anotei tudo corretamente?

Ao repetir o endereço, confirme o valor final exato:

Assistente: Só para confirmar, é c-h-e-n arroba example ponto com, certo?

## Email Confirmation

Email addresses must be captured exactly.

If the user says the email naturally without spelling it out, ask them to repeat it character by character.

Example:

"Could you spell the email address character by character so I can make sure I have it exactly right?"

When reading an email back, confirm the exact final email address.

Example:

"Just to confirm, that is c-h-e-n at example dot com, right?"

Fluxo de trabalho para coleta de entidades

Evite armadilhas da interpretação literal de instruções

gpt-realtime-2 segue instruções de forma mais literal do que os modelos anteriores de tempo real. Prompts que funcionavam bem em modelos mais antigos podem precisar de ajustes.

Use uma linguagem precisa. O modelo pode priorizar a redação exata de uma instrução em vez do comportamento mais amplo que você pretendia. Regras abrangentes ou rígidas podem dominar o comportamento do assistente de maneiras surpreendentes, especialmente quando várias regras se sobrepõem.

Tenha cuidado com palavras que impõem restrições, como must, only, never e always. Use-as quando o comportamento for realmente obrigatório, não apenas para dar ênfase. O uso excessivo de restrições rígidas pode tornar o assistente inflexível, cauteloso demais ou incapaz de lidar com exceções razoáveis.

Prefira um escopo preciso:

For write actions that modify user data, ask for confirmation before calling the tool.

Evite um escopo amplo:

Always ask for confirmation before doing anything.

A versão ampla pode causar confirmações desnecessárias antes de consultas inofensivas de somente leitura, como verificar o status de um pedido, consultar a disponibilidade ou ler informações da conta.

Exemplo de interpretação literal

Recomendações gerais para criação de prompts:

  • Prefira instruções explícitas a intenções implícitas.
  • Evite palavras que imponham restrições desnecessárias, a menos que o comportamento realmente precise ser rígido.
  • Reduza ao mínimo as orientações contraditórias.
  • Tenha cautela com instruções de prioridade em camadas ou que entrem em conflito.
  • Teste os prompts de forma incremental. Pequenas mudanças na redação podem ter grandes efeitos no comportamento.
  • Ao migrar de modelos anteriores de tempo real, espere ter que reestruturar alguns prompts para obter os melhores resultados.

Controle o idioma e o sotaque separadamente

O idioma e o sotaque devem ser controlados separadamente.

O sotaque do usuário não é o mesmo que o idioma em que ele deseja conversar. Um usuário pode falar inglês com sotaque de hindi, espanhol, francês ou mandarim e ainda assim esperar respostas em inglês.

Evite instruções amplas sobre idioma, como:

Mirror the user.
Respond naturally in the user's language.
Switch languages when appropriate.
Sound local.
Adapt to the user's accent.

Essas instruções são amplas demais. O modelo pode interpretar o sotaque, expressões de preenchimento, sinais verbais de escuta ou palavras estrangeiras isoladas como motivos para mudar de idioma.

Política para o idioma inglês

## Language

English is the default response language.

- Do not infer language from accent alone.
- Ignore short filler sounds, backchannels, and isolated foreign words for language detection.
- Only switch languages if the user explicitly asks or provides a substantive utterance in another language.
- If language confidence is low, ask a short clarification instead of guessing.
- Keep preambles, spoken bridges, tool-related messages, and final answers in the same language.
- Accent adaptation must not change the response language.

Política multilíngue

## Language

Default to English unless the user clearly uses another language.

Switch languages only when:

- the user explicitly asks to use another language;
- the user provides a substantive utterance in another language. A substantive utterance means the user gives a complete request, question, or correction in another language, not just a greeting, name, address, filler word, or borrowed phrase.

Do not switch languages based on:

- accent;
- pronunciation;
- filler words;
- short backchannels;
- names;
- addresses;
- isolated foreign words.

If uncertain, ask:

"Would you like me to continue in English or [LANGUAGE]?"

Controle de sotaque

gpt-realtime-2 pode seguir instruções de sotaque com mais firmeza, mas prompts vagos sobre sotaque podem causar desvios ou mudanças indesejadas de idioma.

Prompts de controle de sotaque funcionam melhor quando especificam:

  • o sotaque desejado;
  • quais características devem permanecer estáveis;
  • o ritmo, a acentuação e a prosódia desejados;
  • se a adaptação do sotaque deve afetar a escolha do idioma.

Em vez de:

Sound Australian.

Use:

## Accent

Speak English with a light Australian accent.

- Keep the accent stable from the first word to the last.
- Use natural Australian vowel shaping, but keep speech easy to understand.
- Do not exaggerate the accent.
- Do not change response language based on the user's accent.

Vozes personalizadas

Use Vozes personalizadas quando as vozes padrão não conseguirem atender de forma confiável aos requisitos de marca, sotaque ou personagem.

Os prompts podem orientar o sotaque, o ritmo e a maneira de falar, mas não substituem completamente o design da voz. Para casos de uso que exigem uma identidade vocal consistente da marca ou fidelidade ao sotaque, considere usar Vozes personalizadas.

As Vozes personalizadas estão disponíveis apenas para clientes aprovados. Entre em contato com a equipe responsável pela sua conta para obter acesso.

Mantenha o estado em sessões longas

O gpt-realtime-2 amplia a janela de contexto em tempo real de 32 mil para 128 mil tokens, tornando-o mais adequado para sessões longas. Para conversas bidirecionais densas, considere que 128 mil tokens equivalem a aproximadamente 1 a 2 horas de contexto de áudio bruto denso. Isso varia conforme o uso de ferramentas, o raciocínio interno, os registros inseridos e outros detalhes da sessão.

Em casos de uso com contexto longo, o gpt-realtime-2 tem melhor desempenho quando consegue distinguir quais informações são atuais, quais servem de contexto e quais devem ser ignoradas se houver conflito entre as fontes. Não dependa do modelo para inferir a prioridade das fontes a partir de uma transcrição bruta ou de um grande volume de contexto sem organização. Estruture as informações.

Use um padrão estruturado ao iniciar uma sessão com grande quantidade de contexto, como registros recuperados, histórico de conversas anteriores, políticas, resumos, anotações sobre a conta ou documentos de referência.

Migre de modelos anteriores de tempo real

Ao migrar de modelos anteriores de tempo real, trate o prompt como uma forma de definir o comportamento, não apenas como um texto a ser transferido.

  1. Use o Codex ou um modelo de raciocínio avançado para reestruturar o prompt com base nas orientações mais recentes de criação de prompts para Realtime. Inclua um link para este guia de criação de prompts para fundamentar a migração em práticas recomendadas.
  2. Defina o esforço de raciocínio como low em vez do valor padrão. Aumente-o apenas para fluxos de trabalho que exijam planejamento mais aprofundado.
  3. Revise nomes de ferramentas, parâmetros, enumerações, esquemas JSON e outras configurações para garantir que correspondam à implementação esperada.
  4. Remova exemplos desatualizados. Adicione exemplos curtos de fluxos sem erros, ambiguidades, interrupções, chamadas de ferramentas e comportamentos alternativos.
  5. Compare conversas representativas antes e depois da migração. Verifique se há regressões em relação a uma avaliação existente e documente as mudanças intencionais de comportamento.
  6. Faça uma revisão final de consistência. Confirme que o prompt distingue claramente requisitos obrigatórios, padrões, regras de ferramentas, regras de segurança e comportamentos alternativos.
  7. Execute avaliações, analise falhas representativas e refine o prompt até que os comportamentos desejados sejam confiáveis.

Próximos passos

Para o GPT-Live:

Para o Realtime: