For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Diseño de prompts para modelos Realtime

Diseña y prueba prompts para modelos de voz Realtime.

Elige el modelo Realtime con el que estás desarrollando. Para GPT-Live, consulta Diseño de prompts para GPT-Live.

gpt-realtime-2 es nuestro modelo de voz con razonamiento de última generación para aplicaciones de voz a voz de baja latencia. Puede pensar antes de hablar, seguir instrucciones de forma más confiable, usar una ventana de contexto más amplia y llamar a herramientas con mayor precisión que los modelos realtime anteriores.

Para aprovechar estas mejoras, diseña prompts con un propósito más claro. Define explícitamente las responsabilidades del asistente, los puntos de decisión, el comportamiento de las llamadas a herramientas y las medidas de protección: qué debe hacer, cuándo debe hacerlo y qué debe evitar.

Empieza por lo sencillo. No sobrecargues el prompt desde el principio. Comienza con un prompt mínimo, ejecuta evaluaciones y luego agrega instrucciones solo para los comportamientos que fallen en las pruebas.

Elige un modelo

Modelo Cuándo usarlo Aspectos clave del diseño de prompts
gpt-realtime-2

Necesitas las mejores capacidades de razonamiento, uso de herramientas y seguimiento de instrucciones en tiempo real.

Ajusta el esfuerzo de razonamiento, los preámbulos, las políticas de uso de herramientas, la captura exacta de entidades y el estado en sesiones largas.

gpt-realtime-1.5Necesitas un modelo de voz a voz rápido y confiable, sin razonamiento.

Sigue la estructura básica de los prompts para tiempo real y prueba los comportamientos sensibles a la latencia.

Guía de diseño de prompts para Realtime 2.0

Usa gpt-realtime-2 cuando el agente de voz necesite mejores capacidades de razonamiento, selección de herramientas, manejo exacto de entidades o gestión del estado en sesiones largas. Empieza con reasoning.effort: "low", prueba el comportamiento predeterminado de los preámbulos y define claramente cuándo se requiere confirmación antes de realizar acciones de escritura.

Qué cambió en Realtime 2

Diseña los prompts para Realtime 2 como un agente de voz con razonamiento, no como un bot de voz básico.

CambioQué implica para los prompts
RazonamientoPermite que el modelo razone internamente en tareas complejas antes de hablar o llamar a herramientas. Usa preámbulos para evitar silencios incómodos o frases de relleno innecesarias.
La precisión del prompt importa másReemplaza las indicaciones generales como “sé útil” por reglas claras sobre condiciones de activación, acciones y excepciones: cuándo actuar, qué hacer y cuándo no hacerlo.
Los conflictos entre instrucciones tienen un mayor costoElimina las reglas superpuestas con always, never, only y must, a menos que sean realmente necesarias. Define la prioridad cuando las reglas entren en conflicto.
Es más fácil dirigir el comportamiento al usar herramientasEspecifica cuándo el asistente debe actuar de inmediato, pedir información faltante, confirmar datos que requieren alta precisión, reintentar tras un fallo o escalar el caso.
Los preámbulos son parte fundamental del comportamientoEl modelo puede dar actualizaciones breves por voz antes de iniciar procesos más largos de razonamiento o uso de herramientas. Indica cuándo deben aparecer los preámbulos, qué tan breves deben ser y cuándo omitirlos.
Ventana de contexto ampliadagpt-realtime-2 amplía la ventana de contexto en tiempo real de 32 000 a 128 000 tokens, lo que lo hace más adecuado para sesiones largas y prompts del sistema más extensos.

Los preámbulos no son una cadena de pensamiento oculta. Son actualizaciones breves por voz, como “Voy a revisar ese pedido ahora”. No le pidas al modelo que revele su razonamiento privado.

Usa secciones breves con títulos. El modelo debe poder encontrar rápidamente las instrucciones pertinentes.

# Role and Objective

# Personality and Tone

# Language

# Reasoning

# Message Channels

# Preambles

# Verbosity

# Tools

# Unclear Audio

# Entity Capture

# Long Context Behavior

# Escalation

No todos los casos de uso necesitan todas las secciones. Agrega las que sean pertinentes para tu producto.

Configura el esfuerzo de razonamiento

gpt-realtime-2 puede ofrecer un razonamiento más profundo a cambio de una mayor latencia. Usa el nivel de razonamiento más bajo que le proporcione al asistente suficiente inteligencia para el flujo de trabajo.

Empieza con low para la mayoría de los agentes de voz en producción. Aumenta o reduce el nivel según la complejidad de la tarea, la tolerancia a la latencia y el costo de los fallos.

EsfuerzoCuándo usarloEjemplo
minimalLa prioridad es minimizar la latencia y la tarea es sencilla.Comandos para el hogar inteligente, temporizadores y consultas sencillas del calendario.
lowNecesitas respuestas rápidas y razonamiento básico.Atención al cliente, consultas de pedidos y preguntas sencillas sobre políticas.
mediumEl asistente debe razonar para resolver tareas de varios pasos.Soporte técnico, diagnósticos y enrutamiento complejo.
highUn razonamiento más profundo mejora considerablemente los resultados.Flujos de trabajo de alta precisión, decisiones sobre escalamiento y tareas con restricciones.
xhighEl razonamiento máximo justifica la latencia y el costo adicionales.Planificación compleja, clasificación de casos críticos y orquestación de herramientas en situaciones de alto riesgo.

Además de configurar la API, orienta al modelo sobre cuándo y cuánto razonar.

## Reasoning

- For direct answers, simple lookups, and short confirmations, respond quickly and do not reason.
- For multi-step tasks, tool decisions, troubleshooting, or escalation, reason before acting.
- Do not perform extended reasoning when the user's audio is unclear; ask for clarification instead.

Usa los preámbulos con un propósito claro

Los preámbulos son actualizaciones breves por voz que mantienen la sensación de que el agente responde con agilidad mientras razona, consulta información o llama a una herramienta. Bien usados, le dan al usuario la tranquilidad de saber que el asistente está trabajando. Mal usados, se convierten en relleno y aumentan la latencia percibida.

gpt-realtime-2 genera preámbulos de forma predeterminada. Empieza por probar el comportamiento predeterminado. Si no se ajusta a la experiencia de tu producto, modifícalo mediante instrucciones explícitas.

Cronología de la generación y reproducción de preámbulos

## Preambles

Use short preambles only when they help the user understand that work is happening.

### When to use a preamble

Use a preamble when:

- you are about to call a tool that may take noticeable time;
- you need to reason through a multi-step request;
- you are checking records, availability, account state, or policy details;
- you are preparing an escalation or handoff;
- silence would make the assistant feel unresponsive.

When a preamble is needed, output it immediately before substantive reasoning or tool use.

### When to not use a preamble

Do not use a preamble when:

- the answer is direct and can be given immediately;
- the user is only confirming, correcting, or declining something;
- the audio is unclear and you need clarification;
- the latest audio is silence, background noise, hold music, TV audio, or side conversation;
- the tool call is lightweight and the user would not benefit from an update.

### Preamble style

When using a preamble:

- keep it natural, calm, and concise;
- vary the wording across turns;
- describe the action, not the internal reasoning;
- avoid filler.

Avoid phrases like:

- "Let me think..."
- "Hmm..."
- "One moment while I process that..."
- "I am now going to access the tool..."

### Preamble length

Use one short sentence.

Do not exceed two short sentences unless the user needs an explanation before a high-impact action.

### Prefer

- "I'll check that order now."
- "I'll look up your appointment details."
- "I'll verify that before we make any changes."
- "I'll check the policy and then give you the next step."
- "I'll pull that up so we can make sure it's the right account."

### Avoid

- "Let me think about that for a second."
- "Please wait while I process your request."
- "I'm going to use my tools now."
- "Interesting question. I will reason through this carefully."

Controla la extensión de las respuestas

gpt-realtime-2 sigue mejor las indicaciones de extensión cuando el prompt especifica cuánto detalle dar para cada tipo de tarea. En lugar de decirle al modelo “sé conciso”, define qué significa ser conciso en cada contexto: las respuestas directas, los resultados de herramientas, la solución de problemas, las comparaciones y los escalamientos pueden requerir respuestas de distinta extensión.

## Verbosity

- Direct answers: Use 1-2 short sentences.
- Clarifying questions: Ask one question at a time.
- Tool results: Summarize the result first, then give only the next useful action.
- Product or option comparisons: Include key differences, tradeoffs, and who each option fits.
- Troubleshooting: Give one step at a time unless the user asks for the full procedure.
- Escalations: Briefly explain why escalation is needed and what will happen next.

Ejemplo:

Usuario: ¿Qué plan debería elegir?

Asistente: si buscas el menor costo, elige Basic. Si necesitas permisos de equipo y facturación compartida, elige Pro. Si la revisión de cumplimiento o los controles de administración son importantes, elige Enterprise.

Diseñar el comportamiento de las herramientas

gpt-realtime-2 es más eficaz al llamar a herramientas, pero su comportamiento sigue dependiendo del diseño del prompt y de las especificaciones de las herramientas. Si el prompt no define cuándo actuar, preguntar, confirmar o recuperarse de un error, el asistente puede llamar a herramientas demasiado pronto, hacer preguntas innecesarias o repetir llamadas fallidas.

Definir la iniciativa para llamar a herramientas

Un nivel alto de iniciativa funciona bien para acciones de solo lectura y bajo riesgo. Un nivel bajo es mejor cuando las herramientas modifican datos, producen efectos externos o dependen de identificadores exactos.

Tipo de herramientaComportamiento predeterminado
Consulta de solo lectura y bajo riesgoLlama a la herramienta cuando la intención y los campos requeridos estén claros.
Solo lectura con identificador exactoConfirma el identificador antes de la consulta.
Comunicación visible para el usuarioPrepara un borrador o un resumen antes de enviar.
Cambios en la cuentaConfirma antes de llamar a la herramienta.
Compras, cancelaciones, pagosConfirma el monto, el destino y la consecuencia antes de llamar a la herramienta.
Acciones irreversibles o de alto impactoConfirma de forma explícita y ofrece escalar el caso cuando corresponda.

Usa este comportamiento predeterminado equilibrado cuando combines acciones de lectura y escritura. Adáptalo a tu caso de uso.

## Tools

Use only the tools explicitly provided in the current tool list. Do not invent, assume, simulate, or rename tools.

For read-only tools:

- Call the tool when the user's intent is clear and all required fields are available.
- Do not ask for confirmation unless the lookup depends on a high-precision identifier or there is meaningful risk of using the wrong record.
- Ask a clarification question only if a required field is missing, ambiguous, or conflicting.

For write tools or external actions:

- Summarize the intended action before calling the tool.
- Include the key consequence, such as what will be changed, sent, canceled, ordered, or charged.
- Ask for confirmation.
- Do not call the tool until the user clearly confirms.

For exact identifiers:

- Treat order IDs, tracking numbers, account numbers, confirmation codes, phone numbers, and email addresses as high precision.
- Normalize only when the field type is clear.
- Confirm the final value before account-specific lookups, validation, or write actions.

After tool calls:

- Only say an action was completed after the tool call succeeds.
- If the tool fails, explain the failure briefly, avoid raw errors, and give the user a clear next step.

Ejemplo de alto riesgo:

Usuario: cobra el saldo pendiente a mi tarjeta.

Incorrecto:

Asistente: ya hice el cargo a tu tarjeta.

Correcto:

Asistente: para confirmar, quieres que cobre el saldo pendiente de $248,16 a la tarjeta registrada. ¿Procedo?

Recuperarse de los errores de las herramientas

Los errores de las herramientas forman parte de la conversación. Una buena recuperación debe explicar qué ocurrió e indicarle al usuario claramente el siguiente paso.

No trates todos los errores de la misma manera. La recuperación debe depender del tipo de herramienta, del tipo de error y del impacto en el usuario. Algunos errores deben resolverse con un reintento sin avisar al usuario. Otros requieren pedirle que aclare la información, corrija un identificador, confirme una nueva acción o elija una alternativa.

## Tool Failures

If a tool call fails:

1. Briefly explain what failed in user-friendly language.
2. Do not blame the user or expose raw tool errors.
3. If the failure may be due to an exact identifier, read back the value used and ask the user to correct it.
4. If the failure may be temporary, offer to retry once.
5. If the same failure happens repeatedly, offer an alternate path or escalation.

Do not repeatedly call the same tool with the same arguments after failure.

Do not ask for a different identifier until you have first checked whether the captured value was correct.

Incorrecto:

Asistente: algo salió mal.

Correcto:

Asistente: no encontré ninguna coincidencia para O R D guion 3 1 2 5 B 2 3. ¿Entendí mal alguna parte?

Mantener sincronizada la disponibilidad de herramientas

Los modelos Realtime tienen mucha iniciativa para ayudar. Si el prompt menciona una herramienta que no está disponible, o si la lista de herramientas no coincide con el prompt, el modelo puede inventar un nombre de herramienta o fingir que completó la acción.

Por ejemplo, si el prompt hace referencia a lookup_order, pero la herramienta proporcionada se llama search_orders, el modelo puede hacer la llamada con el nombre incorrecto o simular la acción.

## Tool Availability

Use only the tools that are explicitly provided in the current tool list.

Do not invent, assume, or simulate tools. If a tool is mentioned in the instructions but is not present in the tool list, treat it as unavailable.

If the user requests an action that requires an unavailable tool:

1. Do not pretend to complete the action.
2. Briefly explain that the tool is not available.
3. Offer the closest supported next step.

Only say an action was completed after the relevant tool call succeeds.

Usa el metaprompt de auditoría de prompts del apéndice para revisar los prompts de producción y detectar contradicciones, herramientas faltantes e instrucciones poco robustas.

Manejar el silencio y el audio de fondo

Los agentes de voz tienden a responder de forma predeterminada. En producción, suelen recibir audio que no debería generar una respuesta hablada, como silencio, ruido de fondo, música de espera, audio de televisión o conversaciones ajenas.

Usa una herramienta de espera que no realice ninguna operación cuando el asistente deba permanecer en silencio y seguir escuchando. La herramienta le ofrece al modelo una acción válida que no requiere hablar, en lugar de hacerlo decir cosas como “Aquí estoy” o “No entendí”.

Diseño de la herramienta:

{
  "name": "wait_for_user",
  "description": "Call this when the latest audio does not need a spoken response, such as silence, background noise, hold music, TV audio, side conversation, or speech not addressed to the assistant. This tool helps end the turn without a spoken reply.",
  "parameters": {
    "type": "object",
    "properties": {},
    "required": []
  }
}

Combínala con instrucciones en el prompt:

## Handling Silence and Background Noise

If the latest audio is silence, background noise, hold music, TV audio, side conversation, or speech not addressed to you, call `wait_for_user`.

Do not respond conversationally after calling this tool.

Do not say "I'm here," "I didn't catch that," "Take your time," or "Let me know when you're ready."

Resume normal responses only when the user clearly addresses you or asks for help.

Usa este recurso para el audio que no está dirigido al asistente, no para solicitudes poco claras del usuario. Si el usuario claramente le está hablando al asistente, pero el contenido es ininteligible, pide una aclaración.

Usar los canales de mensajes de forma deliberada

gpt-realtime-2 puede generar mensajes intermedios visibles para el usuario en el canal commentary y respuestas finales dirigidas al usuario en el canal final. Usa instrucciones específicas para cada canal cuando el comportamiento dependa del canal en el que aparece.

Canal¿Visible para el usuario?Se usa para
commentaryPreámbulos y llamadas a herramientas.
finalMensaje final dirigido al usuario.

Por ejemplo, las llamadas a herramientas se realizan en el canal commentary. Si quieres que el asistente diga algo antes, durante o después de usar una herramienta, especifica ese comportamiento en relación con el canal commentary.

Before calling tools in the commentary channel, briefly tell the user what you are doing.

gpt-realtime-2 puede emitir varias fases de respuesta en un solo turno. En la salida de la API, esta distinción se representa mediante el evento response.done, que incluye un valor phase que indica si el contenido es commentary o la respuesta final.

Puedes usar este campo para manejar cada fase de forma diferente en tu aplicación. Por ejemplo, commentary puede reproducirse o mostrarse como una breve actualización intermedia, mientras que final_answer puede reservarse para la respuesta completa del asistente.

response.output[0].phase: "commentary"
response.output[1].phase: "final_answer"

Manejar el audio poco claro

El modelo solo debe actuar a partir de audio que pueda entender con confianza. Si el audio es poco claro, debe hacer una pregunta breve para aclararlo en lugar de adivinar.

No permitas que el modelo infiera palabras faltantes, llame a herramientas, capture entidades, genere preámbulos ni dedique tiempo de razonamiento oculto a intentar reconstruir lo que el usuario pudo haber dicho.

## Unclear Audio

- Only respond to clear audio or text.
- If the user's audio is not clear, ask for clarification using a short English phrase such as "Sorry, could you repeat that clearly?"
- Don't repeat the same unclear-audio clarification twice.
- Treat audio as unclear if it is ambiguous, noisy, silent, unintelligible, partially cut off, or if you are unsure of the exact words the user said.
- Do not guess what the user meant from unclear audio.
- Do not reason when the audio is unclear.
- Do not provide a preamble or call tools in the commentary channel when the audio is unclear.

Ejemplo:

Audio del usuario: “Consulta el pedido tres uno-” [se corta]

Incorrecto:

Asistente: voy a consultar el pedido 31 ahora.

Correcto:

Asistente: solo escuché parte del número de pedido. ¿Podrías repetirlo dígito por dígito?

Capturar entidades con exactitud

Muchos flujos de trabajo en tiempo real dependen de valores exactos: identificadores de pedidos, números de seguimiento, direcciones de correo electrónico, códigos de confirmación, números de cuenta, números de reclamo, identificadores de tickets, referencias de soporte y números de teléfono.

La interacción por voz dificulta esta tarea. Los usuarios hablan rápido, agrupan los números de distintas maneras, deletrean partes de los valores, usan muletillas, se corrigen en medio de un turno o pronuncian caracteres que suenan parecido. Un solo dígito incorrecto puede hacer que una búsqueda falle o devuelva la cuenta equivocada.

Captura las entidades con cautela. Recopila un valor a la vez, normaliza solo lo que esté claro, confirma los valores que requieren alta precisión antes de llamar a herramientas y permite retomar el proceso tras cada corrección.

Recopilar una entidad a la vez

Cuando un flujo de trabajo necesite varios valores, recopílalos uno a la vez. Esto evita que se mezclen los campos, especialmente en las conversaciones por voz.

## Entity Collection Order

Collect required values one at a time.

- Ask for only the next missing value.
- Do not ask for multiple values in the same turn.
- Before asking, check whether the value was already provided earlier in the conversation or the session.
- If a possible value already exists, confirm it with the user before using it.

Example:

"I see tracking number ABC-54321 from earlier. Should I use that one, or do you have a different tracking number?"

Do not call tools until the current value has been collected, validated, and confirmed.

Procesar caracteres deletreados

Usa este enfoque cuando los usuarios deletreen identificadores, códigos, nombres o direcciones de correo electrónico un carácter a la vez. La forma hablada es la entrada, no el valor final.

## Spelled-Out Characters

When a user dictates an ID, code, or email character by character, treat the spoken sequence as one compact value. Preserve explicitly spoken separators like dash, dot, underscore, slash, or plus; otherwise do not add spaces or separators.

Examples:

- "A B C one two three" -> "ABC123"
- "B C dash nine eight seven" -> "BC-987"
- "J O H N at example dot com" -> "john@example.com"

Do not insert spaces between spelled-out characters unless the user explicitly says the value contains spaces.

Normalizar con cuidado los números hablados

En el caso de los identificadores numéricos, los usuarios pueden decir los dígitos por separado, agruparlos o expresarlos como números en lenguaje natural. Si el campo espera un único valor numérico sin interrupciones, convierte en dígitos los números que se hayan dicho con claridad.

## Spoken Number Handling

Convert spoken numbers into digits when collecting numeric identifiers.

Examples:

- "one two three four" -> "1234"
- "one twenty three" -> "123"
- "one nineteen" -> "119"
- "ninety nine eleven" -> "9911"
- "nine thousand nine hundred eleven" -> "9911"

If multiple interpretations are plausible, ask the user to clarify before using the value.

Example:

"I heard either 119 or 1-19. Could you repeat the number digit by digit?"

Confirmar los identificadores exactos antes de llamar a herramientas

Los identificadores de pedidos, números de seguimiento, números de cuenta, números de reclamo, códigos de confirmación y otros identificadores similares son campos que requieren alta precisión. Confírmalos antes de usarlos en una llamada a una herramienta.

En el caso de los identificadores numéricos, repite el valor en voz alta dígito por dígito. Leer el valor como un número completo puede ocultar errores.

Ejemplo:

Asistente: solo para confirmar, escuché 8... 3... 5... 2... 1. ¿Es correcto?

Si el usuario corrige un carácter o dígito, repite el valor corregido completo antes de llamar a la herramienta.

Ejemplo:

Asistente: entendido. Tengo 8... 3... 5... 7... 1. ¿Es correcto?

## Exact Identifier Confirmation

Before calling tools with high-precision identifiers:

- Confirm the final normalized value with the user.
- Read numeric identifiers back digit by digit.
- Do not use guessed, partial, or ambiguous values.
- If the user corrects the value, repeat the full corrected value before calling the tool.

Confirmar direcciones de correo electrónico carácter por carácter

Las direcciones de correo electrónico son valores importantes. Los puntos, guiones, guiones bajos, letras repetidas y nombres que suenan parecido pueden provocar fallas al buscar cuentas o hacer que los mensajes se envíen a la dirección equivocada.

Pídele al usuario que deletree la dirección de correo electrónico:

Asistente: ¿podrías deletrear la dirección de correo electrónico carácter por carácter para asegurarme de tenerla exactamente como es?

Al repetirla en voz alta, confirma la dirección final exacta:

Asistente: solo para confirmar, es c-h-e-n arroba example punto com, ¿correcto?

## Email Confirmation

Email addresses must be captured exactly.

If the user says the email naturally without spelling it out, ask them to repeat it character by character.

Example:

"Could you spell the email address character by character so I can make sure I have it exactly right?"

When reading an email back, confirm the exact final email address.

Example:

"Just to confirm, that is c-h-e-n at example dot com, right?"

Flujo de trabajo para recopilar entidades

Evitar problemas por la interpretación literal de las instrucciones

gpt-realtime-2 sigue las instrucciones de forma más literal que los modelos anteriores de tiempo real. Los prompts que funcionaban bien con modelos más antiguos pueden necesitar ajustes.

Usa un lenguaje preciso. El modelo puede dar prioridad a la redacción exacta de una instrucción por encima del comportamiento más amplio que buscabas. Las reglas generales o rígidas pueden dominar el comportamiento del asistente de formas inesperadas, especialmente cuando varias reglas se superponen.

Ten cuidado con las palabras que imponen restricciones, como must, only, never y always. Úsalas cuando el comportamiento sea realmente obligatorio, no como un recurso general para dar énfasis. El uso excesivo de restricciones estrictas puede hacer que el asistente sea rígido, demasiado cauteloso o incapaz de manejar excepciones razonables.

Prefiere un alcance preciso:

For write actions that modify user data, ask for confirmation before calling the tool.

Evita un alcance amplio:

Always ask for confirmation before doing anything.

La versión de alcance amplio puede provocar confirmaciones innecesarias antes de consultas inofensivas de solo lectura, como consultar el estado de un pedido, obtener información de disponibilidad o leer información de una cuenta.

Ejemplo de interpretación literal

Recomendaciones generales para el diseño de prompts:

  • Prefiere instrucciones explícitas en lugar de intenciones implícitas.
  • Evita las palabras que imponen restricciones innecesarias, salvo que el comportamiento deba ser realmente rígido.
  • Reduce al mínimo las indicaciones contradictorias.
  • Ten cuidado con las instrucciones de prioridad que se superponen o compiten entre sí.
  • Prueba los prompts de forma incremental. Pequeños cambios en la redacción pueden tener grandes efectos en el comportamiento.
  • Al migrar desde modelos anteriores de tiempo real, ten en cuenta que algunos prompts necesitarán una reestructuración para obtener los mejores resultados.

Controlar el idioma y el acento por separado

El idioma y el acento deben controlarse por separado.

El acento de un usuario no equivale al idioma que quiere usar. Un usuario puede hablar inglés con acento hindi, español, francés o mandarín y aun así esperar respuestas en inglés.

Evita instrucciones generales sobre el idioma, como:

Mirror the user.
Respond naturally in the user's language.
Switch languages when appropriate.
Sound local.
Adapt to the user's accent.

Estas instrucciones son demasiado generales. El modelo puede interpretar el acento, las muletillas, las señales verbales de escucha o las palabras aisladas en otros idiomas como un motivo para cambiar de idioma.

Política de uso del inglés

## Language

English is the default response language.

- Do not infer language from accent alone.
- Ignore short filler sounds, backchannels, and isolated foreign words for language detection.
- Only switch languages if the user explicitly asks or provides a substantive utterance in another language.
- If language confidence is low, ask a short clarification instead of guessing.
- Keep preambles, spoken bridges, tool-related messages, and final answers in the same language.
- Accent adaptation must not change the response language.

Política multilingüe

## Language

Default to English unless the user clearly uses another language.

Switch languages only when:

- the user explicitly asks to use another language;
- the user provides a substantive utterance in another language. A substantive utterance means the user gives a complete request, question, or correction in another language, not just a greeting, name, address, filler word, or borrowed phrase.

Do not switch languages based on:

- accent;
- pronunciation;
- filler words;
- short backchannels;
- names;
- addresses;
- isolated foreign words.

If uncertain, ask:

"Would you like me to continue in English or [LANGUAGE]?"

Control del acento

gpt-realtime-2 puede seguir con mayor fidelidad las instrucciones sobre el acento, pero los prompts imprecisos al respecto pueden causar desviaciones o cambios de idioma no deseados.

Los prompts para controlar el acento funcionan mejor cuando especifican:

  • el acento deseado;
  • qué características deben mantenerse estables;
  • el ritmo, la acentuación y la prosodia deseados;
  • si la adaptación del acento debe afectar la elección del idioma.

En lugar de:

Sound Australian.

Usa:

## Accent

Speak English with a light Australian accent.

- Keep the accent stable from the first word to the last.
- Use natural Australian vowel shaping, but keep speech easy to understand.
- Do not exaggerate the accent.
- Do not change response language based on the user's accent.

Voces personalizadas

Usa voces personalizadas cuando las voces estándar no puedan cumplir de manera confiable los requisitos de marca, acento o personaje.

El diseño de prompts permite orientar el acento, el ritmo y la expresión vocal, pero no puede reemplazar por completo el diseño de la voz. Para los casos de uso que requieren una identidad vocal de marca consistente o fidelidad al acento, considera las voces personalizadas.

Las voces personalizadas están disponibles solo para clientes aprobados. Comunícate con el equipo que gestiona tu cuenta para solicitar acceso.

Mantener el estado en sesiones largas

gpt-realtime-2 amplía la ventana de contexto en tiempo real de 32 000 a 128 000 tokens, lo que lo hace más adecuado para sesiones largas. Para conversaciones bidireccionales con mucha información, conviene pensar en 128 000 tokens como aproximadamente 1-2 horas de contexto de audio sin procesar con alta densidad de información. Esto variará según el uso de herramientas, el razonamiento interno, los registros incorporados y otros detalles de la sesión.

En los casos de uso con contexto extenso, gpt-realtime-2 funciona mejor cuando puede distinguir qué información está vigente, cuál sirve como antecedente y cuál debe ignorarse si las fuentes se contradicen. No esperes que el modelo infiera la prioridad de las fuentes a partir de una transcripción sin procesar o de una gran cantidad de contexto sin organizar. Usa una estructura.

Usa un patrón estructurado al iniciar una sesión con una gran cantidad de contexto, como registros recuperados, historial de conversaciones previas, políticas, resúmenes, notas de la cuenta o documentos de referencia.

Migrar desde modelos anteriores en tiempo real

Al migrar desde modelos anteriores en tiempo real, considera el prompt como un medio para definir el comportamiento, no solo como texto que hay que trasladar.

  1. Usa Codex o un modelo de razonamiento potente para reestructurar el prompt según las recomendaciones más recientes de diseño de prompts para Realtime. Incluye un enlace a esta guía de diseño de prompts para basar la migración en prácticas recomendadas.
  2. Configura el esfuerzo de razonamiento en low en lugar del valor predeterminado. Auméntalo solo para flujos de trabajo que requieran una planificación más profunda.
  3. Revisa los nombres de las herramientas, los parámetros, las enumeraciones, los esquemas JSON y otros ajustes para asegurarte de que coincidan con la implementación esperada.
  4. Elimina los ejemplos desactualizados. Agrega ejemplos breves de casos en los que todo funciona como se espera, ambigüedades, interrupciones, llamadas a herramientas y comportamientos alternativos.
  5. Compara conversaciones representativas antes y después de la migración. Usa una evaluación existente para detectar regresiones y documenta los cambios de comportamiento intencionales.
  6. Haz una revisión final de coherencia. Confirma que el prompt distinga claramente entre requisitos obligatorios, valores predeterminados, reglas para herramientas, reglas de seguridad y comportamientos alternativos.
  7. Ejecuta evaluaciones, examina fallas representativas y ajusta el prompt de forma iterativa hasta que los comportamientos deseados sean confiables.

Próximos pasos

Para GPT-Live:

Para Realtime: