Para criar um aplicativo de conversação por voz, comece com o GPT-Live. Ele pode ouvir enquanto fala e manter a conversa em andamento enquanto um agente no backend raciocina, usa ferramentas ou conclui uma tarefa.
Conecte sua primeira conversa com o início rápido de WebRTC e escreva um prompt curto para o Live. Se você já tem um aplicativo Realtime ou um agente de texto, siga o guia Migre para o GPT-Live.
Escolha outro fluxo de trabalho de áudio
Use a Realtime API quando precisar do modelo de sessões e ferramentas que ela oferece. Para transcrição, tradução ou geração de fala sem um agente de conversação, escolha a API dedicada abaixo.
| O que criar | Comece aqui | O que você controla |
|---|---|---|
| Um agente de fala para fala que usa o modelo de sessões e ferramentas do Realtime | Realtime API | Turnos de áudio, estado da sessão, ferramentas e interrupções. |
| Uma interface de voz para um agente de texto existente | Agentes de voz | Conversão de fala em texto, o fluxo de trabalho do agente de texto e, depois, conversão de texto em fala. |
| Uma transcrição de um arquivo de áudio | Transcrição de arquivos | Uploads de arquivos, solicitações com escopo delimitado e formatos de transcrição compatíveis. |
| Legendas ao vivo sem fala do assistente | Transcrição ao vivo | Áudio em streaming e eventos incrementais de transcrição. |
| Tradução contínua de fala | Tradução ao vivo | Uma sessão dedicada à tradução, em vez de um ciclo de turnos de um agente de voz. |
| Narração ou fala gerada | Conversão de texto em fala | Texto, voz e formato de saída. |
| Entrada ou saída de áudio em um aplicativo de chat existente | Áudio no Chat Completions | Solicitações de chat multimodal com escopo delimitado. |
Desenvolva com voz
Consulte Agentes de voz para comparar arquiteturas. Comece pelo guia de criação de prompts para GPT-Live ou Realtime. Depois, use os guias compartilhados de vozes personalizadas, avaliação e otimização de custos. Cada guia diferencia os comportamentos específicos de cada modelo ou API.
Escolha uma conexão
Para áudio no navegador, comece com WebRTC. Para pipelines de áudio no servidor, use WebSockets. Para chamadas telefônicas, consulte Telefonia e SIP. Uma conexão de controle do lado do servidor permite que um backend confiável observe e controle uma sessão de mídia.
Selecione sua API em cada página de conexão. Usar o mesmo transporte não torna os procedimentos de negociação de conexão, as credenciais ou os formatos de eventos do GPT-Live e do Realtime intercambiáveis. Consulte o guia de conexão para ver os pré-requisitos e as instruções de configuração.
Adicione áudio ao seu aplicativo existente
Os exemplos de Chat Completions agora estão em Áudio no Chat Completions. Para começar a criar um agente de voz no navegador, use o início rápido de WebRTC com GPT-Live.