O GPT-Live conduz uma conversa por voz enquanto um agente de backend consulta informações, usa ferramentas e conclui tarefas. Ele pode ouvir enquanto fala, uma capacidade chamada full duplex. O envio de tarefas ao backend é chamado de delegação: a conversa pode continuar enquanto essas tarefas são executadas.
Por exemplo, um usuário pode perguntar sobre um pedido, acrescentar um detalhe enquanto o backend verifica o status e ouvir o resultado quando estiver pronto. Você escolhe o modelo ou agente de backend independentemente do modelo de voz; o Realtime usa um único modelo para fala, raciocínio e seleção de ferramentas.
Entenda as duas partes
- O GPT-Live conduz a conversa. Ele ouve, fala e decide quando pedir ajuda ao backend. Forneça um prompt curto que defina o estilo da conversa e quando delegar.
- O backend executa as tarefas delegadas. Com a delegação via Responses, use um modelo compatível com a Responses. Com a delegação via cliente, conecte qualquer modelo, harness de agente ou serviço que sua aplicação execute. O backend raciocina, usa ferramentas e retorna resultados para o GPT-Live comunicar. Mantenha aqui as instruções detalhadas, as regras de negócio e os fluxos de trabalho com ferramentas.
Sua aplicação é responsável pelas permissões, pelas confirmações, pela execução de funções privadas e pelo estado persistente das tarefas. Interromper a fala não cancela automaticamente o trabalho do backend. Consulte Agentes de voz para comparar o GPT-Live com o Realtime e com aplicações de voz encadeadas.
Escolha como executar o backend
Comece com a delegação via Responses quando um backend gerenciado atender às suas necessidades: o GPT-Live chama o modelo Responses configurado, fornece o contexto da conversa e retorna os resultados. Escolha a delegação via cliente quando sua aplicação precisar controlar a execução do backend, o contexto ou quais resultados chegam ao GPT-Live.
Consulte Escolha um modo de delegação para ver a comparação e os detalhes de configuração. Escolha o modo ao criar a sessão; para mudar de modo, inicie uma nova sessão.
Conecte sua primeira sessão
Comece pelo guia de início rápido de WebRTC com o GPT-Live. O exemplo de navegador e servidor conecta a entrada do microfone e a saída dos alto-falantes, com um backend Responses capaz de pesquisar na Web.
Você precisa de um microfone, uma página no navegador servida por HTTPS ou localhost e um servidor confiável com uma chave de API de projeto da OpenAI. Mantenha a chave no servidor.
- Escreva um prompt de conversa curto que diga ao GPT-Live quando pedir ajuda ao backend.
- Siga o guia de início rápido para conectar o microfone, a reprodução de áudio e o canal de eventos do navegador. Seu servidor cria a sessão e troca a oferta de conexão do navegador por uma resposta.
- Aguarde
session.started, depois fale e ouça uma resposta. Faça uma pergunta que exija informações atuais para experimentar o backend de pesquisa na Web. - Encerre a conversa e feche a sessão para coletar os dados finais de uso e liberar a conexão.
Verifique tanto a conversa por voz quanto o resultado do backend. Um evento de início de sessão confirma a inicialização; ouvir uma resposta e verificar o resultado da pesquisa validam partes distintas da aplicação.
As sessões de voz do GPT-Live são cobradas por segundo, de acordo com a duração. Consulte os preços do modelo para ver a tarifa atual. O uso do modelo de backend e das ferramentas é cobrado separadamente. Consulte Otimização de custos para saber como o uso é contabilizado e como reduzir custos.
Escolha uma conexão
- WebRTC para aplicações de voz no navegador. As trilhas de mídia transportam áudio; um canal de dados transporta eventos JSON.
- WebSockets para integrações de áudio do lado do servidor. O socket principal transporta áudio e eventos de controle.
- Controles do lado do servidor para acesso do backend a uma sessão existente. Uma conexão de banda lateral transporta eventos enquanto o áudio permanece na conexão principal.
- Telefonia e SIP para opções de integração telefônica e orientações sobre provedores.
Integrações com parceiros
Para aplicações criadas com LiveKit, Twilio, Telnyx ou Daily/Pipecat, comece pela visão geral das integrações com parceiros para escolher uma conexão para o fluxo de mídia existente.
Continue desenvolvendo
- Defina o estilo da conversa e o comportamento de delegação em Criação de prompts para o GPT-Live.
- Conecte ferramentas e reduza a latência do backend em Delegação e ferramentas.
- Gerencie o contexto, as transcrições e o ciclo de vida da sessão em Gerenciamento de sessões.
- Escolha uma opção de migração para seu agente Realtime ou baseado em texto em Migre para o GPT-Live.
- Teste os resultados das conversas e das tarefas em Avaliação de agentes de voz.