Há um ano, apresentamos a Responses API, uma base para desenvolvedores e empresas criarem agentes úteis e confiáveis. Equipar os modelos com um conjunto de ferramentas hospedadas permitiu que a IA evoluísse de assistentes de chat para sistemas capazes de agir em seu nome. Hoje, a Responses API oferece suporte a diversas ferramentas para executar fluxos de trabalho agênticos e a um novo conjunto de recursos e primitivas projetados especificamente para desenvolver com modelos mais capazes.
Milhares de desenvolvedores usam a Responses API hoje para aumentar a produtividade em áreas como suporte ao cliente, direito, ciências da vida, viagens e muitas outras. Depois de compartilhar vários casos de sucesso desses setores, hoje celebramos cinco histórias menos conhecidas de desenvolvedores que criaram soluções com a Responses API ao longo do último ano.
Detecção e correção de falhas em agentes de IA
Por Alexis Gauba e Ben Hylak, da Raindrop AI
Ferramentas: Ferramentas desenvolvidas sob medida
Modelos: GPT-5.2 (testando GPT-5.4)
A Raindrop é a plataforma de monitoramento usada pelas empresas de IA mais ambiciosas do mundo para detectar quando seus agentes saem do controle em produção. À medida que os agentes se tornaram mais complexos, essas falhas passaram a ser mais críticas.
Sem a Responses API, criar esse tipo de sistema de monitoramento teria sido muito mais difícil, e o resultado seria muito menos confiável.
O sistema executa análises em segundo plano usando a Responses API (por meio do Vercel AI SDK) para compartilhar ferramentas entre diferentes provedores de modelos e manter a portabilidade entre ambientes. Esses fluxos de trabalho revelam comportamentos incomuns. Quando algo dá errado, o sistema alerta os desenvolvedores e ajuda a diagnosticar o problema por trás da falha.
A plataforma se concentra em três sistemas principais:
- Monitoramento do comportamento dos agentes
- Detecção de falhas e emissão de alertas
- Ferramentas de investigação e depuração para desenvolvedores
Juntos, esses sistemas permitem que as equipes descubram, acompanhem e corrijam problemas em agentes de IA antes que eles afetem os sistemas de produção.
Arquitetura de monitoramento

Essa arquitetura permite que as equipes monitorem continuamente o comportamento dos agentes e respondam rapidamente quando surgem problemas.
1. Monitoramento do comportamento dos agentes
O sistema avalia continuamente o comportamento do agente para determinar se ele está operando conforme o esperado.
Os desenvolvedores podem definir condições que caracterizam resultados indesejados, e a plataforma pode emitir um alerta quando essas condições se verificam.
2. Detecção de falhas e emissão de alertas
Quando detecta anomalias, a Raindrop notifica os desenvolvedores e apresenta o contexto relevante necessário para investigar o problema.
A plataforma oferece ferramentas para:
- Acompanhar mudanças de comportamento entre versões dos agentes
- Identificar quais alterações no prompt ou no sistema provocaram falhas
- Examinar registros de raciocínio e chamadas de ferramentas
Isso permite que os desenvolvedores identifiquem rapidamente a causa raiz das falhas e implantem correções.
3. Ferramentas de investigação e depuração
A Raindrop também oferece ferramentas que ajudam os desenvolvedores a diagnosticar problemas nos fluxos de trabalho dos agentes. Essas capacidades permitem que as equipes conectem a detecção de falhas à melhoria do sistema.
A Raindrop AI usa a Responses API para executar todos os fluxos de trabalho de análise de longa duração em segundo plano. Sem ela, implementar esses sistemas de monitoramento seria significativamente mais difícil.
Fluxos de trabalho de raciocínio aprofundado para dados complexos
Por Eric Provencher, do Repo Prompt
Ferramentas utilizadas: Codex com App Server + MCP, pesquisa na Web
Modelo utilizado: GPT-5.3-Codex
Em vez de deixar o modelo de raciocínio desperdiçar sua janela de contexto explorando informações durante o planejamento ou as revisões, usamos um agente separado para selecionar e organizar o contexto antecipadamente. Assim, nosso modelo de raciocínio pode dedicar o máximo possível de sua capacidade de raciocínio à resolução da tarefa.
Eric Provencher criou um sistema que ajuda desenvolvedores e pesquisadores a realizar análises aprofundadas de grandes coleções de documentos, bases de código e conjuntos de dados.
O Repo Prompt se concentra na engenharia de contexto: reúne, organiza e estrutura automaticamente informações relevantes para que um modelo de raciocínio possa analisá-las de forma eficaz.
Enquanto muitos sistemas de agentes se concentram na coleta de dados, a arquitetura de Eric separa a coleta de contexto do raciocínio aprofundado. O sistema usa fluxos de trabalho de agentes para reunir o contexto relevante e, em seguida, repassa essas informações selecionadas e organizadas a um modelo de raciocínio que se concentra exclusivamente na análise.
A plataforma usa a Responses API da OpenAI para orquestrar fluxos de trabalho de agentes de longa duração e tarefas de raciocínio em atividades como:
- Análise de grandes bases de código e planejamento de arquitetura
- Fluxos de trabalho de revisão aprofundada de código
- Análises de pesquisa em grandes coleções de documentos
- Análise de documentos médicos e científicos
O sistema se baseia em três componentes principais: fluxos de trabalho de agentes que constroem o contexto, modelos de raciocínio aprofundado (fluxo de trabalho “Oracle”) e ciclos iterativos de pesquisa e análise.
1. Fluxo de trabalho do agente de construção de contexto
A primeira etapa do sistema fica a cargo de um agente de construção de contexto. Esse fluxo de trabalho analisa grandes repositórios de dados para determinar quais informações são relevantes para uma determinada consulta.
Usando ferramentas e o raciocínio do modelo com a Responses API, o agente identifica arquivos relevantes, relações entre documentos e trechos com informações essenciais.
O resultado dessa etapa é um pacote de contexto estruturado, que serve de entrada para a etapa de raciocínio.
2. Fluxo de trabalho de raciocínio aprofundado “Oracle”

Ao contrário dos agentes de construção de contexto, o modelo “Oracle” (o modelo de raciocínio aprofundado) não faz chamadas de ferramentas nem recupera informações adicionais. Ele se concentra inteiramente na análise do contexto selecionado e organizado que recebe.
A separação entre pesquisa e raciocínio permite que o modelo dedique toda a sua capacidade de raciocínio à compreensão do problema. Em muitos fluxos de trabalho, a etapa de raciocínio pode se estender por longos períodos, analisando relações complexas dentro do contexto fornecido.
3. Ciclos iterativos de pesquisa e análise
O sistema também oferece suporte a ciclos iterativos de raciocínio. Depois que o modelo de raciocínio gera uma saída, outro agente pode revisar os resultados e determinar se é necessário investigar mais.
Se necessário, o sistema inicia outro ciclo de coleta de contexto e raciocínio. Esse ciclo permite investigações de longa duração, nas quais o sistema refina progressivamente sua análise.
Fluxo de trabalho iterativo

O sistema conta com várias capacidades da Responses API:
- Tarefas em segundo plano: execute tarefas de raciocínio de longa duração, que podem levar minutos ou horas
- Orquestração de agentes: coordene ciclos de agentes para coleta de contexto, raciocínio e validação
- Observabilidade: monitore e gerencie fluxos de trabalho de raciocínio de longa duração durante a execução
A plataforma usa modelos Codex para reunir e estruturar o contexto relevante e, em seguida, passa esse contexto selecionado a modelos de raciocínio mais capazes para uma análise aprofundada. Essas capacidades viabilizam a arquitetura híbrida da plataforma, que combina fluxos de trabalho de agentes com modelos de raciocínio profundo.
Uma interface conversacional para colecionadores de discos de vinil
Por Ash Ryan Arnwine, da Collxn
Ferramentas: Pesquisa na Web e 16 ferramentas personalizadas
Modelo: GPT-5.4, GPT-5 nano
Senti que a Responses API aliviava minha carga de trabalho em comparação com alternativas como construir um sistema completo de geração aumentada por recuperação.
Ash Ryan Arnwine criou a “Collxn” (uma alusão a “coleção”), um pequeno serviço com uma grande missão: ajudar colecionadores de vinil a redescobrir o que já está em suas prateleiras e interagir com seus discos.
Colecionadores costumam catalogar acervos enormes no Discogs, às vezes com milhares de discos. A Collxn se conecta a essa coleção e envia um e-mail diário chamado “Daily Drop”, que destaca um disco diferente e traz detalhes sobre o artista, ajudando os colecionadores a revisitar músicas que já possuem.
E como explorar discos é mais divertido quando se pode fazer perguntas, a Collxn usa a Responses API da OpenAI para oferecer uma interface de chat que permite aos usuários literalmente conversar com seus discos.
Interface conversacional com chamadas de ferramentas
O aplicativo usa a Responses API para oferecer uma interface de chat chamada “Ask This Drop”, na qual os usuários podem fazer perguntas sobre os discos do seu Daily Drop.
O modelo é configurado com acesso a ferramentas da API do Discogs para recuperar informações diretamente do Discogs ao responder a uma pergunta.
Por exemplo, os usuários podem fazer perguntas como:
- Qual é o preço de mercado atual deste disco?
- Que outros álbuns este artista lançou?
- Quão rara é esta prensagem?

O Ask This Drop oferece aos usuários da Collxn uma interface de chat para conversar com seus discos de vinil.
Os colecionadores podem simplesmente fazer perguntas e receber respostas geradas a partir de dados do Discogs em tempo real, combinados com o contexto de sua própria coleção de discos.
Essa abordagem transforma uma coleção estática de discos em uma experiência conversacional conectada ao ecossistema musical mais amplo.
Daily Drop e notícias sobre artistas
A Collxn também usa o Agents SDK da OpenAI para gerar uma seção de “notícias recentes” sobre o artista em destaque no e-mail do Daily Drop.

O Agents SDK da OpenAI é responsável pela seção de notícias sobre artistas do Daily Drop da Collxn.
Esse recurso aciona um agente com pesquisa na Web para encontrar artigos recentes ou novidades sobre o artista e acrescenta esse contexto ao e-mail diário. Entre os usuários beta, o recurso de notícias rapidamente se tornou uma das partes mais populares do produto, pois conecta a experiência de colecionar discos ao mundo exterior de forma dinâmica.
Por fim, Ash migrou a Collxn para a Responses API para lançar o “Ask This Drop”. Com isso, o aplicativo passou a oferecer suporte a raciocínio em várias etapas nos fluxos de trabalho conversacionais, além de chamadas de ferramentas integradas e personalizadas. A implementação da Responses API na Collxn usa a ferramenta integrada de pesquisa na Web para buscar notícias sobre artistas dentro do chat, além de 16 ferramentas personalizadas para trabalhar com a API do Discogs, consultar a conta do usuário na Collxn e muito mais.

A ferramenta de pesquisa na Web da Responses API permite consultar notícias sobre artistas em tempo real no “Ask This Drop” da Collxn.
As conversas com estado persistente na Responses API também estão tornando mais simples e rápido lidar com interações de chat com várias trocas de mensagens. De modo geral, Ash observou que usar a Responses API simplificou a arquitetura em comparação com a construção de um sistema completo de geração aumentada por recuperação (RAG).
Transformando gravações de tela em demonstrações interativas de produtos
Por Nick Sorrentino e Pawel Wszola, da equipe da Arcade
Ferramentas: Uso do computador
Modelos: GPT-5.2, computer-use-preview
Integrar a geração de conteúdo via API reduziu em 50% o número de etapas necessárias para publicar uma demonstração, o que aumentou significativamente as taxas de publicação e a adoção.
A Arcade transforma algo que a maioria das equipes já faz, gravar a tela, em uma demonstração interativa de produto bem elaborada. Em vez de apresentar um produto ao vivo ou escrever uma documentação passo a passo, as equipes gravam um fluxo de trabalho uma única vez e a Arcade cuida do resto.
Nos bastidores, a plataforma analisa a gravação e gera automaticamente um passo a passo guiado que explica o que está acontecendo em cada etapa.
Fluxo de trabalho de geração de demonstrações
Durante uma sessão de gravação:
- O usuário grava a tela enquanto executa um fluxo de trabalho.
- No computador ou no navegador, a Arcade captura diretamente interações estruturadas, como cliques, digitação e rolagem.
- Em dispositivos móveis, onde o ambiente isolado do iOS impede que os aplicativos capturem interações em todo o sistema, os usuários gravam apenas um vídeo da tela do aplicativo.
- A gravação é enviada à Responses API da OpenAI com a ferramenta de uso do computador, que analisa os quadros do vídeo e infere as interações que ocorreram.
- O sistema converte essas ações inferidas em etapas estruturadas.
- A Arcade gera o texto narrativo e os pontos interativos que guiam os espectadores pela demonstração.
Essas etapas se tornam automaticamente o passo a passo interativo que os usuários veem.
As ações estruturadas são então enviadas à API chat completions, que gera os títulos e as descrições dos pontos interativos que aparecem ao longo da demonstração. Os usuários podem ajustar o texto gerado com ferramentas integradas de edição com IA, por exemplo, encurtando ou reescrevendo o texto.
Reduzindo pela metade o esforço para criar demonstrações
Automatizar a narração das demonstrações reduziu significativamente o esforço necessário para publicar um passo a passo do produto.
Após a integração do fluxo de trabalho via API:
- A mediana do número de ações necessárias antes da publicação caiu 50%
- A contagem de ações no P80 caiu de ~230 para ~120
- As taxas de publicação e a adoção do produto aumentaram
Ao eliminar obstáculos do processo de criação de demonstrações, a Arcade permitiu que as equipes transformassem gravações brutas em demonstrações interativas bem elaboradas com muito mais rapidez.
Medindo e melhorando a visibilidade de marcas nas respostas da IA
Por Tunde Adeyinka e Ramon Silva, da Hexagon
Ferramentas utilizadas: Pesquisa na Web
Modelo utilizado: GPT-5.2 Chat
Tunde Adeyinka e Ramon Silva fundaram a Hexagon para responder a uma nova pergunta dos varejistas: como os assistentes de IA falam sobre seus produtos?
À medida que os assistentes de IA influenciam cada vez mais a descoberta de produtos, a Hexagon ajuda as empresas a monitorar como suas marcas aparecem nas respostas geradas por IA e a melhorar esses resultados ao longo do tempo.
A plataforma usa a Responses API da OpenAI como base para três sistemas principais:
1. Arquitetura de simulação de respostas
A Hexagon executa um pipeline diário de simulação para medir como os assistentes de IA respondem a perguntas sobre produtos. Todos os dias, o sistema gera milhares de prompts realistas de consumidores, prompts de recomendação de produtos e consultas sobre compras, e os envia pela Responses API. Os resultados são analisados para acompanhar a visibilidade das marcas nas respostas geradas por IA.
Assim, os clientes do setor varejista podem ver com que frequência seus produtos aparecem e como essas respostas mudam ao longo do tempo.

2. Pipeline de geração de conteúdo com múltiplos agentes
Além das análises, a Hexagon usa a Responses API para gerar conteúdo otimizado que melhora a visibilidade das marcas nas respostas de IA.
O sistema usa uma arquitetura com quatro agentes. Cada agente executa uma etapa especializada do pipeline e passa os resultados para a etapa seguinte, até que o conteúdo final seja produzido e publicado. Os agentes se comunicam por meio de ciclos não determinísticos para refinar o conteúdo de forma iterativa antes da publicação.

3. Painel e ferramentas para clientes
A plataforma também inclui o “Hexi”, um chatbot criado com chamada de função por meio da Responses API. Com o Hexi, os clientes podem explorar análises por meio de conversas e gerar, por conta própria, resumos dos dados de visibilidade de suas marcas na IA. A Hexagon disponibiliza suas análises em um painel para varejistas que acompanha como os produtos aparecem nas respostas geradas por IA.

A Hexagon utiliza várias capacidades essenciais da Responses API para tornar as simulações realistas e úteis em todo o produto:
- Pesquisa na Web: reproduz respostas com navegação habilitada, semelhantes às do ChatGPT.
- Parâmetro de localização do usuário: simula consultas de diferentes regiões para testar variações geográficas.
- Esforço de raciocínio: controla a profundidade e a complexidade das respostas.
- Número máximo de tokens de saída: limita o tamanho das respostas em saídas longas.
- Persistência de contexto: mantém o contexto entre chamadas, permitindo fluxos de trabalho com múltiplos agentes.
A Responses API proporcionou respostas de melhor qualidade e maior persistência de contexto entre várias chamadas, aspectos essenciais para os pipelines de múltiplas etapas que sustentam a plataforma da Hexagon.
Para concluir
Após um ano, a Responses API se tornou um componente fundamental para desenvolvedores que criam software agêntico.
Essas cinco histórias de desenvolvedores mostram como isso funciona na prática: sistemas com múltiplos agentes coordenando ferramentas, detectando bugs, executando fluxos de trabalho e entregando produtos baseados em IA.
A própria plataforma está evoluindo rapidamente, com melhor orquestração e ecossistemas de ferramentas mais completos, além de novidades como contêineres hospedados pela OpenAI com acesso à rede e ferramentas de shell.
Mais ferramentas.
Mais capacidades.
Mais desenvolvedores criando coisas em que o restante de nós ainda não pensou.
Vamos ver o que os desenvolvedores vão criar no segundo ano.