Hace un año presentamos la API Responses, una base para que desarrolladores y empresas creen agentes útiles y confiables. Equipar a los modelos con un conjunto de herramientas alojadas permitió que la IA evolucionara de asistentes de chat a sistemas que pueden realizar acciones en tu nombre. Hoy, la API Responses admite diversas herramientas para ejecutar flujos de trabajo con agentes, además de un nuevo conjunto de funciones y primitivas diseñadas específicamente para desarrollar con modelos más capaces.
Hoy, miles de desarrolladores crean soluciones con la API Responses para aumentar la productividad en sectores como la atención al cliente, los servicios legales, las ciencias de la vida, los viajes y muchos más. Después de compartir numerosos casos de éxito de esos sectores, hoy celebramos cinco historias menos conocidas de desarrolladores que han creado soluciones con la API Responses durante el último año.
Detectar y corregir fallas en agentes de IA
Por Alexis Gauba y Ben Hylak, de Raindrop AI
Herramientas: herramientas desarrolladas a medida
Modelos: GPT-5.2 (con GPT-5.4 en pruebas)
Raindrop es la plataforma de monitoreo que usan las empresas de IA más ambiciosas del mundo para detectar cuándo sus agentes se desvían del comportamiento esperado en producción. A medida que los agentes se han vuelto más complejos, estas fallas se han vuelto más críticas.
Sin la API Responses, crear este tipo de sistema de monitoreo habría sido mucho más difícil y el resultado, mucho menos confiable.
El sistema ejecuta análisis en segundo plano con la API Responses (a través del Vercel AI SDK) para compartir herramientas entre distintos proveedores de modelos y mantener la portabilidad del sistema entre entornos. Estos flujos de trabajo detectan comportamientos inusuales. Cuando algo sale mal, el sistema alerta a los desarrolladores y ayuda a diagnosticar el problema subyacente.
La plataforma se centra en tres sistemas principales:
- Monitoreo del comportamiento de los agentes
- Detección de fallas y generación de alertas
- Herramientas de investigación y depuración para desarrolladores
Juntos, estos sistemas permiten a los equipos descubrir, rastrear y corregir problemas en los agentes de IA antes de que afecten a los sistemas en producción.
Arquitectura de monitoreo

Esta arquitectura permite a los equipos monitorear continuamente el comportamiento de los agentes y responder con rapidez cuando surgen problemas.
1. Monitoreo del comportamiento de los agentes
El sistema evalúa continuamente el comportamiento del agente para determinar si funciona como se espera.
Los desarrolladores pueden definir condiciones que indiquen resultados no deseados, y la plataforma puede generar una alerta cuando se cumplan esas condiciones.
2. Detección de fallas y generación de alertas
Una vez detectadas las anomalías, Raindrop notifica a los desarrolladores y presenta el contexto relevante necesario para investigar el problema.
La plataforma ofrece herramientas para:
- Rastrear los cambios de comportamiento entre versiones del agente
- Identificar qué cambios en los prompts o en el sistema provocaron las fallas
- Examinar las trazas de razonamiento y las llamadas a herramientas
Esto permite a los desarrolladores identificar rápidamente la causa raíz de las fallas y desplegar correcciones.
3. Herramientas de investigación y depuración
Raindrop también ofrece herramientas que ayudan a los desarrolladores a diagnosticar problemas en los flujos de trabajo de los agentes. Estas capacidades permiten a los equipos vincular la detección de fallas con la mejora del sistema.
Raindrop AI usa la API Responses para ejecutar todos sus flujos de trabajo de análisis de larga duración en segundo plano. Sin ella, implementar estos sistemas de monitoreo sería mucho más difícil.
Flujos de trabajo de razonamiento profundo para datos complejos
Por Eric Provencher, de Repo Prompt
Herramientas utilizadas: Codex con App Server + MCP, búsqueda web
Modelo utilizado: GPT-5.3-Codex
En lugar de dejar que el modelo de razonamiento desperdicie su ventana de contexto explorando información durante la planificación o las revisiones, usamos un agente independiente que selecciona y organiza el contexto de antemano. Así, nuestro modelo de razonamiento puede dedicar la mayor parte posible de su capacidad de razonamiento a resolver nuestra tarea.
Eric Provencher creó un sistema que ayuda a desarrolladores e investigadores a realizar análisis profundos de grandes colecciones de documentos, bases de código y conjuntos de datos.
Repo Prompt se centra en la ingeniería de contexto: recopila, organiza y estructura automáticamente la información relevante para que un modelo de razonamiento pueda analizarla de manera eficaz.
Mientras que muchos sistemas de agentes se centran en recopilar datos, la arquitectura de Eric separa la recopilación de contexto del razonamiento profundo. El sistema usa flujos de trabajo con agentes para reunir el contexto relevante y luego entrega esa información seleccionada y organizada a un modelo de razonamiento que se dedica exclusivamente al análisis.
La plataforma usa la API Responses de OpenAI para orquestar flujos de trabajo con agentes y tareas de razonamiento de larga duración en procesos como:
- Análisis de grandes bases de código y planificación de arquitectura
- Flujos de trabajo de revisión profunda de código
- Análisis de grandes colecciones de documentos con fines de investigación
- Análisis de documentos médicos y científicos
El sistema se basa en tres componentes principales: flujos de trabajo con agentes que preparan el contexto, modelos de razonamiento profundo (el flujo de trabajo “Oracle”) y ciclos iterativos de investigación y análisis.
1. Flujo de trabajo del agente que prepara el contexto
La primera etapa del sistema está a cargo de un agente que prepara el contexto. Este flujo de trabajo analiza grandes repositorios de datos para determinar qué información es relevante para una consulta determinada.
Mediante herramientas y el razonamiento del modelo con la API Responses, el agente identifica archivos relevantes, relaciones entre documentos y secciones clave de información.
El resultado de esta etapa es un paquete de contexto estructurado, que se convierte en la entrada de la etapa de razonamiento.
2. Flujo de trabajo de razonamiento profundo “Oracle”

A diferencia de los agentes que preparan el contexto, el modelo “Oracle” (el modelo de razonamiento profundo) no realiza llamadas a herramientas ni recupera información adicional. Se centra por completo en analizar el contexto seleccionado y organizado que se le proporciona.
Al separar la investigación del razonamiento, el modelo puede dedicar toda su capacidad de razonamiento a comprender el problema. En muchos flujos de trabajo, la etapa de razonamiento puede ejecutarse durante períodos prolongados y analizar relaciones complejas dentro del contexto proporcionado.
3. Ciclos iterativos de investigación y análisis
El sistema también admite ciclos iterativos de razonamiento. Después de que el modelo de razonamiento genera una salida, otro agente puede revisar los resultados y determinar si hace falta investigar más.
Si es necesario, el sistema inicia otro ciclo de recopilación de contexto y razonamiento. Este ciclo permite realizar investigaciones de larga duración en las que el sistema refina progresivamente su análisis.
Flujo de trabajo iterativo

El sistema se apoya en varias capacidades de la API Responses:
- Trabajos en segundo plano: ejecuta tareas de razonamiento de larga duración que pueden extenderse durante minutos u horas
- Orquestación de agentes: coordina ciclos de agentes para recopilar contexto, razonar y validar
- Observabilidad: monitorea y administra flujos de trabajo de razonamiento de larga duración mientras se ejecutan
La plataforma usa modelos Codex para recopilar y estructurar el contexto relevante, y luego entrega ese contexto seleccionado a modelos de razonamiento de mayor capacidad para realizar un análisis más profundo. Estas capacidades hacen posible la arquitectura híbrida de la plataforma, que combina flujos de trabajo de agentes con modelos de razonamiento profundo.
Una interfaz conversacional para coleccionistas de discos de vinilo
Por Ash Ryan Arnwine, de Collxn
Herramientas: búsqueda web y 16 herramientas personalizadas
Modelo: GPT-5.4, GPT-5 nano
Sentía que la API Responses me quitaba trabajo de encima en comparación con alternativas como construir un sistema completo de generación aumentada por recuperación.
Ash Ryan Arnwine creó “Collxn” (piensa en “colección”), un pequeño servicio con una gran misión: ayudar a los coleccionistas de vinilos a redescubrir lo que ya tienen en sus estantes e interactuar con sus discos.
Los coleccionistas suelen llevar un registro de enormes colecciones en Discogs, a veces de miles de discos. Collxn se conecta a esa colección y envía un correo diario llamado “Daily Drop”, que destaca un disco diferente junto con detalles sobre el artista y ayuda a los coleccionistas a redescubrir música que ya tienen.
Y como explorar discos es más divertido cuando puedes hacer preguntas, Collxn usa la API Responses de OpenAI para ofrecer una interfaz de chat que permite a los usuarios hablar literalmente con sus discos.
Interfaz conversacional con llamadas a herramientas
La aplicación usa la API Responses para ofrecer una interfaz de chat llamada “Ask This Drop”, donde los usuarios pueden hacer preguntas sobre los discos de su Daily Drop.
El modelo está configurado con acceso a herramientas de la API de Discogs para recuperar información directamente de Discogs al responder una pregunta.
Por ejemplo, los usuarios pueden hacer preguntas como:
- ¿Cuál es el precio de mercado actual de este disco?
- ¿Qué otros álbumes lanzó este artista?
- ¿Qué tan rara es esta edición?

Ask This Drop ofrece a los usuarios de Collxn una interfaz de chat para conversar con sus discos de vinilo.
Los coleccionistas solo tienen que hacer preguntas para recibir respuestas generadas a partir de datos de Discogs en tiempo real, combinados con el contexto de su propia colección de discos.
Este enfoque convierte una colección estática de discos en una experiencia conversacional conectada con el ecosistema musical más amplio.
Daily Drop y noticias sobre artistas
Collxn también usa el Agents SDK de OpenAI para generar una sección de “noticias recientes” sobre el artista destacado en el correo de Daily Drop.

El Agents SDK de OpenAI hace posible la sección de noticias sobre artistas de Daily Drop de Collxn.
Esta función pone en marcha un agente con búsqueda web para encontrar artículos recientes o novedades sobre el artista y agrega ese contexto al correo diario. Entre los usuarios de la versión beta, la función de noticias se convirtió rápidamente en una de las partes más populares del producto, ya que conecta de forma dinámica la experiencia de coleccionar discos con el mundo exterior.
Finalmente, Ash migró Collxn a la API Responses para lanzar “Ask This Drop”. Esto permitió que la aplicación admitiera razonamiento de varios pasos en flujos de trabajo conversacionales, así como llamadas a herramientas integradas y personalizadas. La implementación de la API Responses en Collxn usa la herramienta integrada de búsqueda web para buscar noticias sobre artistas dentro del chat, además de 16 herramientas personalizadas para trabajar con la API de Discogs, consultar la cuenta de Collxn del usuario y más.

La herramienta de búsqueda web de la API Responses permite consultar noticias sobre artistas en tiempo real en “Ask This Drop” de Collxn.
Las conversaciones con estado en la API Responses también están simplificando y agilizando la gestión de interacciones de chat de varios turnos. En general, Ash señaló que usar la API Responses simplificó la arquitectura en comparación con construir un sistema completo de generación aumentada por recuperación (RAG).
Convertir grabaciones de pantalla en demos interactivas de productos
Por Nick Sorrentino y Pawel Wszola, del equipo de Arcade
Herramientas: uso de la computadora
Modelos: GPT-5.2, computer-use-preview
Integrar la generación de contenido mediante API redujo en un 50 % la cantidad de pasos necesarios para publicar una demo, lo que aumentó significativamente las tasas de publicación y la adopción.
Arcade toma algo que la mayoría de los equipos ya hacen, grabar su pantalla, y lo convierte en una demo de producto pulida e interactiva. En lugar de mostrarle a alguien un producto en vivo o escribir documentación paso a paso, los equipos graban un flujo de trabajo una sola vez y Arcade se encarga del resto.
Internamente, la plataforma analiza la grabación y genera automáticamente un recorrido guiado que explica lo que sucede en cada paso.
Flujo de trabajo de generación de demos
Durante una sesión de grabación:
- Un usuario graba su pantalla mientras realiza un flujo de trabajo.
- En el escritorio o en el navegador, Arcade captura directamente interacciones estructuradas como clics, escritura y desplazamientos.
- En dispositivos móviles, donde el entorno aislado de iOS impide que las aplicaciones capturen interacciones de todo el sistema, los usuarios graban en su lugar un video simple de la pantalla de la aplicación.
- La grabación se envía a la API Responses de OpenAI con la herramienta de uso de la computadora, que analiza los fotogramas e infiere las interacciones que ocurrieron.
- El sistema convierte esas acciones inferidas en pasos estructurados.
- Arcade genera el texto narrativo y los puntos interactivos que guían a los espectadores a lo largo de la demo.
Estos pasos se convierten automáticamente en el recorrido interactivo que ven los usuarios.
Luego, las acciones estructuradas se pasan a la API para completar chats, que genera los títulos y las descripciones de los puntos interactivos que aparecen a lo largo de la demo. Los usuarios pueden ajustar el texto generado con las herramientas de edición con IA integradas, por ejemplo, para acortarlo o reescribirlo.
Reducir a la mitad el trabajo de creación de demos
Automatizar la narración de las demos redujo significativamente el esfuerzo necesario para publicar un recorrido guiado de un producto.
Después de integrar el flujo de trabajo basado en la API:
- La mediana de la cantidad de acciones necesarias antes de publicar se redujo en un 50 %
- La cantidad de acciones en el P80 bajó de ~230 a ~120
- Aumentaron las tasas de publicación y la adopción del producto
Al eliminar obstáculos del proceso de creación de demos, Arcade permitió que los equipos convirtieran grabaciones sin editar en demos interactivas pulidas mucho más rápido.
Medir y mejorar la visibilidad de las marcas en las respuestas de la IA
Por Tunde Adeyinka y Ramon Silva, de Hexagon
Herramientas utilizadas: búsqueda web
Modelo utilizado: GPT-5.2 Chat
Tunde Adeyinka y Ramon Silva fundaron Hexagon para responder una nueva pregunta que se plantean los minoristas: ¿cómo hablan los asistentes de IA sobre tus productos?
A medida que los asistentes de IA influyen cada vez más en cómo se descubren los productos, Hexagon ayuda a las empresas a monitorear cómo aparecen sus marcas en las respuestas generadas por IA y a mejorar esos resultados con el tiempo.
La plataforma utiliza la API Responses de OpenAI para hacer funcionar tres sistemas principales:
1. Arquitectura de simulación de respuestas
Hexagon ejecuta un flujo diario de simulación para medir cómo responden los asistentes de IA a preguntas sobre productos. Cada día, el sistema genera miles de prompts realistas de consumidores, prompts de recomendación de productos y consultas de compras, y luego los envía a través de la API Responses. Los resultados obtenidos se analizan para hacer un seguimiento de la visibilidad de las marcas en las respuestas generadas por IA.
Así, los clientes del sector minorista pueden ver con qué frecuencia aparecen sus productos y cómo cambian esas respuestas con el tiempo.

2. Flujo multiagente de generación de contenido
Además del análisis de datos, Hexagon utiliza la API Responses para generar contenido optimizado que mejora la visibilidad de las marcas en las respuestas de IA.
El sistema utiliza una arquitectura de cuatro agentes, en la que cada agente realiza un paso especializado del flujo y pasa sus resultados a la siguiente etapa hasta que se produce y publica el contenido final. Los agentes se comunican mediante ciclos no deterministas para refinar el contenido de forma iterativa antes de publicarlo.

3. Panel y herramientas para clientes
La plataforma también incluye “Hexi”, un chatbot creado con llamada a funciones a través de la API Responses. Con Hexi, los clientes pueden explorar los datos de análisis mediante conversaciones y generar por su cuenta resúmenes de sus datos de visibilidad en IA. Hexagon presenta sus análisis en un panel para minoristas que permite hacer un seguimiento de cómo aparecen los productos en las respuestas generadas por IA.

Hexagon se apoya en varias capacidades clave de la API Responses para que las simulaciones sean realistas y útiles en todo su producto:
- Búsqueda web: replica respuestas con navegación habilitada similares a las de ChatGPT.
- Parámetro de ubicación del usuario: simula consultas desde distintas regiones para evaluar las variaciones geográficas.
- Esfuerzo de razonamiento: controla la profundidad y la complejidad de las respuestas.
- Número máximo de tokens de salida: limita la longitud de las respuestas extensas.
- Persistencia del contexto: mantiene el contexto entre llamadas, lo que permite flujos de trabajo multiagente.
La API Responses ofreció respuestas de mayor calidad y una persistencia del contexto más sólida entre múltiples llamadas, aspectos fundamentales para los flujos de varios pasos que hacen funcionar la plataforma de Hexagon.
Para cerrar
Tras un año, la API Responses se ha convertido en un componente fundamental para los desarrolladores que crean software con agentes.
Estas cinco historias de desarrolladores muestran cómo se traduce esto en la práctica: sistemas multiagente que coordinan herramientas, detectan errores, ejecutan flujos de trabajo y lanzan productos basados en IA.
La propia plataforma evoluciona rápidamente, con una mejor orquestación y ecosistemas de herramientas más completos que incorporan novedades como contenedores alojados por OpenAI con conectividad de red y herramientas de shell.
Más herramientas.
Más capacidades.
Más desarrolladores creando cosas que al resto todavía no se nos han ocurrido.
Veamos qué crean los desarrolladores en el segundo año.