Il y a un an, nous avons lancé l’API Responses, un socle permettant aux développeurs et aux entreprises de créer des agents utiles et fiables. En dotant les modèles d’un ensemble d’outils hébergés, nous avons permis à l’IA de passer d’assistants conversationnels à des systèmes capables d’agir en votre nom. Aujourd’hui, l’API Responses prend en charge de nombreux outils pour les workflows agentiques, ainsi qu’un nouvel ensemble de fonctionnalités et de primitives spécialement conçues pour développer avec des modèles plus performants.
Des milliers de développeurs utilisent aujourd’hui l’API Responses pour améliorer la productivité dans des domaines comme le support client, le droit, les sciences de la vie, le voyage et bien d’autres. Après avoir partagé de nombreuses réussites dans ces secteurs, nous mettons aujourd’hui à l’honneur cinq témoignages moins connus de développeurs qui ont créé des produits avec l’API Responses au cours de l’année écoulée.
Détection et correction des défaillances des agents IA
Par Alexis Gauba et Ben Hylak de Raindrop AI
Outils : Outils développés sur mesure
Modèles : GPT-5.2 (GPT-5.4 en cours de test)
Raindrop est la plateforme de surveillance utilisée par les entreprises d’IA les plus ambitieuses au monde pour détecter les dérives de leurs agents en production. À mesure que les agents se sont complexifiés, ces défaillances sont devenues plus critiques.
Sans l’API Responses, la création d’un tel système de surveillance aurait été bien plus difficile, pour un résultat beaucoup moins fiable.
Le système effectue des analyses en arrière-plan à l’aide de l’API Responses (via le Vercel AI SDK) afin de partager les outils entre différents fournisseurs de modèles et de rester portable d’un environnement à l’autre. Ces workflows font ressortir les comportements inhabituels. Lorsqu’un problème survient, le système alerte les développeurs et les aide à en diagnostiquer la cause.
La plateforme s’articule autour de trois systèmes principaux :
- Surveillance du comportement des agents
- Détection des défaillances et alertes
- Outils d’investigation et de débogage pour les développeurs
Ensemble, ces systèmes permettent aux équipes de détecter, de suivre et de corriger les problèmes des agents IA avant qu’ils n’affectent les systèmes en production.
Architecture de surveillance

Cette architecture permet aux équipes de surveiller en continu le comportement des agents et de réagir rapidement en cas de problème.
1. Surveillance du comportement des agents
Le système évalue en continu le comportement de l’agent pour déterminer s’il fonctionne comme prévu.
Les développeurs peuvent définir les conditions qui caractérisent des résultats indésirables, et la plateforme peut déclencher une alerte lorsque ces conditions sont réunies.
2. Détection des défaillances et alertes
Dès que des anomalies sont détectées, Raindrop avertit les développeurs et leur présente les éléments de contexte pertinents pour examiner le problème.
La plateforme propose des outils pour :
- Suivre les changements de comportement d’une version de l’agent à l’autre
- Identifier les modifications du prompt ou du système à l’origine des défaillances
- Examiner les traces de raisonnement et les appels d’outils
Les développeurs peuvent ainsi identifier rapidement la cause profonde des défaillances et déployer des correctifs.
3. Outils d’investigation et de débogage
Raindrop propose également des outils qui aident les développeurs à diagnostiquer les problèmes dans les workflows des agents. Ces fonctionnalités permettent aux équipes de passer de la détection des défaillances à l’amélioration du système.
Raindrop AI utilise l’API Responses pour exécuter tous ses workflows d’analyse de longue durée en arrière-plan. Sans elle, la mise en œuvre de ces systèmes de surveillance serait nettement plus difficile.
Workflows de raisonnement approfondi pour les données complexes
Par Eric Provencher de Repo Prompt
Outils utilisés : Codex avec App Server + MCP, recherche web
Modèle utilisé : GPT-5.3-Codex
Plutôt que de laisser le modèle de raisonnement gaspiller sa fenêtre de contexte à parcourir les informations lors de la planification ou des revues, nous utilisons un agent distinct pour sélectionner et organiser le contexte en amont. Notre modèle de raisonnement peut ainsi consacrer autant que possible ses capacités de raisonnement à la résolution de notre tâche.
Eric Provencher a créé un système qui aide les développeurs et les chercheurs à analyser en profondeur de vastes collections de documents, des bases de code et des jeux de données.
Repo Prompt se concentre sur l’ingénierie du contexte : il rassemble, organise et structure automatiquement les informations pertinentes pour qu’un modèle de raisonnement puisse les analyser efficacement.
Alors que de nombreux systèmes d’agents se concentrent sur la collecte de données, l’architecture d’Eric sépare la collecte du contexte du raisonnement approfondi. Le système utilise des workflows d’agents pour rassembler le contexte pertinent, puis transmet ces informations sélectionnées et organisées à un modèle de raisonnement qui se consacre exclusivement à l’analyse.
La plateforme utilise l’API Responses d’OpenAI pour orchestrer des workflows d’agents et des tâches de raisonnement de longue durée, notamment pour :
- L’analyse de vastes bases de code et la planification de l’architecture
- Les workflows de revue de code approfondie
- L’analyse de vastes collections de documents à des fins de recherche
- L’analyse de documents médicaux et scientifiques
Le système repose sur trois composants principaux : des workflows d’agents qui constituent le contexte, des modèles de raisonnement approfondi (workflow « Oracle ») et des boucles itératives de recherche et d’analyse.
1. Workflow de l’agent chargé de constituer le contexte
La première étape du système repose sur un agent chargé de constituer le contexte. Ce workflow analyse de vastes dépôts de données pour déterminer quelles informations sont pertinentes pour une requête donnée.
Grâce aux outils et au raisonnement du modèle via l’API Responses, l’agent repère les fichiers pertinents, les relations entre les documents et les passages contenant les informations clés.
Cette étape produit un ensemble structuré d’éléments de contexte qui sert ensuite d’entrée à l’étape de raisonnement.
2. Workflow de raisonnement approfondi « Oracle »

Contrairement aux agents chargés de constituer le contexte, le modèle « Oracle » (le modèle de raisonnement approfondi) n’effectue aucun appel d’outil ni aucune récupération d’informations supplémentaires. Il se consacre entièrement à l’analyse du contexte sélectionné et organisé qui lui est fourni.
La séparation entre recherche et raisonnement permet au modèle de consacrer toute sa capacité de raisonnement à la compréhension du problème. Dans de nombreux workflows, l’étape de raisonnement peut durer longtemps, le temps d’analyser les relations complexes au sein du contexte fourni.
3. Boucles itératives de recherche et d’analyse
Le système prend également en charge des boucles de raisonnement itératives. Une fois que le modèle de raisonnement a produit une sortie, un autre agent peut examiner les résultats et déterminer si des investigations supplémentaires sont nécessaires.
Si nécessaire, le système lance un nouveau cycle de collecte de contexte et de raisonnement. Cette boucle permet de mener des investigations de longue durée au cours desquelles le système affine progressivement son analyse.
Workflow itératif

Le système s’appuie sur plusieurs capacités de l’API Responses :
- Tâches en arrière-plan : exécutez des tâches de raisonnement de longue durée, pouvant durer plusieurs minutes ou plusieurs heures
- Orchestration d’agents : coordonnez les boucles d’agents pour la collecte du contexte, le raisonnement et la validation
- Observabilité : surveillez et gérez les workflows de raisonnement de longue durée pendant leur exécution
La plateforme utilise les modèles Codex pour rassembler et structurer le contexte pertinent, puis transmet ce contexte soigneusement préparé à des modèles de raisonnement plus performants pour une analyse approfondie. Ces capacités rendent possible l’architecture hybride de la plateforme, qui associe workflows d’agents et modèles de raisonnement approfondi.
Une interface conversationnelle pour les collectionneurs de vinyles
Par Ash Ryan Arnwine de Collxn
Outils : Recherche web et 16 outils personnalisés
Modèle : GPT-5.4, GPT-5 nano
J’avais l’impression que l’API Responses me déchargeait d’une partie du travail, par rapport à d’autres solutions comme la création d’un système complet de génération augmentée par récupération.
Ash Ryan Arnwine a créé « Collxn » (pensez « collection »), un tout petit service à la grande ambition : aider les collectionneurs de vinyles à redécouvrir les disques qui garnissent déjà leurs étagères et à interagir avec eux.
Les collectionneurs gèrent souvent d’immenses collections sur Discogs, parfois riches de plusieurs milliers de disques. Collxn se connecte à leur collection et leur envoie chaque jour un e-mail appelé « Daily Drop », qui met à l’honneur un disque différent accompagné d’informations sur l’artiste, pour les aider à redécouvrir la musique qu’ils possèdent déjà.
Et comme parcourir ses disques est plus amusant quand on peut poser des questions, Collxn utilise l’API Responses d’OpenAI pour proposer une interface de discussion qui permet aux utilisateurs de parler littéralement à leurs disques.
Une interface conversationnelle avec appel d’outils
L’application utilise l’API Responses pour proposer une interface de discussion appelée « Ask This Drop », dans laquelle les utilisateurs peuvent poser des questions sur les disques présentés dans leur Daily Drop.
Le modèle est configuré pour accéder aux outils de l’API Discogs afin de récupérer des informations directement sur Discogs lorsqu’il répond à une question.
Les utilisateurs peuvent par exemple poser les questions suivantes :
- Quel est le prix actuel de ce disque sur le marché ?
- Quels autres albums cet artiste a-t-il sortis ?
- À quel point ce pressage est-il rare ?

Ask This Drop offre aux utilisateurs de Collxn une interface pour discuter avec leurs vinyles.
Les collectionneurs peuvent simplement poser des questions et obtenir des réponses générées à partir de données Discogs en temps réel, enrichies par le contexte de leur propre collection de disques.
Cette approche transforme une collection de disques statique en une expérience conversationnelle ouverte sur l’ensemble de l’écosystème musical.
Daily Drop et actualités des artistes
Collxn utilise également l’Agents SDK d’OpenAI pour générer une rubrique « Actualités récentes » consacrée à l’artiste mis à l’honneur dans l’e-mail Daily Drop.

L’Agents SDK d’OpenAI alimente la rubrique d’actualités des artistes du Daily Drop de Collxn.
Cette fonctionnalité déploie un agent doté de la recherche web pour trouver des articles ou des actualités récents sur l’artiste, puis ajoute ce contexte à l’e-mail quotidien. Chez les utilisateurs de la version bêta, cette rubrique est rapidement devenue l’une des fonctionnalités les plus populaires du produit, car elle crée un lien vivant entre leur collection de disques et le monde extérieur.
Ash a finalement migré Collxn vers l’API Responses pour lancer « Ask This Drop ». L’application a ainsi pu prendre en charge le raisonnement en plusieurs étapes dans les workflows conversationnels, ainsi que les appels d’outils intégrés et personnalisés. L’intégration de l’API Responses dans Collxn utilise l’outil de recherche web intégré pour rechercher des actualités sur les artistes au sein de la discussion, en plus de 16 outils personnalisés qui permettent notamment d’interagir avec l’API Discogs et d’interroger le compte Collxn de l’utilisateur.

L’outil de recherche web de l’API Responses permet de rechercher en direct des actualités sur les artistes dans « Ask This Drop » de Collxn.
Les conversations avec état de l’API Responses simplifient et accélèrent également la gestion des discussions à plusieurs échanges. Dans l’ensemble, Ash a constaté que l’utilisation de l’API Responses simplifiait l’architecture par rapport à la création d’un système complet de génération augmentée par récupération (RAG).
Transformer des enregistrements d’écran en démos produit interactives
Par Nick Sorrentino et Pawel Wszola de l’équipe Arcade
Outils : Utilisation de l’ordinateur
Modèles : GPT-5.2, computer-use-preview
L’intégration de la génération de contenu via l’API a réduit de 50 % le nombre d’étapes nécessaires pour publier une démo, ce qui a considérablement augmenté les taux de publication et l’adoption.
Arcade part d’une pratique déjà courante dans la plupart des équipes, l’enregistrement d’écran, pour en faire une démo produit interactive et soignée. Au lieu de présenter un produit en direct ou de rédiger une documentation étape par étape, les équipes enregistrent un workflow une seule fois, et Arcade s’occupe du reste.
En coulisses, la plateforme analyse l’enregistrement et génère automatiquement un parcours guidé qui explique ce qui se passe à chaque étape.
Workflow de génération des démos
Pendant une session d’enregistrement :
- Un utilisateur enregistre son écran tout en exécutant un workflow.
- Sur ordinateur ou dans le navigateur, Arcade capture directement des interactions structurées telles que les clics, la saisie et le défilement.
- Sur mobile, où le bac à sable d’iOS empêche les applications de capturer les interactions à l’échelle du système, les utilisateurs enregistrent à la place une simple vidéo de l’écran de l’application.
- L’enregistrement est envoyé à l’API Responses d’OpenAI avec l’outil d’utilisation de l’ordinateur, qui analyse les images de la vidéo et en déduit les interactions effectuées.
- Le système convertit ces actions déduites en étapes structurées.
- Arcade génère le texte narratif et les zones interactives qui guident les spectateurs tout au long de la démo.
Ces étapes forment automatiquement le parcours interactif présenté aux utilisateurs.
Les actions structurées sont ensuite transmises à l’API Chat Completions, qui génère les titres et les descriptions des zones interactives affichés tout au long de la démo. Les utilisateurs peuvent ajuster les textes générés à l’aide des outils de modification par IA intégrés, par exemple pour les raccourcir ou les reformuler.
Réduire de moitié les étapes de création des démos
L’automatisation de la narration des démos a considérablement réduit les efforts nécessaires pour publier un parcours de découverte du produit.
Après l’intégration du workflow reposant sur l’API :
- Le nombre médian d’actions nécessaires avant la publication a diminué de 50 %
- Le nombre d’actions au 80e percentile (P80) est passé d’environ 230 à environ 120
- Les taux de publication et l’adoption du produit ont augmenté
En simplifiant le processus de création des démos, Arcade a permis aux équipes de transformer beaucoup plus rapidement des enregistrements bruts en démos interactives soignées.
Mesurer et améliorer la visibilité des marques dans les réponses de l’IA
Par Tunde Adeyinka et Ramon Silva de Hexagon
Outils utilisés : Recherche web
Modèle utilisé : GPT-5.2 Chat
Tunde Adeyinka et Ramon Silva ont fondé Hexagon pour répondre à une nouvelle question que se posent les commerçants : comment les assistants IA parlent-ils de vos produits ?
Alors que les assistants IA influencent de plus en plus la découverte de produits, Hexagon aide les entreprises à suivre la façon dont leurs marques apparaissent dans les réponses générées par l’IA et à améliorer ces résultats au fil du temps.
La plateforme utilise l’API Responses d’OpenAI pour faire fonctionner trois systèmes principaux :
1. Architecture de simulation des réponses
Hexagon exécute chaque jour un pipeline de simulation pour mesurer la façon dont les assistants IA répondent aux questions sur les produits. Le système génère quotidiennement des milliers de prompts réalistes de consommateurs, de prompts demandant des recommandations de produits et de requêtes d’achat, puis les soumet à l’API Responses. Les résultats renvoyés sont analysés pour suivre la visibilité des marques dans les réponses générées par l’IA.
Les commerçants clients d’Hexagon peuvent ainsi voir à quelle fréquence leurs produits apparaissent et comment ces réponses évoluent au fil du temps.

2. Pipeline multi-agent de génération de contenu
En plus de ses fonctions d’analyse, Hexagon utilise l’API Responses pour générer du contenu optimisé qui améliore la visibilité des marques dans les réponses de l’IA.
Le système repose sur une architecture à quatre agents. Chaque agent réalise une étape spécialisée du pipeline et transmet ses résultats à l’étape suivante, jusqu’à la production et à la publication du contenu final. Les agents communiquent au sein de boucles non déterministes pour affiner le contenu de manière itérative avant sa publication.

3. Tableau de bord et outils pour les clients
La plateforme comprend également « Hexi », un chatbot qui utilise l’appel de fonction via l’API Responses. Avec Hexi, les clients peuvent explorer les données d’analyse en dialoguant et générer en toute autonomie des synthèses de leurs données de visibilité dans les réponses de l’IA. Hexagon présente ses analyses dans un tableau de bord destiné aux commerçants, qui suit la façon dont les produits apparaissent dans les réponses générées par l’IA.

Hexagon s’appuie sur plusieurs capacités clés de l’API Responses pour rendre les simulations réalistes et utiles dans l’ensemble de son produit :
- Recherche web : reproduit des réponses s’appuyant sur la navigation web, semblables à celles de ChatGPT.
- Paramètre de localisation de l’utilisateur : simule des requêtes provenant de différentes régions pour tester les variations géographiques.
- Effort de raisonnement : contrôle la profondeur et la complexité des réponses.
- Nombre maximal de tokens de sortie : limite la longueur des réponses pour les contenus longs.
- Persistance du contexte : conserve le contexte d’un appel à l’autre, ce qui permet d’exécuter des workflows multi-agents.
L’API Responses a amélioré la qualité des réponses et renforcé la persistance du contexte sur plusieurs appels, deux éléments essentiels pour les pipelines en plusieurs étapes qui font fonctionner la plateforme d’Hexagon.
Pour conclure
En un an, l’API Responses est devenue une brique essentielle pour les développeurs qui créent des logiciels agentiques.
Ces cinq témoignages de développeurs en donnent des exemples concrets : des systèmes multi-agents qui coordonnent des outils, détectent des bugs, exécutent des workflows et permettent de livrer des produits reposant sur l’IA.
La plateforme elle-même évolue rapidement : une meilleure orchestration et des écosystèmes d’outils plus riches, avec de nouveaux ajouts comme les conteneurs hébergés par OpenAI avec accès réseau et les outils shell.
Plus d’outils.
Plus de capacités.
Plus de développeurs qui créent des choses auxquelles nous n’avons pas encore pensé.
Voyons ce que les développeurs créeront au cours de cette deuxième année.