Les capacités audio de l’IA ouvrent de nouvelles perspectives prometteuses pour les expériences utilisateur. Plus tôt cette année, nous avons lancé plusieurs nouveaux modèles audio, dont gpt-realtime, ainsi que de nouvelles fonctionnalités d’API pour permettre aux développeurs de créer ces expériences.
La semaine dernière, nous avons publié de nouvelles versions figées des modèles audio pour répondre à certaines difficultés courantes dans la création d’agents audio fiables. Elles améliorent la fiabilité et la qualité des workflows vocaux en production, de la transcription et de la synthèse vocale aux agents fonctionnant nativement de parole à parole en temps réel.
Ces mises à jour comprennent :
gpt-4o-mini-transcribe-2025-12-15pour la transcription avec l’API de transcription ou Realtime APIgpt-4o-mini-tts-2025-12-15pour la synthèse vocale avec l’API Speechgpt-realtime-mini-2025-12-15pour les interactions natives de parole à parole en temps réel avec Realtime APIgpt-audio-mini-2025-12-15pour les interactions natives de parole à parole avec l’API Chat Completions
Les nouvelles versions figées apportent plusieurs améliorations communes :
Pour les entrées audio :
- Des taux d’erreur sur les mots plus faibles pour les enregistrements audio en conditions réelles et en milieu bruyant
- Moins d’hallucinations pendant les silences ou en présence de bruit de fond
Pour les sorties audio :
- Une voix plus naturelle et plus stable, y compris avec les voix personnalisées
Les tarifs restent identiques à ceux des versions figées précédentes. Nous vous recommandons donc de passer à ces nouvelles versions pour bénéficier de meilleures performances au même prix.
Si vous développez des agents vocaux, des systèmes d’assistance client ou des expériences vocales à l’image d’une marque, ces mises à jour vous aideront à fiabiliser vos déploiements en production. Nous détaillons ci-dessous les nouveautés et leurs effets concrets dans les workflows vocaux.
Parole à parole
Nous déployons de nouveaux modèles Realtime mini et Audio mini optimisés pour mieux appeler les outils et suivre les instructions. Ces modèles réduisent l’écart de capacités entre les modèles mini et leurs versions complètes, ce qui permet à certaines applications de réduire leurs coûts en passant au modèle mini.
gpt-realtime-mini-2025-12-15
Le modèle gpt-realtime-mini est conçu pour être utilisé avec Realtime API, notre API dédiée aux interactions nativement multimodales à faible latence. Il prend notamment en charge le streaming audio en entrée et en sortie, la gestion des interruptions (avec détection facultative de l’activité vocale) et l’appel de fonction en arrière-plan pendant que le modèle continue de parler.
La nouvelle version figée de Realtime mini est mieux adaptée aux agents en temps réel, avec des progrès nets dans le suivi des instructions et l’appel d’outils. Lors de nos évaluations internes de parole à parole, nous avons constaté une amélioration de 18,6 points de pourcentage de la précision du suivi des instructions et de 12,9 points de pourcentage de la précision des appels d’outils par rapport à la version précédente, ainsi qu’une amélioration sur le benchmark Big Bench Audio.



Ensemble, ces progrès rendent les interactions en plusieurs étapes plus fiables et l’exécution des fonctions plus régulière dans les échanges en direct à faible latence.
Pour les scénarios où la précision de l’agent justifie un coût plus élevé, gpt-realtime reste notre modèle le plus performant. Mais lorsque le coût et la latence sont prioritaires, gpt-realtime-mini constitue un excellent choix et offre de bonnes performances en conditions réelles.
Par exemple, Genspark l’a soumis à des tests intensifs de traduction bilingue et de routage intelligent selon l’intention. Outre une meilleure qualité vocale, l’équipe a constaté des réponses quasi instantanées, avec une reconnaissance toujours précise des intentions tout au long d’échanges rapides.
gpt-audio-mini-2025-12-15
Le modèle gpt-audio-mini peut être utilisé avec l’API Chat Completions pour les cas d’utilisation de parole à parole qui ne nécessitent pas d’interaction en temps réel.
Les deux nouvelles versions figées intègrent également un décodeur amélioré qui produit des voix plus naturelles et préserve mieux leur stabilité lors de l’utilisation de voix personnalisées.
Synthèse vocale
Notre dernier modèle de synthèse vocale, gpt-4o-mini-tts-2025-12-15, marque un progrès significatif en matière de précision, avec des taux d’erreur sur les mots nettement inférieurs à ceux de la génération précédente sur les benchmarks vocaux standard. Sur Common Voice et FLEURS, nous observons une baisse d’environ 35 % du taux d’erreur sur les mots (WER), ainsi que des gains réguliers sur Multilingual LibriSpeech.



Dans leur ensemble, ces résultats témoignent d’une prononciation plus précise et plus robuste dans un large éventail de langues.
Comme la nouvelle version figée de gpt-realtime-mini, ce modèle produit une voix beaucoup plus naturelle et donne de meilleurs résultats avec les voix personnalisées.
Transcription
Le dernier modèle de transcription, gpt-4o-mini-transcribe-2025-12-15, affiche des progrès importants en matière de précision et de fiabilité. Sur les benchmarks standard de reconnaissance automatique de la parole (ASR), tels que Common Voice et FLEURS (sans indication de langue), il obtient des taux d’erreur sur les mots inférieurs à ceux des modèles précédents. Nous avons optimisé son comportement dans les conversations en conditions réelles, notamment lorsque les utilisateurs prononcent des énoncés courts ou en présence de bruit de fond. Lors d’une évaluation interne des hallucinations en présence de bruit , au cours de laquelle nous avons diffusé des extraits de bruits de fond réels et des enregistrements audio avec des intervalles de parole variables (y compris des silences), le modèle a produit environ 90 % d’hallucinations en moins que Whisper v2 et environ 70 % de moins que les modèles GPT-4o-transcribe précédents.



Cette version figée du modèle est particulièrement performante en chinois (mandarin), en hindi, en bengali, en japonais, en indonésien et en italien.
Voix personnalisées
Les voix personnalisées permettent aux organisations d’échanger avec leurs clients en utilisant une voix propre à leur marque. Que vous développiez un agent d’assistance client ou un avatar de marque, la technologie de voix personnalisées d’OpenAI facilite la création de voix distinctives et réalistes.
Ces nouveaux modèles de parole à parole et de synthèse vocale améliorent les voix personnalisées : intonations plus naturelles, fidélité accrue à l’échantillon d’origine et meilleure précision dans les différents dialectes.
Afin de garantir une utilisation sûre de cette technologie, les voix personnalisées sont réservées aux clients éligibles. Contactez votre responsable de compte ou notre équipe commerciale pour en savoir plus.
Du prototype à la production
Les applications vocales ont tendance à rencontrer les mêmes difficultés, principalement lors de longues conversations, dans des cas limites comme les silences, ou dans des workflows faisant appel à des outils où l’agent vocal doit être précis. Ces mises à jour ciblent ces défaillances : taux d’erreur plus faibles, moins d’hallucinations, utilisation plus régulière des outils et meilleur suivi des instructions. En complément, nous avons amélioré la stabilité de l’audio généré pour rendre vos expériences vocales plus naturelles.
Si vous proposez déjà des expériences vocales, nous vous recommandons de passer aux nouvelles versions figées 2025-12-15 et de réexécuter vos principaux cas de test de production.
Les premiers testeurs ont confirmé des améliorations notables en passant simplement aux nouvelles versions, sans modifier leurs instructions. Nous vous recommandons toutefois de les essayer sur vos propres cas d’utilisation et d’ajuster vos prompts si nécessaire.