AI 音訊能力為使用者體驗開啟了令人期待的新可能。今年稍早,我們推出了多款全新音訊模型,包括 gpt-realtime,以及新的 API 功能,協助開發人員打造這些體驗。
上週,我們推出了新的音訊模型快照,旨在提升正式環境中各類語音工作流程的可靠性與品質,解決打造可靠音訊智慧體時的部分常見挑戰。這些改進涵蓋轉錄、文字轉語音,以及原生支援即時語音到語音的智慧體。
這次更新包括:
gpt-4o-mini-transcribe-2025-12-15:搭配轉錄 API 或 Realtime API,將語音轉為文字gpt-4o-mini-tts-2025-12-15:搭配 Speech API,將文字轉為語音gpt-realtime-mini-2025-12-15:搭配 Realtime API,提供原生即時語音到語音功能gpt-audio-mini-2025-12-15:搭配 Chat Completions API,提供原生語音到語音功能
這些新快照有幾項共同的改進:
音訊輸入方面:
- 處理真實環境與含有雜訊的音訊時,詞錯誤率更低
- 在靜音或有背景雜訊時,產生的幻覺更少
音訊輸出方面:
- 語音輸出更自然、更穩定,使用自訂語音時也是如此
定價與先前的模型快照相同,因此我們建議切換至這些新快照,以相同的價格享有更好的效能。
如果你正在打造語音智慧體、客服系統或品牌語音體驗,這些更新將有助於提高正式環境部署的可靠性。以下我們將逐一介紹更新內容,以及這些改進在實際語音工作流程中的效果。
語音到語音
我們正在部署新的 Realtime mini 和 Audio mini 模型,進一步改善工具呼叫和指令遵循能力。這些模型縮小了 mini 與完整規模模型之間的智慧差距,讓部分應用程式能改用 mini 模型來節省成本。
gpt-realtime-mini-2025-12-15
gpt-realtime-mini 模型專為搭配 Realtime API 使用而設計,這是我們用於低延遲原生多模態互動的 API。它支援音訊串流輸入與輸出、處理使用者插話(可選擇啟用語音活動偵測),以及在模型持續說話時於背景進行函式呼叫等功能。
新的 Realtime mini 快照在指令遵循和工具呼叫方面有明顯進步,更適合用於即時智慧體。在我們的內部語音到語音評估中,相較於上一個快照,指令遵循準確率提高了 18.6 個百分點,工具呼叫準確率提高了 12.9 個百分點,在 Big Bench Audio 基準測試中的表現也有所提升。



綜合來看,這些改進讓即時、低延遲環境中的多步驟互動更加可靠,函式執行也更加一致。
對於值得花費更高成本來提高智慧體準確率的情境,gpt-realtime 仍是我們表現最好的模型。不過,如果成本和延遲是首要考量,gpt-realtime-mini 是很好的選擇,在真實情境中也有出色表現。
例如,Genspark 針對雙語翻譯和智慧意圖路由對它進行了壓力測試。他們發現,除了語音品質提升之外,回應也幾乎毫無延遲,而且在快速往返的對話中,意圖辨識始終精準。
gpt-audio-mini-2025-12-15
gpt-audio-mini 模型可搭配 Chat Completions API 使用,適用於不需要即時互動的語音到語音使用案例。
這兩個新快照也都搭載升級後的解碼器,讓語音聽起來更自然,並在使用自訂語音時更能維持聲音的一致性。
文字轉語音
我們最新的文字轉語音模型 gpt-4o-mini-tts-2025-12-15 在準確度上有大幅提升,相較於上一代,在各項標準語音基準測試中的詞錯誤率都顯著降低。在 Common Voice 和 FLEURS 上,詞錯誤率(WER)降低了約 35%,在 Multilingual LibriSpeech 上也有一致的進步。



整體而言,這些結果顯示,模型在多種語言的發音準確度和穩健性上都有提升。
與新的 gpt-realtime-mini 快照類似,這個模型的語音聽起來自然許多,使用自訂語音時的表現也更好。
語音轉文字
最新的轉錄模型 gpt-4o-mini-transcribe-2025-12-15 在準確度和可靠性上都有顯著進步。在 Common Voice 和 FLEURS 等標準 ASR 基準測試中(不提供語言提示),它的詞錯誤率低於先前的模型。我們針對模型在真實對話情境中的表現進行了最佳化,例如使用者的簡短發言和嘈雜的背景。在內部的 雜訊環境下幻覺 評估中,我們播放真實環境的背景雜訊片段,以及說話間隔長短不一的音訊(包含靜音)。結果顯示,這個模型產生的幻覺比 Whisper v2 少約 90%,比先前的 GPT-4o-transcribe 模型少約 70%。



這個模型快照在中文(國語)、印地語、孟加拉語、日語、印尼語和義大利語方面的表現尤其出色。
自訂語音
自訂語音讓組織能以獨特的品牌聲音與客戶互動。無論你正在打造客服智慧體還是品牌虛擬化身,OpenAI 的自訂語音技術都能讓你輕鬆建立鮮明、逼真的聲音。
這些新的語音到語音和文字轉語音模型為自訂語音帶來多項改進,包括更自然的語調、更忠於原始樣本的聲音,以及在不同方言中更高的準確度。
為確保這項技術的安全使用,自訂語音僅開放給符合資格的客戶。請聯絡你的客戶總監,或洽詢我們的業務團隊以瞭解詳情。
從原型到正式環境
語音應用程式往往在相同的情況下出問題,主要是長時間對話、靜音等邊界情況,以及需要語音智慧體精準操作的工具驅動流程。這些更新聚焦於解決這些問題:降低錯誤率、減少幻覺、讓工具使用更加一致,並更準確地遵循指令。此外,我們也提升了輸出音訊的穩定性,讓你的語音體驗聽起來更自然。
如果你目前正在推出語音體驗,我們建議改用新的 2025-12-15 快照,並重新執行正式環境的關鍵測試案例。
早期測試者已確認,即使不修改指令,只切換至新快照,也能看到明顯改善。不過,我們仍建議你針對自己的使用案例進行實驗,並視需要調整提示詞。