For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主要導覽
2025年12月22日 音訊

語音應用開發人員最新消息

全新音訊模型快照,並擴大自訂語音的開放範圍,支援正式環境中的語音應用程式。

作者: Derek Salama

語音應用開發人員最新消息

AI 音訊能力為使用者體驗開啟了令人期待的新可能。今年稍早,我們推出了多款全新音訊模型,包括 gpt-realtime,以及新的 API 功能,協助開發人員打造這些體驗。

上週,我們推出了新的音訊模型快照,旨在提升正式環境中各類語音工作流程的可靠性與品質,解決打造可靠音訊智慧體時的部分常見挑戰。這些改進涵蓋轉錄、文字轉語音,以及原生支援即時語音到語音的智慧體。

這次更新包括:

這些新快照有幾項共同的改進:

音訊輸入方面:

  • 處理真實環境與含有雜訊的音訊時,詞錯誤率更低
  • 在靜音或有背景雜訊時,產生的幻覺更少

音訊輸出方面:

  • 語音輸出更自然、更穩定,使用自訂語音時也是如此

定價與先前的模型快照相同,因此我們建議切換至這些新快照,以相同的價格享有更好的效能。

如果你正在打造語音智慧體、客服系統或品牌語音體驗,這些更新將有助於提高正式環境部署的可靠性。以下我們將逐一介紹更新內容,以及這些改進在實際語音工作流程中的效果。

語音到語音

我們正在部署新的 Realtime mini 和 Audio mini 模型,進一步改善工具呼叫和指令遵循能力。這些模型縮小了 mini 與完整規模模型之間的智慧差距,讓部分應用程式能改用 mini 模型來節省成本。

gpt-realtime-mini-2025-12-15

gpt-realtime-mini 模型專為搭配 Realtime API 使用而設計,這是我們用於低延遲原生多模態互動的 API。它支援音訊串流輸入與輸出、處理使用者插話(可選擇啟用語音活動偵測),以及在模型持續說話時於背景進行函式呼叫等功能。

新的 Realtime mini 快照在指令遵循和工具呼叫方面有明顯進步,更適合用於即時智慧體。在我們的內部語音到語音評估中,相較於上一個快照,指令遵循準確率提高了 18.6 個百分點,工具呼叫準確率提高了 12.9 個百分點,在 Big Bench Audio 基準測試中的表現也有所提升。

語音到語音評估圖表 1語音到語音評估圖表 2語音到語音評估圖表 3

綜合來看,這些改進讓即時、低延遲環境中的多步驟互動更加可靠,函式執行也更加一致。

對於值得花費更高成本來提高智慧體準確率的情境,gpt-realtime 仍是我們表現最好的模型。不過,如果成本和延遲是首要考量,gpt-realtime-mini 是很好的選擇,在真實情境中也有出色表現。

例如,Genspark 針對雙語翻譯和智慧意圖路由對它進行了壓力測試。他們發現,除了語音品質提升之外,回應也幾乎毫無延遲,而且在快速往返的對話中,意圖辨識始終精準。

gpt-audio-mini-2025-12-15

gpt-audio-mini 模型可搭配 Chat Completions API 使用,適用於不需要即時互動的語音到語音使用案例。

這兩個新快照也都搭載升級後的解碼器,讓語音聽起來更自然,並在使用自訂語音時更能維持聲音的一致性。

文字轉語音

我們最新的文字轉語音模型 gpt-4o-mini-tts-2025-12-15 在準確度上有大幅提升,相較於上一代,在各項標準語音基準測試中的詞錯誤率都顯著降低。在 Common Voice 和 FLEURS 上,詞錯誤率(WER)降低了約 35%,在 Multilingual LibriSpeech 上也有一致的進步。

文字轉語音評估圖表 1文字轉語音評估圖表 2文字轉語音評估圖表 3

整體而言,這些結果顯示,模型在多種語言的發音準確度和穩健性上都有提升。

與新的 gpt-realtime-mini 快照類似,這個模型的語音聽起來自然許多,使用自訂語音時的表現也更好。

語音轉文字

最新的轉錄模型 gpt-4o-mini-transcribe-2025-12-15 在準確度和可靠性上都有顯著進步。在 Common Voice 和 FLEURS 等標準 ASR 基準測試中(不提供語言提示),它的詞錯誤率低於先前的模型。我們針對模型在真實對話情境中的表現進行了最佳化,例如使用者的簡短發言和嘈雜的背景。在內部的 雜訊環境下幻覺 評估中,我們播放真實環境的背景雜訊片段,以及說話間隔長短不一的音訊(包含靜音)。結果顯示,這個模型產生的幻覺比 Whisper v2 少約 90%,比先前的 GPT-4o-transcribe 模型少約 70%。

轉錄評估圖表 1轉錄評估圖表 2轉錄評估圖表 3

這個模型快照在中文(國語)、印地語、孟加拉語、日語、印尼語和義大利語方面的表現尤其出色。

自訂語音

自訂語音讓組織能以獨特的品牌聲音與客戶互動。無論你正在打造客服智慧體還是品牌虛擬化身,OpenAI 的自訂語音技術都能讓你輕鬆建立鮮明、逼真的聲音。

這些新的語音到語音和文字轉語音模型為自訂語音帶來多項改進,包括更自然的語調、更忠於原始樣本的聲音,以及在不同方言中更高的準確度。

為確保這項技術的安全使用,自訂語音僅開放給符合資格的客戶。請聯絡你的客戶總監,或洽詢我們的業務團隊以瞭解詳情。

從原型到正式環境

語音應用程式往往在相同的情況下出問題,主要是長時間對話、靜音等邊界情況,以及需要語音智慧體精準操作的工具驅動流程。這些更新聚焦於解決這些問題:降低錯誤率、減少幻覺、讓工具使用更加一致,並更準確地遵循指令。此外,我們也提升了輸出音訊的穩定性,讓你的語音體驗聽起來更自然。

如果你目前正在推出語音體驗,我們建議改用新的 2025-12-15 快照,並重新執行正式環境的關鍵測試案例。 早期測試者已確認,即使不修改指令,只切換至新快照,也能看到明顯改善。不過,我們仍建議你針對自己的使用案例進行實驗,並視需要調整提示詞。