For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主要導覽

轉錄

為錄製完成或即時傳入的音訊選擇合適的工作流程。

轉錄會將語音轉換為文字。請根據音訊是已錄製完成,還是即時傳入,選擇工作流程。每種工作流程都有一個建議優先使用的模型。

選擇轉錄工作流程

工作流程 適用情境 建議模型
檔案轉錄

你有已錄製完成的音訊,或範圍明確的音訊請求。上傳檔案後,即可取得最終轉錄文字,或在檔案處理期間以串流方式接收文字。

gpt-transcribe

即時轉錄

你有來自麥克風、通話或其他來源的即時音訊串流,且需要在語音傳入時取得文字。

gpt-live-transcribe

是否串流輸出與是否處理即時音訊,是兩個獨立的選擇。你可以串流接收已錄製完成檔案的轉錄文字,無須開啟 Realtime 工作階段。只有在音訊即時傳入或需要持續連線時,才使用 Realtime。

選擇專用功能

先使用工作流程的建議模型。只有在應用程式需要預設模型未提供的功能時,才切換模型。

如果你需要請使用
標註說話者的轉錄文字gpt-4o-transcribe-diarize 搭配檔案轉錄
逐字時間戳記,或 srtvtt 字幕whisper-1 搭配檔案轉錄
將已錄製完成的音訊翻譯成英文whisper-1 搭配音訊翻譯端點
偵測到的輸入語言gpt-transcribe 搭配檔案轉錄
透過 WebSocket 轉錄已提交的回合gpt-transcribe 搭配即時轉錄

現有整合可在支援的情況下繼續使用 gpt-4o-transcribegpt-4o-mini-transcribegpt-realtime-whisper。建立新的轉錄整合時,不建議優先使用這些模型。

請參閱轉錄定價,並在遷移正式環境流量之前,使用具代表性的音訊測試建議的流程。

提升轉錄品質

gpt-transcribegpt-live-transcribe 接受三種上下文:

  • prompt:以自由格式描述錄音的上下文,例如主題或情境。
  • keywords:音訊中可能出現的確切詞彙,例如產品名稱、藥品名稱或縮寫。
  • languages:錄音可能包含多種語言時,預期輸入語言的清單。

這些輸入僅應用來提供與音訊相關的上下文,請勿重述轉錄任務。關鍵字只是提示,並非必須輸出的內容。只有音訊中確實出現某個關鍵字時,轉錄文字才應包含該字詞。

這些模型使用 languages,而非單數形式的 language 欄位。接受單一語言提示的現有轉錄模型仍使用 language

gpt-transcribe 在 Realtime API 工作階段中轉錄輸入音訊,或在專用的轉錄工作階段中執行時,會自動將先前已轉錄的回合作為上下文。

使用具代表性的音訊進行測試

請在應用程式實際會遇到的音訊條件下測試轉錄,包含:

  • 目標語言、口音,以及不同語言混用的模式。
  • 背景噪音、麥克風品質及電話音訊。
  • 名稱、數字、日期、英數字串及領域術語。
  • 簡短話語、長時間錄音及中途被打斷的語音。

追蹤會影響應用程式的錯誤,不要只依賴詞錯誤率。例如,在醫療照護工作流程中測試藥品名稱,或在客服工作流程中測試訂單編號。

後續步驟