開發新的對話式語音應用程式,請從 GPT-Live 開始。它能一邊說話一邊聆聽,並在後端智慧體進行推理、使用工具或完成任務時,讓對話持續進行。
依照 WebRTC 快速入門建立第一個對話連線,接著撰寫簡短的 Live 提示詞。如果你已有 Realtime 應用程式或文字智慧體,請參閱遷移至 GPT-Live。
選擇其他音訊工作流程
若需要 Realtime API 的作業階段與工具模型,請使用 Realtime API。若要進行轉錄、翻譯或語音生成,且不需要對話式智慧體,請選擇下方的專用 API。
| 開發目標 | 入門指南 | 可控制的項目 |
|---|---|---|
| 使用 Realtime 作業階段與工具模型的語音到語音智慧體 | Realtime API | 音訊回合、作業階段狀態、工具及中斷。 |
| 現有文字智慧體的語音介面 | 語音智慧體 | 先將語音轉為文字,執行文字智慧體工作流程,再將文字轉為語音。 |
| 音訊檔案的轉錄文字 | 檔案轉錄 | 檔案上傳、範圍明確的請求,以及支援的轉錄格式。 |
| 不含助理語音的即時字幕 | 即時轉錄 | 串流音訊及增量轉錄事件。 |
| 連續語音翻譯 | 即時翻譯 | 專用翻譯作業階段,而非語音智慧體的回合循環。 |
| 旁白或生成的語音 | 文字轉語音 | 文字、語音及輸出格式。 |
| 現有對話應用程式中的音訊輸入或輸出 | Chat Completions 中的音訊 | 範圍明確的多模態對話請求。 |
開發語音應用
透過語音智慧體指南比較架構。先閱讀 GPT-Live 或 Realtime 的提示詞指南,再參閱自訂語音、評估及成本最佳化的共用指南。各指南都會區分特定模型或 API 的行為。
選擇連線方式
若要在瀏覽器中使用音訊,請從 WebRTC 開始。伺服器音訊處理流程請使用 WebSockets。電話通話請參閱電話通訊與 SIP。伺服器端控制連線可讓受信任的後端觀察並控制媒體作業階段。
請在各連線說明頁面選擇你使用的 API。即使使用相同的傳輸方式,GPT-Live 與 Realtime 的交握程序、憑證或事件格式也不能互換。請參閱連線指南,了解先決條件與設定步驟。
為現有應用程式加入音訊功能
Chat Completions 範例現已移至Chat Completions 中的音訊。若要開始開發瀏覽器語音智慧體,請使用 GPT-Live WebRTC 快速入門。