For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主要導覽

開始使用 GPT-Live

打造在後端智慧體執行工作時仍能持續進行的語音對話。

GPT-Live 負責語音對話,後端智慧體則同時查詢資訊、使用工具並完成任務。它能一邊說話一邊聆聽,這項能力稱為 全雙工。將工作交給後端稱為 委派:後端執行工作時,對話仍可持續進行。

例如,使用者可以詢問訂單,在後端查詢訂單狀態時補充細節,並在結果就緒後聽取回覆。你可以獨立選擇後端模型或智慧體,不受語音模型限制;Realtime 則使用同一個模型處理語音、推理和工具選擇。

了解兩個部分的分工

  • GPT-Live 負責對話。 它會聆聽、說話,並決定何時向後端尋求協助。請用簡短的提示詞設定對話風格和委派時機。
  • 後端負責處理委派的任務。 使用 Responses 委派時,請選用支援的 Responses 模型。使用用戶端委派時,則可連接應用程式執行的任何模型、智慧體任務執行框架或服務。後端會進行推理、使用工具,並傳回結果,由 GPT-Live 傳達。請將詳細指示、業務規則和工具工作流程放在後端。

你的應用程式負責管理權限、確認、私有函式執行,以及持久保存的任務狀態。打斷語音不會自動取消後端工作。請參閱語音智慧體,比較 GPT-Live、Realtime 和串接式語音應用程式。

選擇後端執行方式

如果託管後端符合需求,可先使用 Responses 委派:GPT-Live 會呼叫你設定的 Responses 模型、提供對話上下文,並傳回結果。如果應用程式需要控制後端執行、上下文,或哪些結果會傳給 GPT-Live,請選擇 用戶端委派

請參閱選擇委派模式,了解比較結果和組態詳細資訊。建立工作階段時就要選定模式;若要變更模式,請啟動新的工作階段。

連接你的第一個工作階段

GPT-Live WebRTC 快速入門開始。其中的瀏覽器與伺服器範例會連接麥克風輸入和喇叭輸出,並搭配可搜尋網頁的 Responses 後端。

你需要麥克風、透過 HTTPS 或 localhost 提供的瀏覽器頁面,以及持有 OpenAI 專案 API 金鑰的可信任伺服器。請將金鑰保留在伺服器上。

  1. 撰寫簡短的對話提示詞,告訴 GPT-Live 何時向後端尋求協助。
  2. 依照快速入門指南連接瀏覽器的麥克風、音訊播放和事件通道。你的伺服器會建立工作階段,並將瀏覽器的連線提議送出以取得回應。
  3. 等待 session.started 事件,然後說話並聆聽回覆。提出需要最新資訊才能回答的問題,試用網頁搜尋後端。
  4. 結束對話並關閉工作階段,以取得最終用量並釋放連線。

請同時檢查語音對話和後端結果。工作階段啟動事件可確認啟動成功;聆聽回覆和檢查搜尋結果,則分別驗證應用程式的不同部分。

GPT-Live 語音工作階段依持續時間按秒計費。目前費率請參閱模型定價。後端模型和工具用量另行計費。請參閱成本最佳化,了解用量計算方式和降低成本的方法。

選擇連線方式

  • WebRTC 適用於瀏覽器語音應用程式。媒體軌道傳輸音訊,資料通道則傳輸 JSON 事件。
  • WebSockets 適用於伺服器端音訊整合。主要通訊端傳輸音訊和控制事件。
  • 伺服器端控制 讓後端存取現有工作階段。帶外連線負責傳輸事件,音訊則仍透過主要連線傳輸。
  • 電話通訊與 SIP 提供電話整合方式和供應商相關指引。

合作夥伴整合

如果應用程式是使用 LiveKitTwilioTelnyxDaily/Pipecat 建置的,請先參閱合作夥伴整合概覽,為現有的媒體傳輸路徑選擇連線方式。

繼續開發