For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主要導覽

成本最佳化

提升效率並降低成本。

使用 OpenAI 模型時,有多種方法可以降低成本。成本與延遲通常密切相關;減少 Token 數量與請求次數,一般也能加快處理速度。此外,OpenAI 的 Batch API 和彈性處理也能協助降低成本。

成本與延遲

若要降低延遲與成本,可以考慮以下策略:

  • 減少請求:減少完成任務所需的請求次數。
  • 盡量減少 Token:減少輸入 Token 的數量,並透過最佳化讓模型輸出更精簡。
  • 選用較小的模型:選擇能兼顧準確度、較低成本與較低延遲的模型。

如需深入瞭解這些策略,請參閱我們的延遲最佳化指南。

Batch API

以非同步方式處理作業。Batch API 提供一組簡單易用的端點,讓你將多個請求彙整至單一檔案,啟動批次處理作業來執行這些請求,在請求執行期間查詢該批次的狀態,並在批次完成後取得彙整的結果。

開始使用 Batch API →

彈性處理

大幅降低 Chat Completions 或 Responses 請求的成本,但回應時間較長,且偶爾會遇到資源無法使用的情況。適合非正式環境或優先順序較低的任務,例如模型評估、資料擴充或非同步工作負載。

開始使用彈性處理 →