無論選擇 gpt-6-astra,還是 gpt-5.6-terra 這類較小的模型,都需要平衡 準確度、 延遲與 成本。本指南將說明關鍵原則,並提供實際範例,協助你做出有根據的決策。
核心原則
模型選擇的原則很簡單:
- 先最佳化準確度: 持續改善準確度,直到達成目標。
- 再最佳化成本與延遲: 接著在維持準確度的前提下,盡可能採用成本最低、速度最快的模型。
1. 先專注於準確度
首先,為你的使用情境設定明確的準確度目標,釐清準確度必須達到什麼程度,才足以投入正式環境。你可以透過以下步驟達成:
- 設定明確的準確度目標: 確定要採用的準確度統計指標及其目標值。
- 例如,90% 的客服來電需要在首次互動時就正確分類並分派處理。
- 建立評估資料集: 建立資料集,讓你能根據這些目標衡量模型的表現。
- 延續上述範例,收集 100 筆互動範例,記錄使用者的需求、LLM 的分類分派結果、正確的分類分派結果,以及模型的判斷是否正確。
- 使用能力最強的模型進行最佳化: 先使用目前可用、能力最強的模型,達成準確度目標。記錄所有回應,以便之後用於蒸餾較小的模型。
- 使用檢索增強生成來最佳化準確度
- 使用微調來最佳化一致性與行為
在此過程中,收集成對的提示詞與生成結果,以供評估、少樣本學習或微調使用。這種做法稱為 提示詞烘焙,可協助你產生高品質範例,供日後使用。
如需更多相關方法與工具,請參閱我們的準確度最佳化指南。
設定切合實際的準確度目標
評估模型決策對財務的影響,即可計算出切合實際的準確度目標。以假新聞分類為例:
- 新聞分類正確: 如果模型分類正確,就能省下人工審查的成本,假設這筆成本為 $50。
- 新聞分類錯誤: 如果模型將沒有問題的文章誤判為假新聞,或漏判了假新聞,就可能需要啟動審查程序,甚至引發投訴,這可能帶來 $300 的成本。
在這個新聞分類範例中,準確度必須達到 85.8% 才能收支平衡,因此將目標設為 90% 或以上,就能確保整體投資有正向回報。你可以依據自身的成本結構,透過這些計算設定有效的準確度目標。
2. 最佳化成本與延遲
成本與延遲是次要考量,因為如果模型無法達成準確度目標,討論這些問題也就沒有意義。不過,一旦找到適合使用情境的模型,你就可以採取以下兩種方法之一:
- 以較小模型的零樣本或少樣本表現進行比較: 換用更小、成本更低的模型,測試它是否能在降低成本與延遲的同時維持準確度。
- 模型蒸餾: 使用準確度最佳化過程中收集的資料,微調較小的模型。
成本與延遲通常相互關聯;減少 Token 數量與請求次數,通常也能加快處理速度。
這個階段可考慮的主要策略包括:
- 減少請求: 限制完成任務所需的請求次數。
- 盡量減少 Token: 減少輸入 Token 數量,並調整模型,使其輸出更精簡。
- 選擇較小的模型: 採用能在維持準確度的同時,兼顧降低成本與延遲的模型。
如需深入瞭解這些策略,請參閱我們的延遲最佳化指南。
原則的例外情況
這些原則有明確的例外情況。如果你的使用情境對成本或延遲極為敏感,請在開始測試前先設定這些指標的上限,再排除超出上限的模型。設定好基準後,這些指引就能協助你在既有限制內提升模型準確度。
實際範例
為了示範這些原則,我們將開發一個假新聞分類器,並設定以下目標指標。下方實驗使用 GPT-4o 系列過往的結果來展示工作流程;目前進行評估時,請先使用 gpt-6-astra,再與較小或經過微調的模型比較。
- 準確度: 達到 90% 的分類正確率
- 成本: 每 1,000 篇文章的花費低於 $5
- 延遲: 每篇文章的處理時間維持在 2 秒以內
實驗
為了達成目標,我們進行了三項實驗:
- 零樣本: 使用
GPT-4o搭配基本提示詞處理 1,000 筆資料,但未達到準確度目標。 - 少樣本學習: 加入 5 個少樣本範例,達到了準確度目標,但提示詞的 Token 數量增加,導致成本超標。
- 微調模型: 使用 1,000 個已標註範例微調
GPT-4o-mini,在維持相近延遲與準確度的同時,大幅降低成本,達成了所有目標。
| ID | 方法 | 準確度 | 準確度目標 | 成本 | 成本目標 | 平均延遲 | 延遲目標 |
|---|---|---|---|---|---|---|---|
| 1 | gpt-4o 零樣本 | 84.5% | $1.72 | < 1s | |||
| 2 | gpt-4o 少樣本 (n=5) | 91.5% | ✓ | $11.92 | < 1s | ✓ | |
| 3 | 以 1000 個範例微調的 gpt-4o-mini | 91.5% | ✓ | $0.21 | ✓ | < 1s | ✓ |
結論
我們從 gpt-4o 改用 gpt-4o-mini,只用了 1,000 個已標註範例進行微調,就以 不到原本 2% 的成本達到同等效能 。
這個流程很重要。通常無法一開始就直接進行微調,因為你還不確定微調是否適合用來達成所需的最佳化,或是尚未備妥足夠的已標註範例。先使用 gpt-6-astra 確立準確率目標,再於需要考量成本與延遲時,測試較小或經過微調的模型。