For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
メインナビゲーション

コストの最適化

効率を高め、コストを削減します。

OpenAI モデルの利用コストを削減する方法はいくつかあります。コストとレイテンシは通常、互いに関連しており、トークン数やリクエスト数を減らすと、一般に処理も速くなります。OpenAI の Batch API や Flex 処理を利用することでもコストを削減できます。

コストとレイテンシ

レイテンシとコストを削減するには、次の方法を検討してください。

  • リクエスト数の削減:タスクの完了に必要なリクエストの数を抑えます。
  • トークン数の最小化:入力トークン数を減らし、モデルの出力が短くなるように最適化します。
  • より小さいモデルの選択:コストとレイテンシの削減を、精度の維持と両立できるモデルを使用します。

これらの方法について詳しくは、レイテンシの最適化ガイドを参照してください。

Batch API

ジョブを非同期で処理します。Batch API は、使いやすい一連のエンドポイントを提供します。複数のリクエストを 1 つのファイルにまとめ、それらを実行するバッチ処理ジョブを開始し、リクエストの実行中にバッチのステータスを確認できます。バッチが完了したら、まとめて結果を取得できます。

Batch API の利用を始める →

Flex 処理

応答時間が長くなり、リソースが一時的に利用できない場合もありますが、その分、Chat Completions や Responses のリクエストにかかるコストを大幅に削減できます。モデルの評価、データの拡充、非同期ワークロードなど、本番環境以外でのタスクや優先度の低いタスクに最適です。

Flex 処理の利用を始める →