For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航

成本优化

提高效率,降低成本。

使用 OpenAI 模型时,有多种方法可以降低成本。成本和延迟通常相互关联;减少 Token 数量和请求次数通常能加快处理速度。此外,您还可以通过 OpenAI 的批处理 API 和弹性处理来降低成本。

成本与延迟

要降低延迟和成本,可以考虑以下策略:

  • 减少请求:控制完成任务所需的请求次数。
  • 尽量减少 Token:减少输入 Token 的数量,并通过优化来缩短模型输出。
  • 选择更小的模型:选择能够在降低成本和延迟与保持准确性之间取得平衡的模型。

如需深入了解这些策略,请参阅我们的延迟优化指南。

批处理 API

以异步方式处理作业。批处理 API 提供了一组简单易用的端点,您可以将一组请求汇集到单个文件中,启动批处理作业来执行这些请求,在请求执行期间查询该批次的状态,并在批处理完成后获取汇总结果。

开始使用批处理 API →

弹性处理

以较慢的响应速度和偶尔的资源不可用为代价,大幅降低 Chat Completions 或 Responses 请求的成本。这种方式非常适合非生产环境任务或优先级较低的任务,例如模型评估、数据充实或异步工作负载。

开始使用弹性处理 →