使用 OpenAI 模型时,有多种方法可以降低成本。成本和延迟通常相互关联;减少 Token 数量和请求次数通常能加快处理速度。此外,您还可以通过 OpenAI 的批处理 API 和弹性处理来降低成本。
成本与延迟
要降低延迟和成本,可以考虑以下策略:
- 减少请求:控制完成任务所需的请求次数。
- 尽量减少 Token:减少输入 Token 的数量,并通过优化来缩短模型输出。
- 选择更小的模型:选择能够在降低成本和延迟与保持准确性之间取得平衡的模型。
如需深入了解这些策略,请参阅我们的延迟优化指南。
批处理 API
以异步方式处理作业。批处理 API 提供了一组简单易用的端点,您可以将一组请求汇集到单个文件中,启动批处理作业来执行这些请求,在请求执行期间查询该批次的状态,并在批处理完成后获取汇总结果。
弹性处理
以较慢的响应速度和偶尔的资源不可用为代价,大幅降低 Chat Completions 或 Responses 请求的成本。这种方式非常适合非生产环境任务或优先级较低的任务,例如模型评估、数据充实或异步工作负载。