For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航

弹性处理

通过弹性处理优化成本。

弹性处理可降低 ResponsesChat Completions 请求的成本,但响应速度较慢,且偶尔会出现资源不可用的情况。它非常适合非生产环境任务或优先级较低的任务,例如模型评估、数据丰富化和异步工作负载。

Token 按批处理 API 费率计费,还可通过提示缓存获得额外折扣。

弹性处理目前处于测试阶段,仅支持部分模型。支持的模型 列于定价页面

API 使用方法

要使用弹性处理,请在 API 请求中将 service_tier 参数设为 flex

弹性处理示例
from openai import OpenAI

client = OpenAI(
    # increase default timeout to 15 minutes (from 10 minutes)
    timeout=900.0
)

# you can override the max timeout per request as well
response = client.with_options(timeout=900.0).responses.create(
    model="gpt-6-astra",
    instructions="List and describe all the metaphors used in this book.",
    input="<very long text of book here>",
    service_tier="flex",
)

print(response.output_text)

API 请求超时

由于弹性处理的处理速度较慢,请求更容易超时。处理超时时,请注意以下几点:

  • 默认超时时间:使用官方 OpenAI SDK 发出 API 请求时,默认超时时间为 10 分钟 。对于较长的提示或复杂任务,您可能需要延长超时时间。
  • 配置超时时间:每个 SDK 都提供了用于延长超时时间的参数。在 Python 和 JavaScript SDK 中,该参数为 timeout,如上方代码示例所示。
  • 自动重试:对于返回 408 Request Timeout 错误码的请求,OpenAI SDK 会自动重试两次,然后才抛出异常。

资源不可用错误

弹性处理有时可能没有足够的资源来处理您的请求,此时会返回 429 Resource Unavailable 错误码。 发生这种情况时,不会向您收费。

您可以考虑采用以下策略来处理资源不可用错误:

  • 使用指数退避重试请求:指数退避适用于能够容忍延迟、希望尽量降低成本的工作负载,因为当更多处理容量可用时,您的请求最终便可完成。有关实现细节,请参阅这篇 Cookbook

  • 使用标准处理重试请求:收到资源不可用错误时,如果对您的使用场景而言,为确保请求成功完成而偶尔承担更高的成本是值得的,便可采用标准处理来重试。具体做法是在重试请求中将 service_tier 设为 auto,或移除 service_tier 参数以使用项目的默认模式。