快速模式可提供最高达原来 2.5 倍的速度和更稳定的延迟,同时保留按量付费的灵活性。对于流量稳定、对延迟要求极高的高价值用户端应用,快速模式是理想选择。
优先处理已于 2026 年 7 月 30 日更名为快速模式。我们还提高了
gpt-5.6-sol 在快速模式下的运行速度,使其最高可达标准处理速度的 2.5 倍。
您可以在 API 请求中使用 service_tier: "priority"
或 service_tier: "fast" 来使用此功能。
配置快速模式
您可以通过请求参数或项目设置,将发往 Responses API 或 Chat Completions API 的请求配置为使用快速模式。
要为单个请求启用快速模式,请将 service_tier 参数设为 fast。对于受支持的模型,将 service_tier 设为 priority 可获得相同的行为。
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="What does 'fit check for my napalm era' mean?",
service_tier="fast",
)
print(response)要在项目级别启用快速模式,请打开 设置,选择 项目下的 常规 ,然后将 项目服务层级 改为 快速。此后,未指定 service_tier 的请求将默认使用快速模式。该项目的请求会随时间逐步过渡到快速模式。
Responses 或 Chat Completions 响应对象中的 service_tier 字段标识了处理请求所用的服务层级。对于 GPT-5.6 及更早的模型,无论请求指定的是 priority 还是 fast,响应都会返回 priority。
速率限制与流量增长速率
基本限制
快速模式用量计入速率限制的方式与标准处理相同。请使用您常用的重试逻辑,并在每次尝试之间等待一段时间。对于同一个模型,标准处理和快速模式共享同一速率限制。
流量增长速率限制
如果您的流量增长过快,系统可能会将部分快速模式请求降为标准速度,并按标准费率收费。发生这种情况时,响应中会包含 service_tier: "default"。根据经验,一旦您的流量达到每分钟 100 万个输入 Token(TPM),每 15 分钟的增幅应不超过 50%。触发流量增长速率限制的具体阈值可能因模型和流量状况而异。
为避免触发流量增长速率限制,请遵循以下建议:
- 更换模型或快照时,逐步增加流量。
- 使用功能开关,在数小时内逐步切换流量,而非瞬间切换。
- 避免在快速模式下运行大型提取、转换和加载(ETL)作业或批处理作业。
使用注意事项
- 快速模式的每 Token 费用高于标准处理。有关详情和受支持的模型,请参阅定价页面。
- 缓存输入折扣仍适用于快速模式请求。
- 快速模式支持多模态请求,包括图像输入。
- 要在用量仪表板中查看快速模式请求,请选择按服务层级分组。对于 GPT-5.6 及更早的模型,即使您指定了
fast,这些请求也会显示为priority。 - GPT-5.6 模型支持长上下文。快速模式不支持微调模型或嵌入向量。
常见问题
有关账户和政策的信息,请参阅快速模式常见问题。
快速模式在所有地区都可用吗?
可用性取决于各司法管辖区的法律法规。如果您对所在地区的可用性有疑问,请联系您的客户总监。
快速模式与规模层级有何关系?
规模层级和快速模式相互独立。快速模式请求单独计费,不会消耗已购买的规模层级 TPM 套餐配额。超出规模层级配额的流量不会自动转入快速模式。
快速模式如何计费?
快速模式的每 Token 费用高于标准处理。所有处理模式的费用均计入您的年度企业消费承诺,符合条件的缓存输入 Token 可享受与标准处理相同的折扣。
对于 GPT-5.6 Sol,快速模式的费用是对应标准费率的两倍。短上下文请求的费用为每 100 万个输入 Token $8、每 100 万个输出 Token $40;长上下文请求的费用为每 100 万个输入 Token $16、每 100 万个输出 Token $60。GPT-5.6 Sol 的优惠价格至少持续至 2026 年 11 月 21 日。请参阅定价详情。
要查看用量,请打开用量仪表板,选择 Responses 或 Chat Completions,然后按服务层级分组。要查看费用,请按账单明细项分组。
哪些模型和模态支持快速模式?
快速模式支持标准处理所提供的多模态能力,包括图像输入。GPT-5.6 模型支持长上下文。快速模式不支持微调模型或嵌入向量。未来的 GPT 模型可能支持快速模式,但不保证每个模型都支持。
流量增长速率限制是否跨项目或组织共享?
是的。您的所有流量都计入同一流量增长速率限制。如果您经常触发流量增长速率限制,可以考虑购买规模层级配额。
如果快速模式未达到延迟目标,会怎样?
GPT-6 Astra 的快速模式不包含延迟 SLA。对于 GPT-5.6 及更早的模型,快速模式和规模层级适用相同的服务级别协议条款;未达到延迟目标时,符合条件的企业协议可能会提供服务额度补偿。如果您有疑问或顾虑,请联系您的客户总监。
快速模式是否兼容数据驻留、零数据保留和 BAA?
快速模式兼容数据驻留、零数据保留和业务伙伴协议(BAA),具体取决于各模型的可用性。GPT-6 Astra 不支持在启用欧盟数据驻留的情况下使用快速模式。现有的端点、工具、资格和合同要求仍然适用。有关详情,请参阅“您的数据”指南。