O modo Fast oferece velocidades até 2,5× maiores e latência mais consistente, mantendo a flexibilidade do pagamento conforme o uso. O modo Fast é ideal para aplicações de alto valor voltadas ao usuário, com tráfego regular e nas quais a latência é essencial.
O processamento prioritário passou a se chamar modo Fast em 30 de julho de 2026. Também aumentamos
a velocidade do modo Fast para gpt-5.6-sol, tornando-o até 2,5×
mais rápido que o processamento padrão. Você pode usar service_tier: "priority"
ou service_tier: "fast" nas suas requisições à API para acessar essa funcionalidade.
Como configurar o modo Fast
Você pode configurar requisições à Responses API ou à API Chat Completions para usar o modo Fast por meio de um parâmetro de requisição ou de uma configuração do projeto.
Para ativar o modo Fast em uma requisição individual, defina o parâmetro service_tier como fast. Definir service_tier como priority produz o mesmo comportamento nos modelos compatíveis.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="What does 'fit check for my napalm era' mean?",
service_tier="fast",
)
print(response)Para ativar no nível do projeto, abra Configurações, selecione Geral em Projeto e altere Nível de serviço do projeto para Fast. As requisições que não especificarem um service_tier passarão a usar o modo Fast por padrão. As requisições do projeto migrarão gradualmente para o modo Fast ao longo do tempo.
O campo service_tier no objeto de resposta de Responses ou Chat Completions identifica o nível usado para processar a requisição. Para GPT-5.6 e modelos anteriores, a resposta retorna priority, independentemente de a requisição especificar priority ou fast.
Limites de taxa e taxa de crescimento do tráfego
Limites básicos
O consumo no modo Fast é contabilizado nos limites de taxa da mesma forma que no processamento padrão. Use sua lógica habitual de novas tentativas e aguarde entre elas. Para um determinado modelo, o processamento padrão e o modo Fast compartilham o mesmo limite de taxa.
Limite da taxa de crescimento do tráfego
Se o tráfego aumentar rápido demais, o sistema poderá processar algumas requisições do modo Fast em velocidades padrão e cobrar as tarifas padrão. Quando isso acontece, a resposta contém service_tier: "default". Como regra geral, quando o tráfego atingir 1 milhão de tokens de entrada por minuto (TPM), aumente-o em no máximo 50% a cada 15 minutos. O ponto exato em que o limite da taxa de crescimento do tráfego se aplica pode variar conforme o modelo e as condições de tráfego.
Para evitar acionar o limite da taxa de crescimento do tráfego:
- Aumente o tráfego gradualmente ao trocar de modelo ou snapshot.
- Use flags de recurso para transferir o tráfego ao longo de horas, e não instantaneamente.
- Evite executar tarefas de extração, transformação e carga (ETL) ou de processamento em lote de grande porte no modo Fast.
Considerações de uso
- O modo Fast cobra um valor adicional por token em relação ao processamento padrão. Consulte a página de preços para ver detalhes e modelos compatíveis.
- Os descontos para entradas em cache continuam válidos para requisições no modo Fast.
- O modo Fast oferece suporte a requisições multimodais, incluindo entradas de imagem.
- Para visualizar as requisições do modo Fast no painel de uso, selecione a opção de agrupar por nível de serviço. Para GPT-5.6 e modelos anteriores, essas requisições aparecem como
priority, mesmo quando você especificafast. - Os modelos GPT-5.6 oferecem suporte a contexto longo. O modo Fast não oferece suporte a modelos com ajuste fino nem a embeddings.
Perguntas frequentes
Para informações sobre contas e políticas, consulte as perguntas frequentes sobre o modo Fast.
O modo Fast está disponível em todas as regiões?
A disponibilidade depende das leis e regulamentações de cada jurisdição. Entre em contato com o responsável pela sua conta se tiver dúvidas sobre a disponibilidade na sua região.
Como o modo Fast interage com o Nível de escala?
O Nível de escala e o modo Fast são separados. As requisições do modo Fast são cobradas separadamente e não consomem os pacotes de TPM adquiridos para o Nível de escala. O tráfego que excede o Nível de escala não é transferido automaticamente para o modo Fast.
Como o modo Fast é cobrado?
O modo Fast cobra um valor adicional por token em comparação com o processamento padrão. Todos os modos de processamento são contabilizados no compromisso anual de gastos da sua empresa, e os tokens de entrada em cache elegíveis recebem os mesmos descontos disponíveis no processamento padrão.
Para o GPT-5.6 Sol, o modo Fast custa o dobro da tarifa padrão correspondente. Requisições de contexto curto custam US$ 8 por 1 milhão de tokens de entrada e US$ 40 por 1 milhão de tokens de saída; requisições de contexto longo custam US$ 16 por 1 milhão de tokens de entrada e US$ 60 por 1 milhão de tokens de saída. Os preços promocionais do GPT-5.6 Sol estão disponíveis pelo menos até 21 de novembro de 2026. Consulte os detalhes de preços.
Para consultar o uso, abra o painel de uso, selecione Responses ou Chat Completions e agrupe por nível de serviço. Para consultar os custos, agrupe por item de cobrança.
Quais modelos e modalidades oferecem suporte ao modo Fast?
O modo Fast oferece suporte às capacidades multimodais disponíveis no processamento padrão, incluindo entradas de imagem. Os modelos GPT-5.6 oferecem suporte a contexto longo. O modo Fast não oferece suporte a modelos com ajuste fino nem a embeddings. Futuros modelos GPT poderão oferecer suporte ao modo Fast, mas esse suporte não é garantido para todos os modelos.
Os limites da taxa de crescimento do tráfego são compartilhados entre projetos ou organizações?
Sim. Todo o seu tráfego é contabilizado no mesmo limite da taxa de crescimento do tráfego. Se você atingir esse limite com frequência, considere adquirir uma cota do Nível de escala.
O que acontece se o modo Fast não atingir a meta de latência?
O modo Fast para o GPT-6 Astra não inclui um SLA de latência. Para GPT-5.6 e modelos anteriores, o modo Fast e o Nível de escala recebem o mesmo tratamento em termos de acordo de nível de serviço, e contratos empresariais elegíveis podem oferecer créditos de serviço quando as metas de latência não são atingidas. Entre em contato com o responsável pela sua conta se tiver dúvidas ou preocupações.
O modo Fast é compatível com residência de dados, zero retenção de dados e um BAA?
O modo Fast é compatível com residência de dados, zero retenção de dados e um Acordo de Associado Comercial (BAA), sujeito à disponibilidade específica de cada modelo. O GPT-6 Astra não oferece suporte ao modo Fast com residência de dados na UE. Os requisitos existentes de endpoints, ferramentas, elegibilidade e contratos continuam válidos. Consulte o guia Seus dados para mais detalhes.