For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal
30 de dez. de 2025 Geral

OpenAI para desenvolvedores em 2025

Uma retrospectiva de fim de ano das principais mudanças em modelos, APIs e plataforma para criar agentes prontos para produção.

Autores: Vaibhav (VB) Srivastav, Katia Gil Guzman

OpenAI para desenvolvedores em 2025

2025 não foi marcado pelo lançamento de um único modelo: foi o ano em que ficou mais fácil usar IA em produção. À medida que os modelos melhoraram em planejamento, uso de ferramentas e tarefas de maior duração, mais equipes passaram de dar instruções passo a passo a delegar trabalho a agentes.

Para os desenvolvedores, essa mudança se manifestou de algumas formas concretas:

  • O raciocínio se tornou um parâmetro central de ajuste e convergiu cada vez mais com os modelos de chat de uso geral.
  • A multimodalidade (documentos, áudio, imagens e vídeo) passou a ter suporte nativo na API.
  • Os componentes para construir agentes (Responses API, Agents SDK, AgentKit) facilitaram a entrega e a operação de fluxos de trabalho com várias etapas.
  • O Codex tornou possível desenvolver com mais rapidez e qualidade do que nunca.

Em resumo

  • A grande mudança foi a combinação de APIs concebidas para agentes com modelos melhores , capazes de executar tarefas mais complexas que exigem raciocínio e uso de ferramentas.
  • O Codex amadureceu tanto nos modelos quanto nas ferramentas, combinando o raciocínio do GPT-5.2-Codex sobre repositórios inteiros com uma CLI pronta para produção e fluxos de trabalho na Web e na IDE para tarefas de programação de longa duração.
  • As melhorias nas ferramentas facilitaram a conexão dos modelos a sistemas reais, com menos dificuldades de integração.
  • Entradas e saídas multimodais (PDFs, imagens, áudio e vídeo) se tornaram uma opção padrão e prática em fluxos de trabalho de ponta a ponta.
  • Avaliações, avaliadores e recursos de ajuste amadureceram, formando um ciclo mais repetível de "medir -> melhorar -> entregar".

Continue lendo para conhecer as principais atualizações de modelos, APIs e plataforma em 2025 e saber como elas podem ajudar você a entregar agentes prontos para produção.

Raciocínio: de modelos separados a uma linha unificada

Depois que introduzimos o paradigma de raciocínio no fim de 2024, quando começamos a dar aos modelos “tempo para pensar”, o início de 2025 foi a era dos modelos de raciocínio como uma família distinta. Modelos como o1, o3 e o4-mini deixaram claro que dedicar mais recursos computacionais para pensar antes de responder poderia melhorar drasticamente a confiabilidade em trabalhos complexos com várias etapas.

Também vale destacar que o o3-mini foi um dos primeiros sinais de que o raciocínio não seria um recurso exclusivo dos modelos de fronteira: ele poderia ser oferecido em formatos econômicos e fáceis de usar para desenvolvedores.

Entre meados e o fim de 2025, a grande tendência foi a convergência: profundidade de raciocínio, uso de ferramentas e qualidade das conversas passaram a coexistir cada vez mais na mesma linha de modelos principais (para a maioria das equipes, “escolher um modelo” passou a ser mais uma questão de equilibrar custo, latência e qualidade do que de escolher entre famílias fundamentalmente diferentes).

Lançamentos centrados em raciocínio, como o1, o3 / o4-mini e o3-mini, ajudaram a transformar a escolha entre "pensar mais a fundo ou responder mais rápido" em algo que os desenvolvedores podiam ajustar. Ao longo do ano, essas ideias foram cada vez mais incorporadas à família GPT-5.x, unificando inteligência geral, profundidade de raciocínio, especialização em programação e multimodalidade em uma única linha de modelos.

Multimodalidade: áudio, visão, imagens e vídeo

No fim de 2025, multimodal deixou de significar “aceita uma imagem como entrada” e passou a significar “você pode criar um produto de ponta a ponta que combina modalidades”, muitas vezes em um único fluxo de trabalho.

Áudio + tempo real

  • Os modelos de áudio de nova geração melhoraram a precisão da conversão de fala em texto e ofereceram mais controle sobre a conversão de texto em fala, viabilizando pipelines de voz prontos para produção.
  • A Realtime API chegou à disponibilidade geral e passou a permitir streaming bidirecional de áudio com baixa latência, viabilizando agentes de voz em tempo real e interfaces de conversação prontos para produção.

Imagens

  • O GPT Image 1 inaugurou uma nova geração de modelos de geração de imagens, produzindo imagens de alta qualidade e edições estruturadas com uma compreensão sólida do mundo e maior capacidade de seguir instruções.
  • A alta fidelidade às imagens de entrada tornou possível preservar detalhes como rostos e logotipos de forma mais consistente durante a edição.
  • O GPT Image 1 mini tornou a geração nativa de imagens mais econômica.
  • O GPT Image 1.5, nosso modelo de geração mais avançado, representou um salto na qualidade das imagens e na consistência das edições.
  • A geração de imagens como ferramenta na Responses API permitiu criar imagens em conversas com várias interações, em combinação com outras ferramentas.

Vídeo

  • Os modelos Sora 2 e Sora 2 Pro trouxeram geração de vídeos com maior fidelidade, maior coerência temporal e suporte a remixagem.
  • A Video API disponibilizou a geração e a edição de vídeos por meio de v1/videos, tornando o vídeo uma modalidade com suporte nativo na API, ao lado de texto, imagens e áudio.

PDFs e documentos

  • As entradas em PDF viabilizaram fluxos de trabalho com uso intensivo de documentos diretamente na API.
  • O uso de PDFs por URL simplificou o processo ao permitir referenciar documentos sem fazer upload.

Por que isso importa: agora você pode contar com a plataforma da OpenAI não apenas para texto e visão, mas também para seus fluxos de trabalho de geração de imagens e vídeos, além de casos de uso de fala para fala.

Codex

Em 2025, o Codex deixou de ser apenas um modelo de programação e se tornou seu colega de equipe na engenharia de software, conectando modelos, ferramentas locais e nuvem para ajudar desenvolvedores a lidar com tarefas de programação mais longas e complexas.

Modelos

Os primeiros modelos de raciocínio demonstraram grandes avanços em tarefas complexas de programação (edições em vários arquivos, depuração e planejamento). Entre meados e o fim de 2025, essas capacidades foram consolidadas na família GPT-5, com o GPT-5.2-Codex se tornando a opção padrão mais recente para geração de código, revisão e raciocínio sobre repositórios inteiros. Essas capacidades deixaram de existir separadamente dos modelos de uso geral e passaram a ser especializações dentro deles.

CLI

O Codex CLI de código aberto (GitHub) levou a programação com agentes diretamente aos ambientes locais, permitindo que desenvolvedores executassem o Codex em repositórios reais, revisassem alterações de forma iterativa e aplicassem edições a arquivos com supervisão humana. Isso tornou as tarefas de programação de longa duração viáveis nos fluxos de trabalho do dia a dia.

Também ficou mais fácil usar o Codex além das interações diretas, com suporte integrado a padrões de automação repetíveis, como executar o Codex por meio de scripts.

Segurança, controle e integrações

O Codex se adaptou às necessidades reais de entregar software: o ambiente isolado e os modos de aprovação facilitaram a participação humana no processo. Ao mesmo tempo, o suporte a AGENTS.md e MCP tornou mais fácil adaptar o Codex ao seu repositório, ampliá-lo com ferramentas e contexto de terceiros e até orquestrar o Codex por meio do Agents SDK (executando a CLI como um servidor MCP).

Atualização, 5 de setembro de 2026: O servidor MCP do Codex foi removido. Consulte as orientações de migração para conhecer as opções atuais de integração.

Web, nuvem e IDE

Além da CLI, o Codex ampliou o suporte a sessões mais longas e à resolução iterativa de problemas na Web + nuvem e na extensão para IDE, aproximando o raciocínio em conversas das alterações concretas no código. As equipes também passaram a poder automatizar partes do fluxo de trabalho com o Codex Autofix na CI.

Por que isso importa: no fim de 2025, o Codex funcionava menos como "um modelo ao qual você envia prompts" e mais como um ambiente de programação, combinando modelos capazes de raciocinar com ferramentas que os desenvolvedores já usam.

Mudança na plataforma: Responses API e componentes para construir agentes

Uma das mudanças mais importantes na plataforma em 2025 foi a transição para APIs concebidas para agentes.

A Responses API facilitou o desenvolvimento para a nova geração de modelos:

  • Suporte a múltiplas entradas e saídas, incluindo diferentes modalidades
  • Suporte a controles e resumos de raciocínio
  • Melhor suporte a chamadas de ferramentas, inclusive durante o raciocínio

Sobre essa base, 2025 também trouxe componentes de mais alto nível, como o Agents SDK de código aberto e o AgentKit, facilitando a criação e a orquestração de agentes.

Também ficou mais fácil gerenciar estado e persistência:

Por que isso importa: criar agentes que executam várias etapas e fluxos de trabalho de longa duração agora exige menos código de integração personalizado e menos gerenciamento de estado.

Além de primitivas robustas, introduzimos um conjunto de ferramentas integradas e poderosas para maximizar a utilidade dos modelos.


Ferramentas: da pesquisa na Web aos fluxos de trabalho

Em 2025, lançamos um conjunto de capacidades padronizadas e combináveis que permitem aos agentes realizar tarefas úteis com segurança.

  • A Pesquisa na Web ofereceu um recurso básico de recuperação para agentes que precisam de informações atualizadas e citações.
  • A Pesquisa de arquivos (armazenamentos vetoriais) ofereceu um recurso básico de RAG hospedado como opção padrão, que se integra facilmente a Responses + Saídas estruturadas.
  • O Code Interpreter executava Python em contêineres isolados para trabalhar com dados, transformar arquivos e depurar de forma iterativa.
  • O Uso do computador viabilizou ciclos de automação de “clicar/digitar/rolar” (preferencialmente combinados com um ambiente isolado e participação humana no processo).

Por que isso importa: os agentes podem recuperar informações, realizar cálculos e agir de forma confiável sem que cada equipe precise reinventar um ambiente próprio de execução de ferramentas.

Executar e escalar: processamento assíncrono, eventos e controles de custo

Quando os agentes passaram de “uma única solicitação” para “tarefas de várias etapas”, as equipes responsáveis pela operação em produção precisaram de recursos básicos para lidar com custo, latência e confiabilidade.

  • O Cache de prompts reduziu a latência e os custos de entrada quando os prompts compartilham prefixos longos e repetidos (prompts de sistema, ferramentas, esquemas).
  • O Modo em segundo plano permitiu gerar respostas de longa duração sem manter uma conexão com o cliente aberta.
  • Os Webhooks permitiram passar de “consultar tudo periodicamente” para sistemas orientados a eventos (conclusão de processamento em lote, de processamento em segundo plano e de ajuste fino).
  • Os Limites de taxa e as orientações para otimizar cargas de trabalho amadureceram à medida que os níveis de uso e as famílias de modelos se expandiram.

Por que isso importa: criar agentes passou a envolver tanto o projeto de sistemas (processamento assíncrono + eventos + orçamentos) quanto a criação de prompts.

Padrões abertos e componentes de código aberto para criar agentes

Além da consolidação das APIs, 2025 deu destaque à interoperabilidade e à capacidade de combinar componentes em sistemas agênticos.

  • O Agents SDK de código aberto para Python (GitHub) e TypeScript (GitHub) estabeleceu componentes práticos para uso de ferramentas, transferências entre agentes, mecanismos de proteção e rastreamento. Ele é independente de provedor, com procedimentos documentados para usar modelos de outros provedores além da OpenAI.
  • O AgentKit adicionou ferramentas de nível mais alto para o desenvolvimento de agentes (incluindo Criador de agentes, ChatKit, Registro de conectores e ciclos de avaliação) para equipes que querem lançar e iterar mais rápido.
  • Na área de padrões, a OpenAI promoveu o AGENTS.md (especificação) e participou da AAIF (Agentic AI Foundation), junto a outros padrões do ecossistema, como o Model Context Protocol (MCP) e as Habilidades. O benefício para os desenvolvedores: ferramentas para agentes mais portáteis e menos integrações pontuais à medida que o ecossistema converge para convenções compartilhadas.

Além do nosso trabalho com agentes e padrões relacionados, apresentamos o Apps SDK, um framework de código aberto que estende o Model Context Protocol (MCP) para permitir que desenvolvedores criem interfaces de usuário junto com seus servidores MCP, definindo tanto a lógica quanto a interface interativa de aplicativos que podem ser executados em clientes como o ChatGPT.

Por que isso importa: os desenvolvedores podem criar agentes menos acoplados a um único ambiente de execução ou interface de usuário e integrar com mais facilidade agentes que usam a tecnologia da OpenAI a sistemas heterogêneos.

Modelos com pesos abertos

Além das APIs hospedadas, a OpenAI lançou modelos com pesos abertos projetados para oferecer transparência, apoiar pesquisas e permitir implantação local ou com hospedagem própria, mantendo capacidades robustas de raciocínio e de seguir instruções.

Avaliação, ajuste e lançamento com segurança

Para concluir

Ao longo de 2025, mantivemos o foco em alguns temas para facilitar o desenvolvimento e o lançamento de soluções na nossa plataforma:

  • Raciocínio em escala e controlável como capacidade central
  • Uma interface de API unificada e concebida para agentes
  • Componentes abertos e padrões emergentes de interoperabilidade
  • Suporte multimodal abrangente a texto, imagens, áudio, vídeo e documentos
  • Ferramentas de produção mais robustas para avaliação, ajuste e implantação

Se você está começando um novo projeto ou modernizando uma integração, estas são boas “opções padrão” para sua tarefa.

  • Uso geral (texto + multimodal): GPT-5.2 para chat, trabalho com contextos longos e entradas multimodais.
  • Raciocínio mais profundo / cargas de trabalho que exigem confiabilidade: GPT-5.2 Pro para planejamento e tarefas em que a qualidade justifica o uso de mais recursos computacionais.
  • Programação e engenharia de software: GPT-5.2-Codex para geração e revisão de código, raciocínio sobre repositórios inteiros e agentes de programação que usam ferramentas.
  • Geração e edição de imagens: GPT Image 1.5 para geração de imagens com maior fidelidade e edições iterativas.
  • Voz em tempo real: gpt-realtime para interações de fala para fala com baixa latência e agentes de voz ao vivo.

Para informações atualizadas sobre disponibilidade e níveis, consulte a página oficial de comparação de modelos.

Essas atualizações estabelecem a base para o que vem a seguir. Obrigado por criar com a gente em 2025. Estamos ansiosos para ver o que você vai criar em 2026.