2025 年的重点不在于某一次模型发布,而在于 AI 在生产环境中的运行变得更加容易。随着模型在规划、工具使用和长时间跨度任务上的能力不断提升,越来越多的团队从“逐步给出提示”转向将工作委托给智能体。
对开发者而言,这一变化具体体现在以下几个方面:
- 推理成为一项核心可调能力 ,并逐渐与通用聊天模型融合。
- 多模态能力(文档、音频、图像、视频) 成为 API 原生支持的核心能力。
- 智能体构建组件 (Responses API、Agents SDK、AgentKit)让多步骤工作流更容易交付和运行。
- Codex 让开发速度和质量都达到了前所未有的水平。
要点速览
- 最显著的变化是, 原生面向智能体的 API 与 更强大的模型 相结合,能够完成需要推理和工具使用的更复杂任务。
- Codex 的模型和工具都日趋成熟,将 GPT-5.2-Codex 面向整个代码仓库的推理能力,与可用于生产环境的 CLI、Web 和 IDE 工作流相结合,用于处理长时间跨度的编程任务。
- 工具的改进让模型更容易接入实际系统,集成过程也更加顺畅。
- 多模态输入和输出(PDF、图像、音频、视频)成为端到端工作流中切实可用的默认选择。
- 评测、评分器和调优功能日趋成熟,形成了更易重复执行的“衡量 → 改进 → 交付”循环。
请继续阅读,回顾 2025 年模型、API 和平台的重大更新,了解这些更新如何帮助您交付生产级智能体。
推理:从独立模型走向统一系列
2024 年底,我们首次引入 推理 范式,开始给予模型“思考时间”。到了 2025 年初, 推理模型 已成为一个独立的模型系列。 o1、 o3 和 o4-mini 等模型清楚地表明,在回答前投入额外算力进行思考,可以显著提高处理复杂多步骤任务的可靠性。
还值得一提的是, o3-mini 是最早表明这一趋势的模型之一:推理不会只是前沿模型专有的功能,也可以通过经济高效、对开发者友好的形式提供。
到了 2025 年中后期,主要趋势是 融合:同一个旗舰模型系列越来越多地兼顾推理深度、工具使用和对话质量。对大多数团队而言,“选择模型”更多是在成本、延迟和质量之间权衡,而不再是在本质不同的模型系列之间做选择。
o1、o3 / o4-mini 和 o3-mini 等以推理为核心的模型,让开发者能够自行调节“思考更深入”与“响应更快速”之间的取舍。随着这一年的推进,这些理念逐渐融入 GPT-5.x 系列,将通用智能、推理深度、编程专长和多模态能力统一到同一个模型系列中。
多模态:音频、视觉、图像和视频
到 2025 年底, 多模态 的含义不再只是“能够接受图像输入”,而是“您可以构建跨模态的端到端产品”,并且通常在单个工作流中就能完成。
音频与实时交互
- 新一代音频模型提高了语音转文本的准确性,并提供了可控性更强的文本转语音能力,为生产级语音流水线提供支持。
- Realtime API 正式全面推出,支持低延迟、双向音频流式传输,让生产级实时语音智能体和对话界面成为切实可行的选择。
图像
- GPT Image 1 开启了新一代图像生成模型,凭借强大的世界理解能力和更好的指令遵循能力,生成高质量图像并进行结构化编辑。
- 高输入保真度让图像编辑能够更稳定地保留人脸、标志等细节。
- GPT Image 1 mini 让原生图像生成更加经济高效。
- GPT Image 1.5 是我们最先进的生成模型,在图像质量和编辑一致性方面实现了显著跃升。
- 图像生成作为 Responses API 中的一项工具,可以与其他工具结合使用,在多轮对话中创建图像。
视频
- Sora 2 和 Sora 2 Pro 模型带来了保真度更高的视频生成能力,增强了时间连贯性,并支持混编。
- Video API 通过
v1/videos提供视频生成和编辑能力,使视频与文本、图像和音频一样,成为 API 原生支持的核心模态。
PDF 与文档
- PDF 输入让您能够直接通过 API 实现需要处理大量文档的工作流。
- 通过 URL 引用 PDF 省去了上传文档的步骤,使用起来更加便捷。
意义所在: 现在,您不仅可以使用 OpenAI 平台处理文本和视觉任务,还可以用它实现图像与视频生成工作流,以及语音到语音的使用场景。
Codex
2025 年,Codex 不再只是一个编程模型,而成为了您的软件工程师队友:它将模型、本地工具和云端连接起来,帮助开发者处理耗时更长、更加复杂的编程任务。
模型
早期推理模型在复杂编程任务(多文件编辑、调试、规划)上展现了显著进步。到了 2025 年中后期,这些能力整合进了 GPT-5 系列,GPT-5.2-Codex 成为代码生成、审查以及面向整个代码仓库进行推理的最新默认选择。这些能力不再独立于通用模型,而是在通用模型内部实现了专门化。
CLI
开源的 Codex CLI(GitHub)将智能体编程直接带入本地环境,让开发者能够在实际代码仓库中运行 Codex,反复审查变更,并在人工监督下将修改应用到文件中。这让长时间跨度的编程任务在日常工作流中变得切实可行。
Codex 内置了对可重复执行的自动化模式的支持,例如通过脚本使用 Codex,让它在交互式使用之外也更容易投入实际运行。
安全、控制与集成
Codex 针对实际交付中的需求进行了改进:沙盒和审批模式让人工参与和监督变得更容易。同时,对 AGENTS.md 和 MCP 的支持,让 Codex 更容易适配您的代码仓库,通过第三方工具和上下文扩展能力,甚至可以通过 Agents SDK 编排 Codex(将 CLI 作为 MCP 服务器运行)。
更新(2026 年 9 月 5 日): Codex MCP 服务器已移除。有关当前可用的集成方式,请参阅迁移指南。
Web、云端与 IDE
除 CLI 之外,Codex 还在 Web 和云端以及 IDE 扩展中增强了对更长会话和迭代式问题解决的支持,让对话式推理与实际代码变更之间的衔接更加紧密。团队还可以在 CI 中使用 Codex Autofix,将部分工作流自动化。
意义所在: 到 2025 年底,Codex 的角色不再局限于“接受提示的模型”,而更像一个编程工作界面,将具备推理能力的模型与开发者已有的工具结合起来。
平台变化:Responses API 与智能体构建组件
2025 年最重要的平台变化之一,是转向 原生面向智能体的 API。
Responses API 让基于新一代模型进行开发变得更加容易:
- 支持多种输入和输出,涵盖不同模态
- 支持推理控制和推理摘要
- 增强对工具调用的支持,包括在推理过程中调用工具
在这一基础上,2025 年还带来了更高层的构建组件,例如开源的 Agents SDK 和 AgentKit,让智能体的构建和编排更加容易。
状态和持久化也变得更容易管理:
- 对话状态(以及 Conversations API)支持持久化会话线程和可重放的状态
- 连接器和 MCP 服务器用于引入外部上下文,并通过可信的工具接口执行操作
意义所在:现在,构建多步骤智能体和长时间运行的工作流所需的自定义衔接代码和状态管理工作更少了。
除了强大的基础能力,我们还推出了一系列功能强大的内置工具,以充分发挥模型的实用价值。
工具:从网页搜索到工作流
2025 年,我们推出了一系列标准化、可组合的能力,让智能体能够安全地完成有用的工作。
- 网页搜索为需要最新信息和引用来源的智能体提供了简单的基础检索能力。
- 文件搜索(向量存储)提供了默认的托管式 RAG 基础能力,可与 Responses 和结构化输出顺畅组合使用。
- 代码解释器在沙盒容器中运行 Python,用于数据处理、文件转换和迭代调试。
- 计算机使用支持由“点击、输入、滚动”构成的自动化循环,最好配合沙盒和人工参与机制使用。
为什么重要: 智能体可以可靠地检索信息、执行计算和采取行动,各团队无需再各自从头构建定制的工具运行时。
运行与扩展:异步、事件和成本控制
当智能体从处理“单次请求”发展到执行“多步骤作业”时,负责生产系统的团队便需要用于控制成本、降低延迟和保障可靠性的基础能力。
- 当多个提示共享较长的重复前缀(系统提示、工具、模式)时,提示缓存可以降低延迟和输入成本。
- 后台模式支持耗时较长的响应生成,无需一直保持客户端连接。
- Webhook让系统从“凡事都要轮询”转向事件驱动,例如批处理完成、后台响应生成完成和微调完成等事件。
- 随着使用层级和模型系列的扩展,速率限制及工作负载优化指南也日趋完善。
为什么重要: 构建智能体时,系统设计(异步、事件和预算)变得与提示词设计同样重要。
开放标准与开源智能体基础组件
在推动 API 整合的同时,2025 年也着重强调了智能体系统的 互操作性和可组合性 。
- 开源的 Agents SDK 提供 Python(GitHub)和 TypeScript(GitHub)版本,为工具使用、任务交接、护栏和追踪提供了实用的基础组件。它 不依赖特定提供商,文档中也介绍了使用非 OpenAI 模型的方法。
- AgentKit 为希望更快交付和迭代的团队提供了更高层次的智能体开发工具,包括智能体构建器、ChatKit、连接器注册表和评估循环。
- 在标准方面,OpenAI 推动了 AGENTS.md (规范),并参与了 AAIF(Agentic AI Foundation),与 Model Context Protocol(MCP) 和技能等其他生态标准共同发展。随着生态系统逐渐采用共同约定,开发者可以获得可移植性更强的智能体工具,并减少一次性的定制集成工作。
除了在智能体及相关标准方面的工作,我们还推出了 Apps SDK。这是一个扩展了 Model Context Protocol(MCP)的开源框架,让开发者能够为 MCP 服务器构建配套 UI,同时定义应用的逻辑和交互界面,使这些应用能够在 ChatGPT 等客户端中运行。
为什么重要:开发者可以构建与单一运行时或 UI 界面耦合程度更低的智能体,并更轻松地将由 OpenAI 驱动的智能体集成到异构系统中。
开放权重模型
除了托管式 API,OpenAI 还发布了 开放权重模型 ,旨在提升透明度、支持研究以及本地或自托管部署,同时保留强大的推理和指令遵循能力。
- gpt-oss 120b & 20b 推理模型专为自托管和本地部署而设计。
- gpt-oss-safeguard 120b & 20b 安全与策略模型旨在与 gpt-oss 配合运行。
评估、调优与安全交付
- Evals API 用于评测驱动开发。
- 强化微调(RFT)使用可编程评分器。
- 在您使用较大模型验证任务后,监督微调 / 蒸馏可将高质量的表现迁移到更小、成本更低的模型上。
- 评分器和提示优化器帮助团队更紧密地衔接“评测 → 改进 → 再评测”循环。
总结
2025 年,我们始终围绕几个方向持续投入,让开发者能够更轻松地在我们的平台上构建和交付产品:
- 将规模化、可控的推理作为核心能力
- 统一、原生面向智能体的 API 接口
- 开放的基础组件与逐步形成的互操作性标准
- 全面深入地支持文本、图像、音频、视频和文档等多种模态
- 更强大的生产环境工具,支持评估、调优和部署
按任务推荐模型(截至 2025 年底)
如果您正着手开发新项目或升级现有集成,以下模型可以作为相应任务的合理“默认选择”。
- 通用任务(文本 + 多模态): GPT-5.2 适合聊天、长上下文任务和多模态输入。
- 更深入的推理 / 对可靠性要求较高的工作负载: GPT-5.2 Pro 适合规划,以及值得投入额外算力来提升质量的任务。
- 编程与软件工程: GPT-5.2-Codex 适合代码生成、审查、整个代码仓库层面的推理,以及工具驱动的编程智能体。
- 图像生成与编辑: GPT Image 1.5 适合生成保真度更高的图像和进行迭代编辑。
- 实时语音: gpt-realtime 适合低延迟的语音到语音交互和实时语音智能体。
有关最新的可用性和层级信息,请参阅官方模型比较页面。
这些更新为未来的发展奠定了基础。感谢您在 2025 年与我们一同构建,我们期待看到您在 2026 年创造的成果。
链接与资源
- 提示优化器
- 模型比较(当前名称、可用性和层级信息)
- Agents SDK(Python)和 Agents SDK(TypeScript)
- Codex 文档和 Codex CLI GitHub 代码仓库
- 图像 Playground
- 平台更新日志(发布内容与时间)