2025 年 9 月,OpenAI 推出了 GPT-5-Codex,这是首个针对智能体编程优化的 GPT-5 版本。2025 年 12 月,我们发布了 5.2,人们也从那时开始相信,自主编程智能体可以可靠地工作。尤其明显的是,模型能够可靠遵循指令的持续时间大幅增加了。
我想通过压力测试探一探这个极限。于是,我给了 Codex 一个空白代码仓库、完全访问权限,以及一项任务:从零构建一款设计工具。然后,我让它使用 GPT-5.3-Codex,以“极高”推理级别运行。Codex 不间断运行了约 25 小时,使用了约 1300 万个 Token,生成了约 3 万行代码。
这是一次实验,并非生产环境上线。不过,在长时工作中至关重要的几个方面,它表现不错:遵循规格说明、专注于任务、执行验证,并在过程中修复问题。

长时间运行的 Codex 会话是什么样的
我让 Codex 根据会话数据生成一个汇总页面:

下面展示了 CLI 会话统计数据和 Token 用量:

这些截图直观地展现了一个核心变化:智能体编程越来越看重任务的时间跨度,而不只是单样本任务中的智能表现。
真正的变化在于时间跨度
这不只是“模型变聪明了”。实际变化在于,智能体能够更长时间地保持思路连贯,端到端完成更大规模的工作,并在出错后恢复,而不丢失工作主线。
METR 对时间跨度基准测试的研究,为理解这一趋势提供了一个有用的视角:前沿智能体能够以约 50% 和 80% 的可靠性完成的软件任务,其时长正在迅速增长,大约每 7 个月翻一番。请参阅衡量 AI 完成长时任务的能力(METR)。

我们近期的 GPT-5.3-Codex 发布公告介绍了智能体工作在两个实际方面的进一步提升:
- 它更擅长多步骤执行(规划 → 实现 → 验证 → 修复)。
- 在运行过程中更容易调整方向,无需重新开始整个运行过程(修正方向不会清除已有进度)。
Cursor 关于长时间运行的自主编程系统的文章也给了我启发,其中包括他们构建浏览器的实验:Cursor 如何构建网页浏览器(扩展智能体规模)。
Cursor 团队写道,OpenAI 模型“在长时间自主工作方面要出色得多:遵循指令、保持专注、避免偏离目标,以及准确、完整地实现功能”。
为什么 Codex 能在长时任务中保持思路连贯
长时间运行的工作,与其说依赖一条庞大的提示,不如说更依赖模型所处的智能体循环。
在 Codex 中,这个循环大致如下:
- 制定计划
- 编辑代码
- 运行工具(测试、构建、代码检查)
- 观察结果
- 修复问题
- 更新文档和状态
- 重复循环
这个循环之所以重要,是因为它为智能体提供了:
- 真实反馈(错误、差异、日志)
- 保存在外部的状态(代码仓库、文件、文档、工作树、输出)
- 持续接受引导的能力(您可以根据结果修正方向)
这也解释了为什么在 Codex 的各个产品界面中使用 Codex 模型,会比在通用聊天窗口中体验更好:执行框架提供了结构化上下文(代码仓库元数据、文件树、差异、命令输出),并强制遵循严格的完成条件检查流程。
我们最近发布了一篇介绍 Codex 智能体循环的文章,其中有更详细的说明。
此外,我们还推出了 Codex App,让这个循环能够融入日常工作:
- 跨项目并行运行对话线程(长时间运行的工作不会阻碍您的日常工作)
- 技能(规范规划、实现、测试和报告流程)
- 自动化(在后台处理例行工作)
- Git 工作树(隔离各次运行、让差异便于审查、减少反复折腾)

我的测试设置
我为这次“实验”选择了设计工具,因为这是一项严苛的测试:用户界面、数据模型、编辑操作,以及大量边界情况。糊弄是过不了关的。如果架构有问题,工具很快就会出故障。
我给 GPT-5.3-Codex 提供了一份内容详实的规格说明,让它以“极高”推理级别运行。最终,它不间断运行了约 25 小时,能够保持思路连贯,并交付高质量代码。模型每完成一个里程碑,还会执行验证步骤(测试、代码检查、类型检查)。
核心思路:持久保存项目记忆
最重要的方法是持久保存项目记忆。我把规格说明、计划、约束和状态写进 Markdown 文件,让 Codex 可以反复查阅。这避免了偏离目标,也让“完成”的定义保持稳定。
下方提供了代码仓库链接,使用的文件如下:
Prompt.md(规格说明 + 交付成果)
用途:固定目标,避免智能体“做出令人惊艳却不符合要求的东西”。
文件中的主要部分:
- 目标 + 非目标
- 硬性约束(性能、确定性、用户体验、平台)
- 交付成果(完成时必须具备的内容)
- “完成条件”(检查项 + 演示流程)
初始提示要求 Codex 将提示/规格文件视为完整的项目规格说明,并生成一份按里程碑组织的计划:

Plan.md(里程碑 + 验证)
用途:将开放式工作拆解为一系列智能体能够完成并验证的检查点。
文件中的主要部分:
- 足够小、能在一次循环中完成的里程碑
- 每个里程碑的验收标准 + 验证命令
- 暂停并修复的规则:如果验证失败,先修复,再继续
- 记录决策,避免反复摇摆
- 代码库的预期架构

我们最近为 Codex App、CLI 和 IDE 扩展添加了原生计划模式。它可以在动手修改之前,将较大的任务拆解成一系列清晰、可审查的步骤,让您提前确认实施方案。如果还需要澄清细节,Codex 会继续提问。使用 /plan 斜杠命令即可开启。
Implement.md(参照计划的执行指令)
用途:这是一份操作手册,明确告诉 Codex 如何开展工作:遵循计划、控制改动范围、运行验证、更新文档。
文件中的主要部分:
- 以计划 Markdown 文件为准,逐个完成里程碑
- 每完成一个里程碑就运行验证,发现问题立即修复
- 将改动限定在既定范围内,不扩大范围
- 持续更新文档 Markdown 文件

Documentation.md(交付过程中的状态与决策)
用途:这份文件兼具共享记忆和审计日志的作用,让我即使离开几个小时,回来后仍能了解期间发生了什么。
文件中的主要部分:
- 当前里程碑状态(已完成什么,接下来做什么)
- 已做出的决策及其原因
- 运行与演示方法(命令和快速冒烟测试)
- 已知问题与后续事项

在这次运行中,里程碑验证的实际情况如下:

每个里程碑都进行验证
Codex 并不是写完代码就寄希望于它能正常运行。每完成一个里程碑,它都会执行验证命令,修复问题后再继续。
以下是指令中要求它使用的部分质量检查命令:

下面是 Codex 在代码规范检查失败后修复问题的示例:

智能体构建了什么
结果并不完美,也尚未达到生产环境要求,但它是实实在在、可以测试的成果。这次运行的衡量标准不是“能否编译通过”,而是“是否遵循了指令,以及是否真的能用”。
已实现的主要功能:
- 画布编辑(画框、分组、形状、文本、图片与图标、按钮、图表)
- 实时协作(在线状态、光标、选区和编辑操作在标签页之间同步)
- 检查器控件(几何属性、样式、文本)
- 图层管理(搜索、重命名、锁定与隐藏、调整顺序)
- 参考线、对齐与吸附
- 历史快照与恢复
- 回放时间线,并从先前的时间点创建分支
- 原型模式(交互热区与流程导航)
- 评论(固定位置的讨论串,可标记为已解决或重新打开)
- 导出(保存、导入、导出,以及通过 CLI 导出为 JSON 和 React + Tailwind)
在 Codex 中运行长时任务的经验
这次运行能够成功,靠的不是某一条巧妙的提示,而是以下因素的共同作用:
- 明确的目标与约束(规格文件)
- 设有检查点和验收标准的里程碑(
plans.md) - 指导智能体如何工作的操作手册(
implement.md) - 持续验证(测试、代码规范检查、类型检查、构建)
- 实时更新的状态记录与审计日志(
documentation.md),让运行过程始终可供查看
这就是长时编程任务的发展方向:减少事事盯守,在护栏保障下委派更多工作。
让 Codex 试试您自己的长时间运行任务
这次持续 25 小时的 Codex 运行,让我们提前看到了编程开发的未来。我们正在从单次提示和紧密的结对编程循环,走向与能够持续工作的队友协作:它可以从头到尾完成一整块实际工作,而您只需在里程碑处把握方向,无须逐行管理代码。
我们对 Codex 的发展方向很明确:让它更善于像队友一样协作,更紧密地融入您的实际上下文,并通过护栏让工作成果可靠、可审查、易于交付。我们已经看到,当智能体承担常规的实现和验证工作后,开发者的推进速度会更快,也能腾出精力专注于最重要的部分:设计、架构、产品决策,以及没有现成模板可循的新问题。
受益者也不会止于开发者。随着 Codex 越来越善于理解意图,并提供安全的配套机制(计划、验证、预览、回滚),更多非开发者也能构建和迭代产品,而无须整天待在 IDE 中。Codex 的各个使用界面和模型还会持续更新,但核心目标始终不变:让智能体不再像一个需要您时刻盯着的工具,而更像一位能让您放心托付长时任务的队友。
如果您也想亲自尝试,可以从以下资源入手: