For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主要導覽
2026年2月23日 Codex

使用 Codex 執行長時間任務

作者: Derrick Choi

使用 Codex 執行長時間任務

2025 年 9 月,OpenAI 推出 GPT-5-Codex,這是首個針對智慧體式程式碼編寫最佳化的 GPT-5 版本。2025 年 12 月,我們推出 5.2,人們也從那時開始相信,自主程式碼編寫智慧體可以可靠地完成工作。尤其明顯的是,模型能可靠遵循指示的持續時間大幅增加。

我想透過壓力測試,看看這個極限在哪裡。於是,我給了 Codex 一個空白程式碼庫、完整存取權,以及一項任務:從零開始打造設計工具。接著,我讓它使用 GPT-5.3-Codex,以「極高」推理等級執行。Codex 連續執行了約 25 小時,使用約 1,300 萬個 Token,並產生約 3 萬行程式碼。

這是一次實驗,並非正式環境上線。不過,在長時間工作的重要環節上,它表現良好:遵循規格、專注於任務、執行驗證,並在過程中修正問題。

Codex Design Desk 使用者介面

長時間執行的 Codex 工作階段是什麼樣子

我請 Codex 根據工作階段資料產生摘要頁面:

Codex 工作階段摘要儀表板

以下則是 CLI 工作階段的統計資料與 Token 用量:

Codex CLI 工作階段統計資料與 Token 用量

這些螢幕擷取畫面讓核心轉變清楚可見:智慧體式程式碼編寫越來越重視任務時間跨度,而不只是單次回應的智慧表現。

真正的轉變在於任務時間跨度

這不只是「模型變聰明了」。實際的改變是,智慧體能在更長的時間內維持連貫性,從頭到尾完成更大範圍的工作,並在發生錯誤後恢復執行,同時不失去原有脈絡。

METR 的任務時間跨度基準測試研究,有助於我們理解這個趨勢:前沿智慧體能以約 50% 和 80% 的可靠度完成的軟體任務,其時間長度正快速增加,大約每 7 個月就翻倍。請參閱衡量 AI 完成長時間任務的能力(METR)

METR 衡量 AI 完成長時間任務能力的圖表

我們近期的 GPT-5.3-Codex 發布公告,說明了智慧體工作在兩個實用層面的進一步提升:

  1. 它更擅長執行多步驟流程(規劃 → 實作 → 驗證 → 修正)。
  2. 執行途中更容易調整方向,無須從頭開始(修正方向不會清除既有進度)。

Cursor 關於長時間執行的自主程式碼編寫系統的文章也啟發了我,其中包括他們打造瀏覽器的實驗:Cursor 如何打造網頁瀏覽器(擴展智慧體規模)

Cursor 團隊寫道,OpenAI 模型「在長時間自主工作方面表現好得多:遵循指示、保持專注、避免偏離方向,以及精確且完整地實作功能」。

為什麼 Codex 能在長時間任務中維持連貫性

長時間執行的工作,與其仰賴一份龐大的提示詞,更取決於模型運作時所處的智慧體迴圈。

在 Codex 中,這個迴圈大致如下:

  1. 規劃
  2. 編輯程式碼
  3. 執行工具(測試/建置/程式碼靜態檢查)
  4. 觀察結果
  5. 修正問題
  6. 更新文件/狀態
  7. 重複執行

這個迴圈很重要,因為它為智慧體提供了:

  • 實際回饋(錯誤、差異、記錄)
  • 儲存在外部的狀態(程式碼庫、檔案、文件、工作樹、輸出)
  • 持續調整方向的能力(你可以根據結果修正方向)

這也解釋了為什麼在 Codex 介面中使用 Codex 模型,比在一般聊天視窗中更順手:任務執行框架會提供結構化的上下文(程式碼庫中繼資料、檔案樹、差異、指令輸出),並嚴格要求依照既定流程確認是否符合「完成條件」。

我們最近發布了一篇介紹 Codex 智慧體迴圈的文章,其中有更詳細的說明。

此外,我們也推出了 Codex App,讓這個迴圈能融入日常工作:

顯示專案對話串的 Codex App 工作區

我的測試設定

我選擇設計工具作為這次「實驗」的題目,因為這是個嚴苛的考驗:使用者介面、資料模型、編輯操作,加上大量邊界情況。這種測試無法蒙混過關。架構一旦有問題,很快就會出錯。

我給了 GPT-5.3-Codex 一份內容紮實的規格,並以「極高」推理等級執行。結果,它連續執行了約 25 小時,仍能維持連貫性,交付優質程式碼。模型每完成一個里程碑,也都會執行驗證步驟(測試、程式碼靜態檢查、型別檢查)。

關鍵概念:可持續保留的專案記憶

最重要的技巧,是建立可持續保留的專案記憶。我把規格、計畫、限制條件與狀態寫進 Markdown 檔案,讓 Codex 能反覆查閱。這避免了方向偏移,也讓「完成」的定義保持一致。

下方提供程式碼庫連結,使用的檔案如下:

Prompt.md(規格 + 交付成果)

目的:固定目標,避免智慧體「做出令人驚豔、卻不符合需求的東西」。

檔案中的主要章節:

  • 目標 + 不在目標範圍內的事項
  • 不可妥協的限制條件(效能、確定性、使用者體驗、平台)
  • 交付成果(完成時必須具備的項目)
  • 「完成條件」(檢查項目 + 示範流程)

最初的提示詞要求 Codex 將提示詞/規格檔案視為完整的專案規格,並產生以里程碑為基礎的計畫:

用來啟動 Codex 執行的提示詞

Plan.md(里程碑 + 驗證)

目的:把開放式工作拆成一連串檢查點,讓智慧體能逐一完成並驗證。

檔案中的主要章節:

  • 將里程碑縮小到能在一次迴圈內完成的規模
  • 每個里程碑的驗收標準 + 驗證指令
  • 先停下來修正的規則:如果驗證失敗,必須先修正才能繼續
  • 記錄決策,避免反覆改變方向
  • 程式碼庫的預定架構

Codex 在工作時參閱 Markdown 計畫檔案

我們最近在 Codex App、CLI 和 IDE 擴充功能中加入了原生規劃模式。這個模式能在開始修改前,將較大的任務拆解成一連串清楚、可供審查的步驟,讓你事先確認執行方式。若還有需要釐清的地方,Codex 會進一步提問。若要開啟此模式,請使用 /plan 斜線指令。

Implement.md(參照計畫的執行指示)

用途:這是操作手冊,明確告訴 Codex 該如何執行:遵循計畫、將變更限制在指定範圍內、執行驗證,以及更新文件。

檔案中的主要章節:

  • 以 Markdown 計畫檔案為準,逐一完成里程碑
  • 每完成一個里程碑就執行驗證(發現問題立即修正)
  • 將變更限制在指定範圍內(不要擴大範圍)
  • 持續更新 Markdown 文件檔案

指示 Codex 讀取 implement.md 並以其內容作為執行指示的提示詞

Documentation.md(交付過程中的狀態與決策)

用途:這是共用記憶與稽核紀錄。有了它,即使我離開數小時,回來後仍能了解這段期間發生了什麼事。

檔案中的主要章節:

  • 目前的里程碑狀態(已完成哪些項目、接下來要做什麼)
  • 已做出的決策及其原因
  • 執行與示範方式(指令與快速冒煙測試)
  • 已知問題與後續事項

顯示里程碑狀態更新的文件檔案

這次執行過程中,實際的里程碑驗證如下:

Codex 在各里程碑執行的品質驗證指令

在每個里程碑進行驗證

Codex 並非只寫好程式碼,就期待它能正常運作。每完成一個里程碑,它都會執行驗證指令,修正問題後才繼續。

以下是要求它使用的品質檢查指令範例:

用於 lint、型別檢查、測試、建置與匯出的品質檢查指令

以下則是 Codex 在 lint 檢查失敗後修正問題的範例:

Codex 在執行 npm run lint 後修正問題

智慧體打造了什麼

成果並不完美,也還沒準備好用於正式環境,但確實做了出來,而且可以測試。這次執行的標準不只是「能編譯」,而是「有沒有遵循指示,而且真的能用?」

已實作的主要功能:

  1. 畫布編輯(框架、群組、形狀、文字、圖片/圖示、按鈕、圖表)
  2. 即時協作(跨分頁同步上線狀態、游標、選取項目與編輯內容)
  3. 屬性檢查器控制項(幾何屬性、樣式、文字)
  4. 圖層管理(搜尋、重新命名、鎖定/隱藏、重新排序)
  5. 輔助線/對齊/吸附
  6. 歷程快照與還原
  7. 重播時間軸,以及從先前的時間點建立分支
  8. 原型模式(熱點與流程導覽)
  9. 留言(可標記為已解決或重新開啟的釘選討論串)
  10. 匯出(儲存/匯入/匯出,以及透過 CLI 匯出為 JSON 和 React + Tailwind)

執行長時間 Codex 任務的心得

讓這次執行成功的,不是單一巧妙的提示詞,而是以下要素的組合:

  • 明確的目標與限制(規格檔案)
  • 設有檢查點與驗收標準的里程碑(plans.md
  • 說明智慧體應如何執行工作的操作手冊(implement.md
  • 持續驗證(測試/lint/型別檢查/建置)
  • 即時更新的狀態與稽核紀錄(documentation.md),讓執行過程隨時可供檢視

這就是長時間程式開發工作的發展方向:不必時刻緊盯,而是在防護機制下委派更多工作。

試著讓 Codex 處理你自己的長時間任務

這次長達 25 小時的 Codex 執行,讓我們預見了程式開發的未來。我們正從單次提示詞與緊密配合的結對程式設計,走向能長時間工作的協作夥伴,由它從頭到尾完成一部分實際工作。你只需在各個里程碑引導方向,不必逐行緊盯程式碼。

我們為 Codex 設定的方向很簡單:讓它更懂得如何與人協作,更緊密地結合你的實際上下文,並透過防護機制,讓工作成果保持可靠、可供審查且容易交付。我們已經看到,當智慧體接手例行的實作與驗證工作,開發人員就能加快進度,把時間投入最重要的部分:設計、架構、產品決策,以及沒有現成範本可循的新問題。

而且,受惠的不只有開發人員。隨著 Codex 更善於掌握意圖,並提供計畫、驗證、預覽、還原等安全支援機制,更多非開發人員也能打造作品並持續改進,不必整天待在 IDE 裡。Codex 的各個介面與模型還會有更多進展,但核心目標始終不變:讓智慧體不再像是需要時刻緊盯的工具,而更像是能放心交付長時間工作的協作夥伴。

如果你也想親自試試,可以從這些資源開始: