Agent Benchmarks

GPT-5.2 寫下 METR 時間視野新紀錄:6.6 小時的 Agent 門檻

METR 於 2026 年 2 月 4 日將 GPT-5.2 納入時間視野追蹤:高推理模式的 50% 時間視野約 6.6 小時,刷新紀錄。本文解析指標計算方式、與前代模型對比,以及約每 4–7 個月翻倍的指數趨勢對工程團隊的意義。

GPT-5.2 寫下 METR 時間視野新紀錄:6.6 小時的 Agent 門檻 — 文章封面
本頁內容6 個段落
  1. 時間視野是什麼:指標怎麼算
  2. GPT-5.2 的 6.6 小時代表什麼
  3. 與前代與同代模型的對比
  4. 每 4–7 個月翻倍的指數趨勢
  5. 對工程與產品團隊的意義
  6. 參考來源

2026 年 2 月 4 日,AI 評測機構 METR 把 GPT-5.2 加進「時間視野」(time horizon)追蹤基準——前一天才剛納入 Gemini 3 Pro 與 GPT-5.1 Codex Max。數字一出就是紀錄:GPT-5.2 在「高」推理模式下,50% 時間視野約 6.6 小時(95% 信賴區間 3 小時 20 分至 17 小時 30 分),為這項基準設立以來的最高標記。

這個數字衡量的事很具體:把任務交給 agent,它有一半機率能完成的任務長度,以人類專家完成同一任務所需的時間計。6.6 小時代表「交代一個下午的工作」首次進入可靠範圍——對照 2025 年中模型還在 1 小時上下徘徊,這是 agent 從 demo 邁向可委派的分水嶺。

時間視野是什麼:指標怎麼算

METR 的定義:時間視野是「預測 agent 能以指定可靠度完成」的任務時長,以人類專家的完成時間衡量。做法是先由受過訓練的專業人員估出每個任務的完成時間(取幾何平均),再對「成功率 vs 人類時間的對數」擬合邏輯迴歸曲線,讀出 50% 與 80% 成功率的交叉點。每個模型在每個任務上大約跑 8 次。

任務來自三個套件:RE-Bench(ML 研究工程)、HCAST(範圍較廣的軟體工程)與 SWAA(較短的軟體操作任務),合計超過一百個。要注意的是,這些任務以軟體工程與研究為主——時間視野衡量的是「工程任務長度」,不是泛用的辦公能力。

GPT-5.2 的 6.6 小時代表什麼

三個必須一起讀的脈絡。第一,6.6 小時是「高」推理模式的結果,不是更極端的 xhigh 檔位。第二,信賴區間很寬(3 小時 20 分到 17 小時 30 分),單一點估計的誤差不可忽略。第三,METR 明言目前任務套件在 16 小時以上的測量「不可靠」——任務難度的天花板正在逼近量測極限,這也是他們持續擴充套件的原因。

與前代與同代模型的對比

把座標點連起來,斜率才是重點:

  • GPT-5(2025 年 8 月量測):約 2 小時 17 分
  • GPT-5.1 Codex Max:約 2 小時 42 分
  • Claude Opus 4.5(2025 年 12 月加入):約 4 小時 49 分
  • GPT-5.2(2026 年 2 月 4 日加入,高推理模式):約 6.6 小時,發布即登頂

也就是說,OpenAI 一個世代就把自家紀錄從 2 小時 17 分推到 6.6 小時,接近三倍;同週入榜的 Gemini 3 Pro 與 GPT-5.1 Codex Max 都被壓在其下。上一個持續領先的模型是 Anthropic 的 Claude Opus 4.5,4 小時 49 分的紀錄只保持了約六週。

每 4–7 個月翻倍的指數趨勢

METR 的歷史資料顯示,50% 時間視野大約每 4 到 7 個月翻一倍,而且指數曲線對資料的擬合優於線性與雙曲線——目前沒有觀察到趨勢放緩的證據。GPT-5.2 的結果被廣泛解讀為翻倍仍在加速的佐證。照這個節奏外推,「可靠工作日長度」(4 到 8 小時)的任務在 2026 年內就會成為常態,規劃 agent 架構時值得直接以此為基線——這也是我們在2026 開年展望中的判斷。

對工程與產品團隊的意義

三個務實結論。第一,任務拆分策略要重寫:當 6 小時任務的可靠度過半,舊的「拆到 30 分鐘再逐步組裝」打法,會被「整段委派加檢查點驗收」取代。第二,監控比以往更重要:一半成功率意味着另一半會失敗,驗收測試與復原機制是架構的一部分,不是選配。第三,模型選型該盯時間視野而非單點分數:SWE-bench 之類的成績不會告訴你,模型能否撐完一個下午的連續工作。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵