Benchmarks

Epoch AI:中國模型平均落後美國前沿 7 個月,差距 4 到 14 個月

Epoch AI 於 2026 年 1 月 2 日發布 ECI 分析:2023 年以來中國模型平均落後美國前沿 7 個月,區間 4 至 14 個月,尚無模型超越 o3。本文拆解計算方法、開源權重的干擾變數與社群爭論。

Epoch AI:中國模型平均落後美國前沿 7 個月,差距 4 到 14 個月 — 文章封面
本頁內容6 個段落
  1. ECI 怎麼算出「七個月」
  2. 4 到 14 個月:差距的形狀
  3. 開源權重的干擾變數
  4. 七個月真的重要嗎
  5. 對開發者的意義
  6. 參考來源

2026 年 1 月 2 日,Epoch AI 發布資料分析(作者 Luke Emberson),結論一句話講完:以該機構的 ECI(Epoch Capabilities Index)能力指數衡量,2023 年以來每一個站上能力前沿的模型都來自美國,而中國模型平均落後 7 個月,差距區間為 4 到 14 個月。這個數字迅速成為美中 AI 競賽討論的標準引用,TIME 整理兩國競賽的圖表報導即直接採用。

「七個月」的意義不在於聽起來大或小,而在於它是第一個把「中國到底落後多少」變成可以逐日追蹤的公開曲線。對模型選型與政策判斷來說,這份分析的量測方法與它的限制,都值得拆開來看。

ECI 怎麼算出「七個月」

ECI 是 Epoch 以基準測試成績合成的模型能力指數。這次分析的做法是:對每一天,取當時表現最好的中國模型 ECI 分數,回頭比對美國模型在多久之前持有相同或更低的分數,這段時間差就是「落後月數」;分數在 1 分以內視為等價。兩國各自的第一個模型——美國的 LLaMA-65B 與中國的 Baichuan1-7B——因為「可能不在真正前沿」而被排除。資料以 Creative Commons BY 授權釋出,底層 CSV 在 1 月 6 日更新過一次,設計上就是給人持續追蹤的。

4 到 14 個月:差距的形狀

結果面有兩個錨點。2024 年 5 月,第一款 ECI 超越 GPT-4 的中國模型出現,當時落後 14 個月,是整個觀察期的最大差距;而到分析發布時,仍沒有任何中國模型超越 OpenAI 在 2025 年 4 月發布的 o3。資料集中領先的中國模型包括 DeepSeek-R1、DeepSeek-V3.2、Qwen3-235B、Qwen3-Max、Kimi K2 Thinking 與智譜的 GLM 系列;美國前沿則由 GPT-5.2、Gemini 3 Pro、Claude Opus 4.5 等輪流把持。

開源權重的干擾變數

Epoch 自己標註了最重要的限制:這個國家差距幾乎完全映照「封閉前沿 vs 開放權重」的差距——頂尖中國模型幾乎全部開放權重,美國前沿模型則全部閉源。換言之,曲線量到的可能是商業策略差異(開放與否),而不純粹是能力差異。這也呼應我們在2026 開年觀察談到的開源路線分歧:能力領先者與權重開放的領先者已經不是同一批公司,兩種座標系會給出不同的「誰領先」答案。

七個月真的重要嗎

Hacker News 上 87 則留言的討論,幾乎預演了所有質疑。一派質疑指標本身:基準測試存在「benchmaxxing」空間,分數領先不等於真實能力領先;有人主張中國模型是美國模型的蒸餾產物,但立刻有人反駁——DeepSeek 的 MLA 架構、MoE 負載平衡都是公認的原創貢獻。另一派質疑結論的實際意義:多數真實任務用七個月前的 SOTA 就已經足夠;而在開放權重與小模型市場,中國陣營反而是主導者,阿里巴巴的閉源旗艦 Qwen 3 Max 在西方討論中近乎隱形。出口管制的反效果也被反覆提起:晶片限制迫使中國團隊把效率做到極致。

對開發者的意義

三個實際結論。第一,把「七個月」當基準線而非鐵律:封閉前沿大約領先最好的開放權重模型半年,你的功能是否真的需要那半年,直接決定成本結構。第二,讀任何國家級能力比較前先看指標定義——Epoch 的方法完全公開,但換一個指數,結論可能翻轉。第三,這個數字已經進入政策與媒體的主流論述(TIME 的美中競賽圖表即為一例),之後只會出現得更頻繁;理解它怎麼量出來,比背下數字本身有用得多。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵