2026 年 2 月 11 日,Google DeepMind 在官方部落格發布 Gemini 3 Deep Think 的重大更新。這個專為專業研究設計的推理模式,目標不是把奧賽題解得更快,而是在數學、物理與電腦科學研究者指導下處理開放式研究問題。文章由 Thang Luong 與 Vahab Mirrokni 帶隊,Terence Tao 位列致謝——DeepMind 把「AI for Science」當主戰線的訊號很明確。
從奧賽金牌到研究級推理
Deep Think 是 Gemini 3 的專門推理模式。DeepMind 表示,它在 2025 年夏季的國際數學奧林匹亞(IMO)達到金牌水準,稍後版本在 ICPC 追平同等標準。這次更新的主角是 2026 年 1 月版本:在內部評測中顯著超越 IMO 金牌版本,而且用更低的推理算力達到更好的推理品質。換句話說,能力還在往上走,成本曲線同時在往下走。
Aletheia:會承認失敗的數學代理人
更新中最值得工程師注意的是 Aletheia——以 Deep Think 為核心的數學研究代理人。它用自然語言驗證器檢查自己的證明、可以透過 Google 搜尋與網頁瀏覽查文獻,而且設計上允許「承認失敗」。
這對 agent 工程極為關鍵:不會說「我做不到」的研究代理人,比流暢產出錯誤證明的更危險。自然語言驗證器也讓數學家能用習慣的方式審查機器推理。
90% 的 IMO-ProofBench Advanced 與推理縮放
在 IMO-ProofBench Advanced 上,Deep Think 隨推理期算力增加最高可達 90%,而且 DeepMind 報告這條縮放曲線一路延伸到博士級習題(內部 FutureMath Basic 基準)。對產品團隊的含義直接:當品質可以用算力換,準確率、延遲與成本就成了同一組可調旋鈕。
18 個研究問題的實績與自我設限
DeepMind 給出罕見具體的實績清單:跨 18 個研究問題,產出至少一篇 ICLR 2026 接受論文。亮點包括 Feng26(算術幾何 eigenweights 的全自主論文)、在 Bloom 的 Erdős 猜想庫 700 個開放問題中自主解出 4 個(含 Erdős-1051)、用三元素反例推翻 2015 年的線上次模最佳化猜想,並協助 STOC 2026 論文審稿。
報告同時自我設限:目前只達 Level 2「可發表品質」,沒有 Level 3 或 4 突破——這種克制反而提高可信度。
取得方式與限制
Deep Think 目前在 Gemini App 向 Google AI Ultra 訂閱者開放;API 端僅限獲選的研究者、工程師與企業透過 Early Access Program 申請,尚未進入一般 pay-as-you-go 的 Gemini API。Demis Hassabis 隨後在 X 宣布這次升級在「最嚴格的數學與科學基準」上創下新紀錄;India Today 的後續報導則指出它在 Humanity’s Last Exam 拿到及格分數。
為什麼開發者該關注
三點。第一,驗證器設計:自然語言驗證加上「允許失敗」是可借鑑的 agent 架構模式。第二,推理算力作為產品變數:90% 背後是一條可控的品質—成本曲線,值得寫進 eval 與定價設計。第三,差異化戰場從通用基準轉向專業研究工作流。延續2026 開年觀察的路線分歧:Deep Think 選「往深處走」,同週開源陣營正「往便宜走」。
參考來源
- Accelerating Mathematical and Scientific Discovery with Gemini Deep Think — Google DeepMind
- Gemini 3 Deep Think: Advancing science, research and engineering — Google Blog
- Google Gemini 3 Deep Think AI scores passing marks in Humanity’s Last Exam — India Today
本文由 AI 協助自上述來源整理,經人工審核後發布。
