Anthropic

Anthropic Project Fetch 第二階段:Opus 4.7 操作機器狗比人快 20 倍

Anthropic 於 2026 年 6 月 18 日發布 Project Fetch 第二階段:Claude Opus 4.7 全自主操作機器狗,比最快人類團隊快約 20 倍、程式碼少十倍,卻仍推不動那顆海灘球。本文拆解數據、方法與社群爭議。

Anthropic Project Fetch 第二階段:Opus 4.7 操作機器狗比人快 20 倍 — 文章封面
本頁內容6 個段落
  1. 20 倍速度從哪裡來
  2. 實驗設計:人類只負責插電與按確認
  3. 推不動的海灘球
  4. 從資安到實體世界的同一個劇本
  5. 爭議與對開發者的意義
  6. 參考來源

2026 年 6 月 18 日,Anthropic 的 Frontier Red Team 發布「Project Fetch: Phase Two」。研究員 Michael Ilie、C. Daniel Freeman 與 Kevin K. Troy 讓 Claude Opus 4.7 全自主操作一台現成的四足機器狗,重跑 2025 年 8 月第一階段由人類團隊執行的同一組任務。核心結果:在人類曾完成的任務上,模型比當時最快的人類團隊快上約 20 倍。

這不是又一支展示影片,而是同一批任務、可重複對照的實驗。在「LLM 到底能不能做實體任務」的爭論裡,它給了目前最具體的一組數字,同時也留下一個清晰的失敗案例。

20 倍速度從哪裡來

研究團隊用 Claude Code 跑了三次 Opus 4.7,adaptive thinking 開到最大強度。在人類完成過的任務上,模型大約比最快的人類團隊快 20 倍;在至少有一組人類完成的每一項任務上,也至少快 10 倍。在四項雙方都完成的共同任務上,模型比「沒有 Claude 的人類團隊」快超過 37 倍,比「有 Claude 的人類團隊」快超過 18 倍,而且只用了大約十分之一的程式碼就達到相同或更好的成功率。

換句話說,這不是用更多程式碼硬堆出來的結果——程式量反而少了一個量級。論文另指出,模型在已完成步驟上的完成時間變異很低,這對需要可預測性的自動化管線來說,可能比平均速度更有價值。

實驗設計:人類只負責插電與按確認

實驗刻意把人的角色壓到最低:研究員只負責接上筆電、輸入初始提示,並在指令執行與任務轉換時按下核准。實體控制器的任務被明確排除。會挑 Opus 4.7,是因為它當時是最先進的非 Mythos 級模型——Mythos Preview 的初步測試因為環境設定與推論服務的差異,無法做公平比較。這個排除決策後來在 Hacker News 上引來不少揣測。

模型的表現有三個亮點:很快找到了人類當年集體卡關的感測器介面做法;大部分程式碼第一次執行就能動;發現自己誤用了預設的過時物件偵測演算法後,主動繞過修正。

推不動的海灘球

任務名稱裡的「fetch」——把海灘球撥到定位——恰恰是模型始終做不好的部分。它能把自己的身體擺到球的正後方,但後續的推撥動作「控制不佳、不算成功」。作者的診斷:模型缺少人類靠反覆練習養成的閉環感知與修正能力。作為對照,一位有經驗的機器人研究者成功完成了自主取球;作者也相信現在的 Claude 在更多時間與更好的鷹架下應該做得到。

論文裡最直白的一句話是:「這不代表 LLM 已經解決了機器人學,遠遠沒有。」實驗沒有測任何低階控制(例如 actuation policies),而且這些進步來自一般性的規模化,不是針對機器人任務的訓練。

從資安到實體世界的同一個劇本

作者點出一個模式:模型先輔助人類,接著人類輔助模型,最後模型獨立作業。這個劇本先前已在資安領域出現,現在開始在實體任務上重演。他們寫道,我們「很可能正在進入實體 agentic AI 的早期時代」。

對安全研究而言,重點不在這次做對了什麼,而在速度:不到一年、沒有做任何機器人專屬訓練,同一批任務的完成時間就被壓縮了 20 倍。這也提醒我們,真實任務的縱貫評測與靜態基準量的是不同的東西——工具使用類基準(例如 Hugging Face 的 agentic tooling 評測)量「會不會用工具」,Project Fetch 量「能不能獨力把一個實體任務收斂到結果」。

爭議與對開發者的意義

Hacker News 上的討論(73 分、26 則留言)大致分三派。質疑派認為這份報告「讀起來更像 Opus 4.7 對 4.1 的版本比較」,真正有資訊量的實驗是讓人類團隊也換上新模型再比一次;也有人質疑第一方研究的可信度。反駁派則指出 Opus 公開可用、硬體便宜,任何人都可以重現,而且公司部落格本來就是公開的宣傳品,沒有偽裝。

對開發者的三個實際訊息。第一,把 LLM 當「會寫控制程式碼的通用工程師」來用,而不是內建運動控制的系統——閉環修正仍是明確短板。第二,別忽略低變異這個性質:穩定可預測的步驟完成時間,往往是自動化能否上線的關鍵。第三,單一實驗室的自家數據不應直接當基準,等第三方重現後再下結論。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵