AGENTIC COMMONSAI 產業簡報

繁中EN

主題AI 編程與開發工具出版 2026-10-10

返回文章列表Claude

Opus 5.5 把旗艦模型的價格拉下來了:builder 該看的不是分數,是每個任務的帳單

Anthropic 在官方公告中介紹了 Claude Opus 5.5,這是 Claude 5.5 系列的第一個模型。對 builder 來說,這次最值得注意的不是排行榜上又多了幾個百分點,而是帳單:Anthropic 自己的測試顯示,在典型工作負載下,Opus 5.5 的執行成本比 Opus 5 低 40%,同時表現達到 Claude Fable 5.1 在多數工作上的水準。

價格結構怎麼變

具體數字是這樣的:輸入每百萬 token $4、輸出 $20,分別比 Opus 5 便宜 20%;但真正影響 agent 和 coding 工作的是 cache reads——降到每百萬 $0.20,比 Opus 5 便宜 60%。因為這類工作的大部分成本本來就來自 cache reads,這一項的降幅會直接反映在長會話和多重步驟任務的總帳單上。

速度也快了:輸出比 Opus 5 快 30% 以上。如果還嫌不夠,Claude Code 和 Claude Platform 提供 fast mode,最高 2.5 倍速,代價是輸入 $8、輸出 $40 每百萬 token。另外 Pro、Max、Team 和按席次的 Enterprise 方案,五小時用量上限都提高了,訂閱用戶還拿到一個可以自行保存、想用時再啟用的 rate limit reset。

每個任務的成本,比每個 token 的成本重要

更關鍵的一點:Opus 5.5 不只單價便宜,每個任務用的 token 也更少,兩者疊加才是那 40% 的來源。Anthropic 引用的內部測試裡,把 HAProxy 從 C 翻譯成 Rust,Opus 5.5 用 9.5 小時完成,Fable 5.1 用了 12 小時,成本還低 51%。在 FrontierCode 上以預設 effort 檔位,它以約五分之一的每任務成本打贏 GPT-6 Astra;Terminal-Bench 4.0 上以約四成成本追平 Astra;CursorBench 4.0 則以約三分之一成本比 GPT-5.6 Sol 高出 11 分。

這些數字來自 Anthropic 的公告和圖表腳註,其中有幾點值得保留判讀:AutomationBench 由 Zapier 執行且不使用 fallback 模型,safeguard 介入會被計為失敗,所以分數低於實際情況;Terminal-Bench 和 Terminal-Bench-Science 的標準誤差都在 ±2 到 5 分之間。Anthropic 自己也承認,在這個能力層級,benchmark 之間的差距已經不太能對應真實世界的差異,他們內部使用時,Opus 5.5 和 Fable 5.1 的差距比分數看起來窄。

長任務是它的主場

如果要把 Opus 5.5 放進工作流程,最合適的場景顯然是那些又長又散的工作:跨 codebase 的遷移和審計。有早期測試者在三小時內審計並修完 20 萬行的 codebase,Opus 5 需要 20 多小時、多 2.5 倍的 token。另一個案例是在一天內完成 68 萬行的遷移。GitHub 的 CPO Mario Rodriguez 在公告中表示,在 Copilot CLI 和 VS Code 的測試裡,Opus 5.5 使用的 token 和步驟數在所有受測模型中屬於最少的,在 VS Code 中用不到一半的步驟解決了比 Opus 5 更多的終端機任務。

這和之前 Claude Sonnet 5.5 重新畫出中階模型的成本線 是同一條邏輯的延伸:當旗艦模型的價格往下壓,選型時「哪些任務值得用旗艦」這條線也要跟著重畫。原先為了省錢拆給中階模型的長任務,現在可能直接留在同一顆模型上。

安全測試和後續

安全面上,公告稱 Opus 5.5 在 Anthropic 的自動化行為審計(automated behavioral audit)上是目前測過表現最好的模型,比較不容易做出難以逆轉的動作或超出邊界,對 prompt injection 的抵抗力也高於 Opus 5。由於在生物和網路安全方面與 Claude Mythos 5.1 相當,它配備了與 Fable 5.1 類似的 safeguards,並有 Life Sciences Verification Program 和即將擴大的 Cyber Verification Program 作為受管控的存取管道。完整評估細節在 Opus 5.5 System Card。

Claude Sonnet 5.5 和 Claude Haiku 5.5 會在接下來幾週跟進。實際的下一步很簡單:拿你現在最燒錢的那個長任務,用 Opus 5.5 預設 effort 重跑一次,比較帳單和 token 用量——那是任何 benchmark 都替代不了的證據。

參考來源

AGENTIC COMMONS由 PHLEGON LABS 經營
分享X電郵
支持我們

相關閱讀

  1. 中階模型的成本線被重新畫過:Claude Sonnet 5.5 對 builder 意味著什麼

    Claude Sonnet 5.5 以同價但更快更省的姿態接下日常工作,Terminal-Bench 4.0 從 10.3% 跳到 70.6%,改寫中階模型的選型算式。

    Anthropic

  2. 小模型的價格往下壓了四分之三:Claude Haiku 5.5 改變了 subagent 的成本算式

    Anthropic 推出 Claude Haiku 5.5,價格平均比 Haiku 4.5 低約 75%,並首次為 Haiku 級模型加入可調 effort 設定。

    Anthropic

  3. Sonnet 5.5 把帳單往下壓 30%:模型分層策略該重算的一張表

    Anthropic 於 2026 年 9 月 28 日發布 Claude Sonnet 5.5,速度快 30%、多數工作便宜最多 30%,高流量 agent 的成本結構需要重算。

    Anthropic