AGENTIC COMMONSAI 產業簡報

繁中EN

標籤Anthropic出版 2026-10-07

返回文章列表Anthropic

小模型的價格往下壓了四分之三:Claude Haiku 5.5 改變了 subagent 的成本算式

本頁內容6 個段落
  1. 數字告訴我們什麼
  2. Effort 設定下放到 Haiku 級
  3. 針對 subagent 和低延遲場景
  4. 配套的價格調整
  5. 實際的下一步
  6. 參考來源

高用量、對成本敏感的工作——摘要、compaction、資料庫查詢、分類——過去常常卡在一個尷尬的位置:交給大模型太貴,交給小模型又不夠穩。Anthropic 在 2026 年 10 月 7 日發表的 Claude Haiku 5.5,就是把這條線往下壓:官方稱它是旗下最便宜、最快、能力最強的小模型,平均運行成本比 Haiku 4.5 低約 75%。

數字告訴我們什麼

根據 Anthropic 公布的基準測試,Haiku 5.5 相比 Haiku 4.5 的躍進相當明顯:OSWorld 2.1(offline subset)從 15.7% 提升到 72.4%,Terminal-Bench 4.0 從 0.0% 到 39.2%,Humanity’s Last Exam(無工具)從 10.2% 到 45.9%。和 GPT-6 Luna 相比,它在 OSWorld 上領先(72.4% 對 48.9%),在 Terminal-Bench 和 HLE 則仍落後。Sonnet 5.5 在多數項目上還是更強,但價差正是 Haiku 存在的理由。

對 builder 來說,這些數字真正的意義不是排名,而是「哪些工作可以從大模型降級到小模型」的邊界往後移了。以前需要 Sonnet 級能力才能穩定完成的分類或 agent 子任務,現在可能用 Haiku 5.5 就夠,直接反映在帳單上。

Effort 設定下放到 Haiku 級

Haiku 5.5 是第一個支援可調 effort 設定的 Haiku 級模型。這表示你可以在同一顆模型上,按任務的重要性選擇偏向省錢或偏向聰明,而不必為不同等級的工作維護兩套模型配置。Anthropic 也提供了各 effort 等級在三個基準上的準確率對成本的曲線,部署前值得先看一遍,估計自己的工作負載落在曲線的哪一段。

針對 subagent 和低延遲場景

Anthropic 明確把兩個使用情境寫進了定位:一是搭配 Opus 5.5 和 Sonnet 5.5,在編碼工作中擔任 subagent;二是速度敏感的任務,例如即時客服和瀏覽器操作。早期測試中,Asana 的 Staff Software Engineer Aaron Vinh 表示,在他們針對 AI Teammates 的 eval 中,任務完成延遲降低超過 30%,每個 agent turn 的推論速度最高快 2.5 倍。

這和之前寫過的 Claude 系列在存取與使用上的分層設計 是同一條思路:把不同等級的工作明確分配給不同等級的資源,而不是一顆模型包辦所有事。Haiku 5.5 把 subagent 的單位成本壓低,等於讓「主模型規劃、小模型執行」這種架構更容易達到損益平衡。

配套的價格調整

這次發表還有兩項容易忽略的配套:Sonnet 5.5 的 cache reads 價格減半,讓多數 agentic 工作的成本下降約 20%;Claude Max 和 Team 訂閱者則獲得新的每月 API credit。前者對跑長 agent 流程的人影響不小——cache 命中的次數越多,這項調整省得越多。

實際的下一步

如果你的系統裡已經有明確的任務分層,Haiku 5.5 值得做一輪降級測試:挑出目前用 Sonnet 級模型跑的重複性任務,用相同的 eval 對比品質與成本。要注意的是,以上效能數據都來自 Anthropic 自家的測試與客戶早期回饋,實際表現仍取決於你的工作負載——先用一小段真實流量驗證,再決定要不要把降級推廣到整條 pipeline。

參考來源

AGENTIC COMMONS由 PHLEGON LABS 經營
分享X電郵
支持我們

相關閱讀

  1. Sonnet 5.5 把帳單往下壓 30%:模型分層策略該重算的一張表

    Anthropic 於 2026 年 9 月 28 日發布 Claude Sonnet 5.5,速度快 30%、多數工作便宜最多 30%,高流量 agent 的成本結構需要重算。

    Anthropic

  2. 同一顆模型、兩種把關:Mythos 5.1 把「誰能用」和「怎麼用」分開處理

    Anthropic 讓 Mythos 5.1 只對通過驗證的組織開放,並用 Fable 5.1 帶著更精準的防護走向大眾。

    Claude Mythos

  3. Claude Opus 4.8 發布:Dynamic Workflows 與更誠實的程式碼模型

    Anthropic 在 41 天後推出 Claude Opus 4.8:價格不變,新增可協調上百個子代理的 Dynamic Workflows 與 Effort 控制,SWE-bench Pro 升至 69.2%,Mythos 預告數週內開放。

    Anthropic