高用量、對成本敏感的工作——摘要、compaction、資料庫查詢、分類——過去常常卡在一個尷尬的位置:交給大模型太貴,交給小模型又不夠穩。Anthropic 在 2026 年 10 月 7 日發表的 Claude Haiku 5.5,就是把這條線往下壓:官方稱它是旗下最便宜、最快、能力最強的小模型,平均運行成本比 Haiku 4.5 低約 75%。
數字告訴我們什麼
根據 Anthropic 公布的基準測試,Haiku 5.5 相比 Haiku 4.5 的躍進相當明顯:OSWorld 2.1(offline subset)從 15.7% 提升到 72.4%,Terminal-Bench 4.0 從 0.0% 到 39.2%,Humanity’s Last Exam(無工具)從 10.2% 到 45.9%。和 GPT-6 Luna 相比,它在 OSWorld 上領先(72.4% 對 48.9%),在 Terminal-Bench 和 HLE 則仍落後。Sonnet 5.5 在多數項目上還是更強,但價差正是 Haiku 存在的理由。
對 builder 來說,這些數字真正的意義不是排名,而是「哪些工作可以從大模型降級到小模型」的邊界往後移了。以前需要 Sonnet 級能力才能穩定完成的分類或 agent 子任務,現在可能用 Haiku 5.5 就夠,直接反映在帳單上。
Effort 設定下放到 Haiku 級
Haiku 5.5 是第一個支援可調 effort 設定的 Haiku 級模型。這表示你可以在同一顆模型上,按任務的重要性選擇偏向省錢或偏向聰明,而不必為不同等級的工作維護兩套模型配置。Anthropic 也提供了各 effort 等級在三個基準上的準確率對成本的曲線,部署前值得先看一遍,估計自己的工作負載落在曲線的哪一段。
針對 subagent 和低延遲場景
Anthropic 明確把兩個使用情境寫進了定位:一是搭配 Opus 5.5 和 Sonnet 5.5,在編碼工作中擔任 subagent;二是速度敏感的任務,例如即時客服和瀏覽器操作。早期測試中,Asana 的 Staff Software Engineer Aaron Vinh 表示,在他們針對 AI Teammates 的 eval 中,任務完成延遲降低超過 30%,每個 agent turn 的推論速度最高快 2.5 倍。
這和之前寫過的 Claude 系列在存取與使用上的分層設計 是同一條思路:把不同等級的工作明確分配給不同等級的資源,而不是一顆模型包辦所有事。Haiku 5.5 把 subagent 的單位成本壓低,等於讓「主模型規劃、小模型執行」這種架構更容易達到損益平衡。
配套的價格調整
這次發表還有兩項容易忽略的配套:Sonnet 5.5 的 cache reads 價格減半,讓多數 agentic 工作的成本下降約 20%;Claude Max 和 Team 訂閱者則獲得新的每月 API credit。前者對跑長 agent 流程的人影響不小——cache 命中的次數越多,這項調整省得越多。
實際的下一步
如果你的系統裡已經有明確的任務分層,Haiku 5.5 值得做一輪降級測試:挑出目前用 Sonnet 級模型跑的重複性任務,用相同的 eval 對比品質與成本。要注意的是,以上效能數據都來自 Anthropic 自家的測試與客戶早期回饋,實際表現仍取決於你的工作負載——先用一小段真實流量驗證,再決定要不要把降級推廣到整條 pipeline。
