Anthropic

Sonnet 5.5 把帳單往下壓 30%:模型分層策略該重算的一張表

Anthropic 於 2026 年 9 月 28 日發布 Claude Sonnet 5.5,速度快 30%、多數工作便宜最多 30%,高流量 agent 的成本結構需要重算。

Sonnet 5.5 把帳單往下壓 30%:模型分層策略該重算的一張表 — 文章封面

一個價格點,兩種部署策略

Anthropic 在 2026 年 9 月 28 日發布 Claude Sonnet 5.5,主打對 Sonnet 5 快 30%、多數工作最多便宜 30%。定價是每百萬輸入 token $2、輸出 $10,搭配 prompt caching 最多省 90%、batch processing 省 50%。根據 Anthropic 的產品頁面,美國境內推論以 1.1 倍價格提供,這對有資料落地需求的金融與醫療客戶是明確的選項。

對 builder 來說,這不只是降價新聞。當中階模型同時變快、變便宜、還拉高任務完成率,你的模型分層表就需要重新畫一條線。

token 消耗下降,才是複利所在

單價降 30% 已經可觀,但幾個客戶引述的數字指向另一件事:輸出 token 減少。Slackbot 團隊說在幾乎所有離線 eval 上表現更好,輸出 token 少約 14%;一家金融機構的私人測試套件裡,Sonnet 5 每個答案用約 497k token,Sonnet 5.5 只用約 121k;還有團隊回報工具呼叫次數少了三分之一、shell 執行次數約減半。

這些是 Anthropic 頁面上彙整的客戶說法,不是可獨立驗證的基準,但方向一致:省的不只是單價,是整個執行路徑的長度。高流量 agent 的帳單主要由 token 量驅動,執行步驟變短,成本是乘法效果。如果你之前在為 agent 的 token 開銷傷腦筋,這類「更少、更穩的步驟」比單純降價更值得追蹤。

分層的線要往哪裡移

很多團隊的架構是:Opus 級處理難題、Sonnet 級處理日常。Sonnet 5.5 的定位是「Opus 5.5 更快、更便宜互補」,而且幾個測試顯示它縮短了與旗艦的差距——在 118 個真實 app 建置中品質與 Opus 5 持平,平均 3.6 次迭代就達標,Opus 5 要 7.7 次。

這正好呼應我在把模型分層寫進架構裡討論的取捨:分層不是一次性的決定,而是隨模型發布週期持續重算的路由表。當中階模型在長程任務、程式碼審查、支援工單這些場景的完成率提高,原本「保險起見上旗艦」的路由就該有降級的路徑,並用你自己的 eval 驗證。

三個實際動作

第一,把現有的離線 eval 直接對 Sonnet 5.5 跑一輪——Slackbot 團隊特別提到不需要改任何 prompt。第二,用 claude-sonnet-5-5 在小流量環境量測實際 token 消耗,而不是只看公告的百分比。第三,如果你想控制思考預算,這代 API 開放了細粒度的 thinking effort 控制,適合把低風險任務的成本壓得更低。

一個保留:客戶引述都來自 Anthropic 的官方頁面,樣本與情境未公開。最穩的下一步是用自己 5% 的流量做 shadow 測試,讓你的 eval 而不是行銷數字,決定路由表怎麼改。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵