問題:不是模型太貴,是任務配錯了模型
多數公司導入 AI 的軌跡很相似:先瘋狂試工具、隨手發 API key,然後收斂到幾組固定用法。到了正式管理階段,你會想控管每個人的 token 支出——但預算和規則只能擋住超標,擋不了浪費。真正省錢的方式,是讓使用者在不知不覺間就用對了模型。
Cloudflare 在 2026 年 9 月 30 日推出 Auto Router 公開測試版,透過 AI Gateway 提供。做法是把模型設成 cloudflare/auto,路由器會自動把每個請求導向「夠用」的模型。根據 Cloudflare 自己在內部 OpenCode 環境的數據,相比只用 OpenAI Sol 或 Claude Opus 這類前沿模型,成本最多可省 30%。
帳單怎麼變化:benchmark 數字怎麼讀
Cloudflare 用內部的通用知識工作基準(涵蓋 email、日曆、Slack、檔案、差旅、財務等模擬工作流,97 個任務、每任務三次取樣)比較三個選項:
- cloudflare/auto:成功率 86.6%,總成本 $2.10,每次成功 $0.0084
- Claude Opus 5.5:成功率 96.6%,總成本 $5.91,每次成功 $0.0210
- GPT-6 Sol:成功率 84.2%,總成本 $2.64,每次成功 $0.0108
換句話說,Auto Router 的整體表現接近 Sol,但成本只有 Sol 的 80%、Opus 的 35%。要誠實看待的是:Opus 的成功率仍高一截,如果你的任務真的需要最強模型,省下來的錢可能換來失敗重做。
有個反直覺的觀察值得記住:單價便宜的模型不一定帶來更便宜的結果——它可能用多得多的 token 才解完同一題。所以路由器要最小化的是「預測的整條軌跡成本」,而不是按每百萬 token 單價做負載平衡。
運作方式:分類、評分、再算快取帳
請求進到 cloudflare/auto 後,AI Gateway 先篩出能服務這個請求的模型池:排除格式不支援的、憑證或花費上限不允許的,也會在供應商故障時自動剔除、恢復後自動加回。
剩下的候選模型,由跑在 Workers AI 邊緣 GPU 上的多頭分類模型處理。它輸出兩組訊號:14 個任務類別的機率(寫程式、規劃、研究、資料分析等),以及四個維度的 1–5 分:複雜度、模糊度、風險高低、對前文的依賴。一個評分矩陣把這些訊號和模型 benchmark 結果結合,最後和各模型的輸入輸出價格算出效用最高的選擇——簡單任務價格權重大,難的任務讓強模型有更多勝出空間。
最講究的部分是長對話的快取成本。偵錯或寫程式這種長 session,花費往往不在模型單價,而在 cache read 隨對話長度累積。換模型等於丟掉快取、整個 context 重寫。Auto Router 的處理是:同一個 turn 內不換;跨 turn 時對切換施加隨 context 大小成長的懲罰,持有快取的模型按便宜的 cache read 計價,其他候選按完整重寫成本計價。
為什麼這對產品團隊是架構上的變化
以前「省錢」的手段是事後的:設預算、看報表、限制某些人用某些模型。Auto Router 把決策移到請求路徑上——因為所有流量本來就經過 gateway,gateway 有位置替每個請求做判斷。這和我先前在 Ringg 用模型路由省下九成客服成本 那篇觀察到的趨勢一致:路由正在從手動選單變成基礎設施的預設行為。
兩階段架構還有一個實務好處:路由決策可檢視——你能看到每個任務被判成什麼類別、什麼難度,以及它如何導致模型選擇。新模型上線不需要重訓分類器,只需在評分矩陣加權重。Cloudflare 也預告會推出 cloudflare/auto-best 等其他路由設定,同樣的分類器但只看品質、不計成本。
導入前的務實提醒
Auto Router 測試期間免費,適合已經在用 AI Gateway 的團隊直接試。但幾點先想清楚:這些數字來自 Cloudflare 自己的內部基準,不是獨立驗證;成功率比 Opus 低約 10 個百分點,高風險任務是否交給自動路由,值得用你自己的任務測過再決定。Cloudflare 列出的後續規劃包括支援 Responses API 與 WebSockets、納入零資料保留需求、以及為每個請求選擇合適的推理等級——如果你依賴這些功能,先確認覆蓋範圍。實際的下一步:挑一週的非關鍵工作流接到 cloudflare/auto,比對真實帳單與成功率,再決定要不要擴大。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
