2026 年 2 月 13 日,Cloudflare 在社群公告中宣布:智譜的 GLM-4.7-Flash 正式上線 Workers AI。同一波公告還包含 agents-on-Cloudflare 的 agent 工具,以及 Workers AI Provider v3.1.1 的更新。
時間點緊接著智譜自己的大日子——GLM-5 才在 2 月 11 日開源發布。兩天後,Zhipu 的模型就出現在 Cloudflare 的 serverless 平台上。
模型供應商遇上部署平台
這類組合的意義在分工。Zhipu 生產模型,Cloudflare 提供觸達:Workers AI 把 inference 放進 serverless 環境,開發者不需要自建 GPU 叢集、不需要談企業合約,就能直接呼叫 GLM-4.7-Flash。
對 Zhipu,這是一條低摩擦的海外通路;對 Cloudflare,模型目錄越豐富,平台就越像 AI 應用的預設 runtime。Flash 級模型放在這種環境裡也合理——成本敏感、需要低延遲的工作負載,正是邊緣部署的甜蜜點。
agent 工具鏈一起出貨
這次公告不只是目錄加一款模型。agents-on-Cloudflare 工具與 Workers AI Provider v3.1.1 同場出現,指向同一個方向:Cloudflare 想承包的不只是 inference,還有 agent 的執行環境——模型、工具、runtime 打包成同一個開發面。
對照二月的主流發布——Opus 4.6 的 agent teams、GLM-5 的 long-horizon 任務——可以看到 agent 能力正同時往兩端長:模型端更強,平台端更好裝。兩者相加,才是開發者實際拿到的 agent stack。
實務上的取捨
把模型放到第三方邊緣平台執行,便利與控制是一組交換:
- 版本與供應時程取決於平台方,release notes 要兩邊一起追
- 邊緣部署換來低延遲與免維運,但模型選擇受限於平台目錄
- 對高用量的成本敏感場景,Flash 級模型搭配 serverless 計費,通常是值得先試的組合
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
