先看最實際的那一刀:淘汰 V4-Pro
DeepSeek 在 2026 年 9 月 10 日發布 DeepSeek-V4.1-Flash,這款新模型不只上線,還直接取代自家旗艦。根據公告,多方測試把 V4.1-Flash 排在 V4-Pro 之前,涵蓋效能、成本、速度與總執行時間,因此 DeepSeek 正在淘汰 V4-Pro。從 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 的請求都會自動路由到 V4.1-Flash,並按 V4.1-Flash 的費率計費,直到 V4.1-Pro 推出為止。
對正在跑 production 的團隊來說,這不是一則普通的發布消息。如果你的呼叫已經寫死 deepseek-v4-pro,四天之後你實際用的模型和帳單就變了,值得先確認輸出品質是否仍在驗收範圍內。
不對稱架構:輸入 8B、輸出 16B
V4.1-Flash 是 DeepSeek 新架構家族中最小的模型,總參數 552B 的 MoE,但採用新的 Causal Encoder–Decoder 設計:輸入只啟用 8B 參數,輸出啟用 16B。DeepSeek 表示,新的預訓練方法加上更大規模的 RL 後訓練,讓它在 benchmark 上超越包括 V4-Pro 在內的旗艦模型。
這個設計對 builder 的意義在於輸入和輸出的成本結構被拆開了。長 context、短輸出的應用(例如 RAG 查詢、文件摘要的前置處理)吃的是便宜的 encoder 端;長輸出的任務才用到較重的 decoder。如果你的 workload 輸入輸出比例極端,這類架構值得放進選型清單。
KV cache 為什麼是 agent 成本的關鍵
公告裡最值得留意的一組數字:和前代相比,V4.1-Flash 的 KV cache 只需要 1/4 的 HBM 和 1/8 的 SSD 儲存。DeepSeek 自己點明了原因——cache-hit 的費用往往佔 agent 成本的一大塊,壓縮 cache 就能顯著壓低這部分開支。
這和過去我們談過的小模型成本邏輯是同一條線:真正的省錎不只在單價,而在架構層面減少每個 token 的基礎開銷。之前分析 Claude Haiku 5.5 對 subagent 成本算式的影響時(見這篇),結論是小模型降價改變了「哪些環節該交給便宜模型」;這次 DeepSeek 則是從 KV cache 需求下手,讓多輪 agent 對話的固定成本往下走。兩條路徑疊起來,agent 服務的損益平衡點正在明顯移動。
定價、遷移與部署選項
幾件操作面上的事:
- 模型名稱設為
deepseek-flash即可使用,原生支援多模態。舊的deepseek-v4-flash和deepseek-v4-flash-vision-exp為了相容性會暫時路由到 V4.1-Flash。 - 新定價自 2026 年 9 月 10 日 04:00 UTC 生效,尖峰/離峰費率機制延續,離峰費率為尖峰的一半——可排程的批次工作值得移到離峰時段。
- WorkBuddy(含 CodeBuddy)和 OpenCode 是官方合作夥伴,已完整支援 V4.1-Flash。
- 模型權重和技術報告已放上 Hugging Face,DeepSeek 表示會與開源社群合作做 inference 支援,也在探詢 2,000 GPU 規模以上的大型部署合作。
一個務實的下一步
如果你的 pipeline 已經依賴 V4-Pro,先在 9 月 14 日前用 deepseek-flash 跑一輪離線評測,確認自動路由後的輸出品質與帳單變化。如果只是選型階段,V4.1-Flash 把「小模型價格、旗艦級表現」的競爭又往前推了一步——技術報告就在 Hugging Face 上,值得親自讀過再下判斷,而不是只看 benchmark 數字。
