AGENTIC COMMONSAI 產業簡報

繁中EN

標籤AI API出版 2026-10-10

返回文章列表AI API

KV cache 縮到八分之一:DeepSeek-V4.1-Flash 怎麼改寫 agent 的成本算式

本頁內容6 個段落
  1. 先看最實際的那一刀:淘汰 V4-Pro
  2. 不對稱架構:輸入 8B、輸出 16B
  3. KV cache 為什麼是 agent 成本的關鍵
  4. 定價、遷移與部署選項
  5. 一個務實的下一步
  6. 參考來源

先看最實際的那一刀:淘汰 V4-Pro

DeepSeek 在 2026 年 9 月 10 日發布 DeepSeek-V4.1-Flash,這款新模型不只上線,還直接取代自家旗艦。根據公告,多方測試把 V4.1-Flash 排在 V4-Pro 之前,涵蓋效能、成本、速度與總執行時間,因此 DeepSeek 正在淘汰 V4-Pro。從 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 的請求都會自動路由到 V4.1-Flash,並按 V4.1-Flash 的費率計費,直到 V4.1-Pro 推出為止。

對正在跑 production 的團隊來說,這不是一則普通的發布消息。如果你的呼叫已經寫死 deepseek-v4-pro,四天之後你實際用的模型和帳單就變了,值得先確認輸出品質是否仍在驗收範圍內。

不對稱架構:輸入 8B、輸出 16B

V4.1-Flash 是 DeepSeek 新架構家族中最小的模型,總參數 552B 的 MoE,但採用新的 Causal Encoder–Decoder 設計:輸入只啟用 8B 參數,輸出啟用 16B。DeepSeek 表示,新的預訓練方法加上更大規模的 RL 後訓練,讓它在 benchmark 上超越包括 V4-Pro 在內的旗艦模型。

這個設計對 builder 的意義在於輸入和輸出的成本結構被拆開了。長 context、短輸出的應用(例如 RAG 查詢、文件摘要的前置處理)吃的是便宜的 encoder 端;長輸出的任務才用到較重的 decoder。如果你的 workload 輸入輸出比例極端,這類架構值得放進選型清單。

KV cache 為什麼是 agent 成本的關鍵

公告裡最值得留意的一組數字:和前代相比,V4.1-Flash 的 KV cache 只需要 1/4 的 HBM 和 1/8 的 SSD 儲存。DeepSeek 自己點明了原因——cache-hit 的費用往往佔 agent 成本的一大塊,壓縮 cache 就能顯著壓低這部分開支。

這和過去我們談過的小模型成本邏輯是同一條線:真正的省錎不只在單價,而在架構層面減少每個 token 的基礎開銷。之前分析 Claude Haiku 5.5 對 subagent 成本算式的影響時(見這篇),結論是小模型降價改變了「哪些環節該交給便宜模型」;這次 DeepSeek 則是從 KV cache 需求下手,讓多輪 agent 對話的固定成本往下走。兩條路徑疊起來,agent 服務的損益平衡點正在明顯移動。

定價、遷移與部署選項

幾件操作面上的事:

  • 模型名稱設為 deepseek-flash 即可使用,原生支援多模態。舊的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 為了相容性會暫時路由到 V4.1-Flash。
  • 新定價自 2026 年 9 月 10 日 04:00 UTC 生效,尖峰/離峰費率機制延續,離峰費率為尖峰的一半——可排程的批次工作值得移到離峰時段。
  • WorkBuddy(含 CodeBuddy)和 OpenCode 是官方合作夥伴,已完整支援 V4.1-Flash。
  • 模型權重和技術報告已放上 Hugging Face,DeepSeek 表示會與開源社群合作做 inference 支援,也在探詢 2,000 GPU 規模以上的大型部署合作。

一個務實的下一步

如果你的 pipeline 已經依賴 V4-Pro,先在 9 月 14 日前用 deepseek-flash 跑一輪離線評測,確認自動路由後的輸出品質與帳單變化。如果只是選型階段,V4.1-Flash 把「小模型價格、旗艦級表現」的競爭又往前推了一步——技術報告就在 Hugging Face 上,值得親自讀過再下判斷,而不是只看 benchmark 數字。

參考來源

AGENTIC COMMONS由 PHLEGON LABS 經營
分享X電郵
支持我們

相關閱讀

  1. 小模型的價格往下壓了四分之三:Claude Haiku 5.5 改變了 subagent 的成本算式

    Anthropic 推出 Claude Haiku 5.5,價格平均比 Haiku 4.5 低約 75%,並首次為 Haiku 級模型加入可調 effort 設定。

    Anthropic

  2. OpenRouter 完成 1.13 億美元 B 輪:模型路由層估值翻倍至 13 億美元

    2026 年 5 月,OpenRouter 宣布 1.13 億美元 B 輪融資,由 CapitalG 領投,估值翻倍至約 13 億美元。每月處理 100 兆 token、支援 400+ 模型,本文解析模型路由層為何成為 Agent 時代的關鍵基礎設施。

    OpenRouter

  3. DeepSeek 把 V4 Pro 七五折降價常態化:前沿模型價格戰的底牌

    2026 年 5 月 22 日,DeepSeek 宣布旗艦 V4 Pro 的 75% 折扣轉為常態價:輸出每百萬 token 0.87 美元,僅為原價四分之一,Flash 更只要 0.28 美元。本文解析降價常態化的成本邏輯與對 API 市場的連鎖影響。

    LLM