如果你的 agent 工作流是按 token 計費在跑,DeepSeek 這次正式版(GA)發布有兩件事值得你打開計算機:推理強度可以按任務調整,以及尖峰、離峰時段的價格差到 50%。
根據 DeepSeek API 文件上的公告,DeepSeek-V4-Pro 已透過 API 和 app/web 上的「Expert Mode」上線,模型名稱維持不變,也就是說既有程式碼換模型的改動成本很低。
推理強度變成一個可調參數
V4 系列現在支援低、高、max 三檔推理強度:簡單任務用 low,日常 agent 工作流用 high,複雜任務才開 max。對 builder 來說,這代表你不必再為了偶爾出現的難題,讓所有請求都付出完整推理的延遲和 token 成本。
實務上,這很像給呼叫端多了一個 routing 維度。分類、格式轉換這種任務鎖 low;多步驟的工具呼叫維持 high;只有在規劃、除錯這類真正需要長推理的場景才升到 max。這和我先前寫過的 KV cache 優化邏輯是同一件事的兩面:把錢花在真正需要模型「多想」的地方。之前那篇談的是 DeepSeek-V4.1-Flash 把 KV cache 縮到八分之一,改寫 agent 的成本算式(參考),這次則是從推理強度這端下手。
尖離峰定價:排程變成省錢手段
配合 V4 系列發布,DeepSeek 同步更新了 API 定價,並首次引入尖峰與離峰兩種費率,離峰比尖峰低 50%。新價格在 UTC 時間 2026 年 8 月 16 日 16:00 生效。
公告原文並未列出各模型具體的每 token 單價,實際數字要看 API 文件的定價頁。但 50% 的離峰折價幅度已經足以改變架構決策:批次處理、文件索引、eval 跑分這類不急的任務,完全可以排進離峰時段。如果你的產品有大量非同步 workload,值得在生效日前把排程邏輯寫好,這是最直接的成本槓桿。
Responses API 相容,降低遷移阻力
另一個對 builder 友善的點:V4-Pro 原生支援 OpenAI Responses API,公告特別提到針對 Codex 做了優化,並提供一鍵設定。對已經在 OpenAI 生態裡的工具鏈,這代表切換或試用 V4-Pro 的成本大幅下降——不需要重寫呼叫層,換 base URL 和模型名稱就能跑起來。
我的判斷
把這三件事放在一起看:可調推理強度控制的是「每次呼叫想多深」,尖離峰定價控制的是「什麼時候呼叫」,Responses API 相容控制的是「換過來要花多少工」。三者都在壓低把 V4-Pro 放進 production 的門檻。
限制也要說清楚:公告來自 DeepSeek 的 API 文件新聞頁,我還沒有實際跑過這顆模型的 benchmark 或延遲數據,推理強度各檔的實際品質差異需要自己用手上任務驗證。合理的下一步是拿一個生產環境裡的真實 workload,在 max 降級到 high 之間做一輪 eval,再決定哪些流量適合排進離峰。先量,再省,順序別反過來。
