AGENTIC COMMONSAI 產業簡報

繁中EN

主題開源模型與開放權重出版 2026-10-11

返回文章列表LLM

1M context 變成預設值:DeepSeek-V4 Preview 上線,開發者要改的其實只有一行

如果你今天打開 DeepSeek 的 API 文件,會看到一則不太像一般模型更新的公告:DeepSeek-V4 Preview 已經上線並開源,而且 1M context 不再是加購選項,而是所有官方服務的預設值。根據 DeepSeek 官方 API Docs 的公告,這次更新的重點不是又一個 benchmark 分數,而是把長 context 的成本結構重新壓了一遍。

兩檔模型,一個遷移路徑

這次推出了兩個型號。DeepSeek-V4-Pro 是 1.6T 總參數、49B 活躍參數的旗艦,官方宣稱在 Agentic Coding benchmark 上是開源 SOTA,數學、STEM 與 coding 推理則超越所有現有開源模型。DeepSeek-V4-Flash 則是 284B 總參數、13B 活躍參數,官方定位是快速且經濟的選擇,在簡單 agent 任務上表現與 Pro 相當。

對已經在用 DeepSeek API 的團隊,遷移成本出乎意料地低:base_url 不用動,只要把 model 名稱改成 deepseek-v4-pro 或 deepseek-4-flash(官方文件寫的是 deepseek-v4-flash)。兩個型號都支援 OpenAI ChatCompletions 和 Anthropic 兩種 API 格式,也都有 Thinking / Non-Thinking 雙模式。

不過有一個硬期限要注意:公告明確指出 deepseek-chat 和 deepseek-reasoner 會在 2026 年 7 月 24 日 15:59(UTC)之後完全退役,目前這兩個名稱分別路由到 V4-Flash 的 non-thinking 和 thinking 模式。如果你的程式碼還寫著舊名稱,等於是把 model selection 交給別人決定。

1M context 為什麼值得認真看

官方把這次的重點放在「結構創新與超高 context 效率」:新的 attention 設計結合了 token-wise 壓縮和 DSA(DeepSeek Sparse Attention),宣稱在大幅降低計算與記憶體成本的同時,做到世界領先的長 context 表現。1M context 已經是所有官方 DeepSeek 服務的預設。

對 builder 的實際意義是:過去要靠 chunking、摘要、多輪檢索拼湊的場景,現在可能可以直接塞進一個請求。但這也代表成本估算要重做——context 變長不等於免費,只是單位成本壓低了。之前談 DeepSeek-V4-Pro 正式版的計價與推理強度控制 時提過,DeepSeek 的定價策略一直對成本敏感的團隊很友善,這次的 Flash 型號延續同一個方向。

Agent 場景是主要賣點

公告裡另一個值得注意的訊號:DeepSeek-V4 已經整合 Claude Code、OpenClaw 和 OpenCode 等主流 agent 工具,而且官方表示 DeepSeek 內部的 agentic coding 已經在用這套模型。如果開源宣稱屬實,這對想在自己架的 agent pipeline 裡用開源權重(Hugging Face 上有開放 weights 和技術報告)的團隊來說,是一條可行的路。

幾個務實的提醒

這是 Preview 版本,官方同時提醒近期有不少非官方訊息流傳,DeepSeek 的消息應以官方帳號為準。benchmark 宣稱(例如「僅次於 Gemini-3.1-Pro」)目前只能對照官方技術報告自行驗證。

實際的下一步很簡單:把 production 裡所有寫死 deepseek-chat 和 deepseek-reasoner 的地方找出來,在七月退役期限前換成明確的 model 名稱,然後用你自己的任務跑一輪成本與品質對比——特別是那些原本被 context 長度逼著做工程 workaround 的場景,現在值得重新算一次帳。

參考來源

AGENTIC COMMONS由 PHLEGON LABS 經營
分享X電郵
支持我們

相關閱讀

  1. 推理強度自己調、離峰半價:DeepSeek-V4-Pro 正式版對成本控制的實際影響

    DeepSeek-V4-Pro 正式發布,加入可調推理強度、OpenAI Responses API 相容,並在 8 月 16 日引入尖離峰差異定價。

    AI API

  2. 一百 K tokens 是新的分水嶺:Haiku 5.5 把小模型的計價和調控都交給 builder

    Claude Haiku 5.5 用 prompt 長度分級計價、首度加入 effort controls,讓大量呼叫的分類、摘要和 subagent 任務有更細的成本調節旋鈕。

    Claude

  3. KV cache 縮到八分之一:DeepSeek-V4.1-Flash 怎麼改寫 agent 的成本算式

    DeepSeek-V4.1-Flash 以不對稱 MoE 架構將 KV cache 壓到前代四分之一,並直接淘汰旗艦 V4-Pro,改寫 agent 服務的成本與選型邏輯。

    AI API