AGENTIC COMMONSAI 產業簡報

繁中EN

主題AI 代理與工作流出版 2026-10-11

返回文章列表AI API

把思考塞進工具呼叫裡:DeepSeek-V3.2 對 agent 開發流程的實際改動

如果你手上已經有接 DeepSeek API 的 agent 專案,這次 DeepSeek-V3.2 的升級成本幾乎是零:官方文件明確說 V3.2 的使用方式和 V3.2-Exp 相同,App、Web 和 API 都已上線。真正值得花時間看的,是兩件事——思考被整合進工具呼叫,以及那個只活到 12 月 15 日的 Speciale 端點。

V3.2 正式版:例行升級加一個新能力

V3.2 是 V3.2-Exp 的正式後繼版本。DeepSeek 在公告中把它的定位描述為推理與長度之間取得平衡的「日常主力」,並聲稱效能達到 GPT-5 等級——這類比較留給你自己的 eval 去驗證就好。

對 builder 更有操作意義的是新引入的 thinking in tool-use:V3.2 是 DeepSeek 首個把思考直接整合進工具呼叫的模型,而且思考與非思考兩種模式都支援工具使用。背後靠的是一套大規模的 agent 訓練資料合成方法,涵蓋超過 1,800 個環境和 85,000 條以上的複雜指令。實務上,這代表你在 agent 迴圈裡不用再糾結「要開思考模式就犧牲工具呼叫」的取捨——兩者可以同時開。細節可以直接看官方的 thinking mode 指南。

Speciale:推理拉滿,但有期限和限制

DeepSeek-V3.2-Speciale 是另一條產品線。官方把它定位成「推理能力推到極限」的版本,聲稱可與 Gemini-3.0-Pro 匹敵,並在 IMO、CMO、ICPC World Finals 和 IOI 2025 達到金牌等級的成績。

但幾個限制要先看清楚:

  • 目前僅供 API 使用,且不支援 tool-use,定位是社群評測與研究
  • 走臨時端點,base_url 為 https://api.deepseek.com/v3.2_speciale_expires_on_20251215
  • 定價與 V3.2 相同,但 token 消耗更高(公告明言複雜任務表現強,代價是更高的 token 用量)
  • 可用至 2025 年 12 月 15 日 15:59(UTC)

換句話說,Speciale 不是拿來跑 production agent 的。它的角色更像一個限時的測量工具:如果你的產品有真正困難的推理環節,值得趁這兩週把難題丟進去跑一輪,看看 token 成本換來的推理提升是否值得,再決定要不要調整模型路由策略。

開源與技術報告

兩個模型都已放上 Hugging Face:DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale,技術報告也一併公開。對需要自建或微調的團隊來說,權重可得通常比 benchmark 數字更重要。

放進更大的脈絡來看

這篇公告是在供應的 RSS 摘要中找到的,摘要並未說明正式發布日期之外的其他時間細節,例如 Speciale 之後會否有正式端點或支援工具呼叫——這些目前都是未知數,別急著把它寫進長期架構規劃。

不過方向本身值得注意。從 KV cache 的成本壓縮(我之前寫過 DeepSeek-V4.1-Flash 怎麼改寫 agent 的成本算式),到這次把思考整合進工具呼叫,DeepSeek 明顯在沿著「讓 agent 跑得更便宜、推理更順」這條線走。對 builder 的實際建議很簡單:現有 V3.2-Exp 的程式碼可以直接平滑升級到 V3.2,然後趁 12 月 15 日前用 Speciale 跑一次難題對照——一週內就能決定你的推理環節該不該換彈藥。

參考來源

AGENTIC COMMONS由 PHLEGON LABS 經營
分享X電郵
支持我們

相關閱讀

  1. 1M context 變成預設值:DeepSeek-V4 Preview 上線,開發者要改的其實只有一行

    DeepSeek-V4 Preview 開源上線,Pro 與 Flash 兩檔模型把 1M context 變成預設,deepseek-chat 七月退役前 API 只需改 model 名稱。

    LLM

  2. 推理強度自己調、離峰半價:DeepSeek-V4-Pro 正式版對成本控制的實際影響

    DeepSeek-V4-Pro 正式發布,加入可調推理強度、OpenAI Responses API 相容,並在 8 月 16 日引入尖離峰差異定價。

    AI API

  3. 把 agent 的每個分支變成一個 decision 呼叫:Decisions API 和 Jev 的兩種做法

    OpenAI 用受限的 GPT-6 Luna 做決策,TypeSafe 的 Jev 則是專用 decision model,兩種架構差異直接影響延遲、成本和輸出保證。

    AI API