Mistral 在 2026 年 10 月 6 日發表 Mistral Large 4(官方暱稱 le Chonk)的公開預覽,API 已可在 Mistral Studio 試用,權重預計月底釋出。對 builder 來說,這是一個值得認真看的訊號:開放權重模型第一次在多個企業關鍵領域達到與最強封閉模型接近的水準。
規格與定位
根據 Mistral 的公告,ML4 是 1 兆參數、490 億活躍參數的原生多模態模型,從零開始在 Mistral 位於歐洲的自有資料中心訓練,用了 3,800 張 NVIDIA Grace Blackwell GPU。訓練資料涵蓋超過 160 種語言,包括所有歐盟官方語言。
Mistral 自己的定位很明確:在資安、金融、法律等企業工作負載上,ML4 在開放模型中屬於最先進;在視覺定位(visual grounding)等部分領域,甚至超過了他們測試過的封閉前沿模型。
資安是這次最有趣的差異點
公告中最值得留意的論述來自資安領域。Mistral 指出,封閉模型的 provider 級拒答會阻擋合法的漏洞研究和事件回應——在事故處理中途失去模型能力,本身就是資安風險。他們舉了一個具體例子:在一項要求模型重現開源軟體漏洞再修補的測試中,ML4 拿到 82%,是所有模型中最高,而 Mistral 表示 Claude Opus 5.5 和 GPT-6 Astra 因為拒絕執行該任務,分數接近零。
其他資安數據:在 Artificial Analysis Cyber Index 排名全球前五,Cybench 解決率 93%,在 Lakera 的 B3 prompt injection 基準上抵抗 93.3% 的攻擊。同時,Mistral 稱 ML4 對惡意資安請求的拒答率是所有開源模型中最高的——也就是說,設計意圖是能做防禦研究,但不放寬對惡意請求的把關。
在權重釋出前,Mistral 正與資安領導者、審核過的合作夥伴和政府機構進行實地紅隊測試,這些單位可以使用降低審核限制、擴充網路能力的同一模型版本。這段過程的結果,會是評估這款模型實際風險的重要觀察點。
編碼與 agent 能力的實際水位
對日常開發工作,ML4 在 DeepSWE v1.1 拿 61.7%、Terminal-Bench 4 拿 28.3%,綜合 Coding Agent Index 為 49.8%,超過 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。Surge AI 的盲測人評中,它在五個模型裡排第二(3.74 分),輸給 Claude Opus 5(4.22)。
Agent 方面,在涵蓋 Gmail、Sheets、Slack、Salesforce 共 657 個工作流程的 AutomationBench 上得分 59.9%。財務與法律任務透過第三方 vals.ai 評估,公告稱兩者都超過 GPT-6-Astra。
對你的選型意味著什麼
幾個實際的決策考量:
- 如果你做資安工具,ML4 的開放權重加自部署組合,解決的是封閉模型拒答帶來的結構性問題。這類能力過去只能在 API 限制下妥協。
- 如果你在乎資料主權,Mistral 提供端到端在歐洲營運、獨立於其他數位服務商、受歐洲法律管轄的部署選項。
- 如果你只想挑最強的模型,編碼盲測仍由 Claude Opus 5 領先,ML4 是開放權重陣營裡的新旗手,不是全面取代封閉模型。
換模型之前記得先把測試案例鎖住——我們之前在改 prompt 或換模型之後的 agent 回歸測試那篇談過這套流程,這次同樣適用:等權重釋出,用你自己的 eval 跑一輪再決定。
目前仍缺的細節:模型架構、完整基準和後訓練方法論,Mistral 說會在權重釋出前陸續公布。預覽階段的數字都來自 Mistral 自家或其委託的評測,獨立驗證要等社群拿到權重之後。
