2026 年 2 月 12 日,MiniMax 發布 M2.5 與 M2.5-Lightning,並同步在 Hugging Face 開源權重。官方定位一句話:能力逼近前沿、價格砍到只剩零頭——SWE-Bench Verified 拿下 80.2%,平均解題時間 22.8 分鐘,與 Claude Opus 4.6 的 22.9 分鐘持平,成本卻僅其十分之一。
時點踩在中國模型的密集發布期:智譜前一天才開源 GLM-5(見先前的報導),VentureBeat 以「成本僅 Claude Opus 4.6 的二十分之一」為題報導 M2.5。低價加開源已是市場預設值。
兩個版本:能力相同、速度加倍
M2.5 與 M2.5-Lightning 能力完全相同,差別只有速度與價格。M2.5 以每秒 50 token 運行,輸入每百萬 token 0.15 美元、輸出 1.20 美元;Lightning 每秒 100 token——官方稱是多數前沿模型的兩倍——輸入 0.30 美元、輸出 2.40 美元,兩者皆支援快取。官方換算的數字:Lightning 連續跑一小時 1 美元,M2.5 只要 0.30 美元;四個全年無休實例一年共 10,000 美元。
SWE-Bench 80.2%:跨 harness 的編碼表現
除了 80.2% 的 SWE-Bench Verified,更有說服力的是跨 harness 表現:Droid 上 79.7 勝過 Opus 4.6 的 78.9,OpenCode 上 76.1 對 75.9。單一 benchmark 可被針對性最佳化,跨環境穩定性才是 agent 工程師在意的。其他數字:Multi-SWE-Bench 51.3%、BrowseComp 76.3%(含 context management),搜尋與工具呼叫回合數比 M2.1 減少約 20%。辦公場景的 GDPval-MM 評測平均勝率 59.0%,對應 MiniMax Agent 內建的 Office Skills。
Forge、CISPO 與大規模 agentic RL
訓練配方是這波中國模型的共同路線:大規模 agentic 強化學習,環境超過 20 萬個真實編碼任務,涵蓋 10 種以上語言與 Web、Android、iOS、Windows 全端。兩個自研元件:Forge 框架把 agent 與訓練推論引擎解耦,以樹狀樣本合併與非同步排程做到約 40 倍訓練加速;CISPO 演算法用來穩定大規模 MoE 訓練。獎勵設計混合過程獎勵與任務完成時間最佳化,迫使模型在聰明與快之間取平衡——這就是 22.8 分鐘平均解題時間的由來。
開源權重與自架部署
權重以 Modified-MIT 授權上架 Hugging Face,229B 參數、多數以 FP8 量化儲存,下載體積約 230GB。部署走 SGLang、vLLM、Transformers 與 KTransformers。對照內部數據——M2.5 已自主處理公司 30% 的任務、佔新進程式碼 80%——自建「公司編碼主力」的門檻,第一次降到一張多卡伺服器加一份開源權重。
對開發者的實際意義
三點觀察。第一,coding agent 的邊際成本正在塌陷:輸出單價僅 Opus 等級的十分之一到二十分之一,長時間運行的 agent 從成本問題變成背景值。第二,開源權重改變採購談判:能自架 229B 的團隊,對 API 報價從此有了錨點。第三,速度本身成為規格:Lightning 的每秒 100 token 讓互動式 agent 的體感接近本機工具,對 IDE 與 terminal agent 是新的約束,也是差異化空間。
參考來源
- MiniMax M2.5: Built for Real-World Productivity — MiniMax
- MiniMax-M2.5 model card — Hugging Face
- MiniMax’s new open M2.5 and M2.5-Lightning near state-of-the-art — VentureBeat
本文由 AI 協助自上述來源整理,經人工審核後發布。
