Mistral

Mistral 開源 Leanstral:專為 Lean 4 證明工程打造的 120B 稀疏模型

Mistral 以 Apache 2.0 釋出 Leanstral-120B-A6B,第一個專為 Lean 4 設計的開源程式代理。單次推理 18 美元,pass@2 便以約 15 分之一的成本超越 Claude Sonnet。本文解析其架構、FLTEval 成績與三種部署方式。

Mistral 開源 Leanstral:專為 Lean 4 證明工程打造的 120B 稀疏模型 — 文章封面
本頁內容6 個段落
  1. 開源陣營的第一個 Lean 4 專用代理
  2. 為什麼是 Lean 4
  3. 120B 參數、6B 啟用的成本結構
  4. FLTEval 成績解讀
  5. 取得與部署方式
  6. 參考來源

Mistral 釋出了 Leanstral,第一個專為 Lean 4 打造的開源程式代理。模型命名為 Leanstral-120B-A6B:總參數 120B、啟用參數約 6B 的稀疏架構,權重以 Apache 2.0 授權完整開放,Hugging Face 上的模型卡(mistralai/Leanstral-2603)標示為 119B-A6B。它的定位不是玩具示範,而是真實的證明工程——在完整儲存庫裡補完證明、定義概念,而不是解孤立練習題。對做形式驗證的團隊來說,這是第一個可以自己裝在自己機器上跑的同級工具。

開源陣營的第一個 Lean 4 專用代理

一般程式代理處理的是「看起來對」的程式碼;Lean 4 的世界裡只有「被機器驗證過」與「不成立」兩種狀態。Mistral 的切入點是把代理直接對準這個高門檻領域:模型針對 lean-lsp-mcp 訓練,並支援任意 MCP 伺服器,讓代理能實際讀寫 Lean 專案狀態。Hacker News 上的討論反應典型:社群普遍肯定方向,但對與 Qwen 系列的實力對比保留判斷,等獨立評測出爐。

為什麼是 Lean 4

Lean 4 是證明助理,能表達 perfectoid space 這類前沿數學物件,也能寫出軟體規格——例如 Rust 程式碼的已驗證性質。它的價值在於把「人類審查機器產生的程式碼」這個瓶頸,換成「機器自己證明」:一旦證明通過,正確性就是數學事實。隨著 AI 生成程式碼的量爆炸,形式驗證從數學系的奢侈品,正在變成高風險軟體的必需品——這正是 Leanstral 押注的趨勢。

120B 參數、6B 啟用的成本結構

稀疏架構在這裡不只是省錢口號,而是產品邏輯。證明搜尋本質上是大量平行嘗試,單次推理成本夠低,多次取樣(pass@k)才玩得下去:一次 18 美元,十六次也只要 290 美元。對照 Claude Opus 單趟 1,650 美元——是 Leanstral 單次成本的 92 倍。Mistral 的算盤很清楚:用便宜、可平行疊代的專用模型,換取在垂直領域與通用旗艦模型打陣地戰的本錢。

FLTEval 成績解讀

在 FLTEval(以 FLT 專案的實際 PR 為題庫)上:Claude Haiku 花 184 美元得 23.0 分,Sonnet 花 549 美元得 23.7 分,Opus 花 1,650 美元得 39.6 分。Leanstral 單次 18 美元得 21.9,pass@2(36 美元)拿 26.3,已以約 15 分之一的成本超過 Sonnet;pass@16(290 美元)到 31.9,比 Sonnet 高 8 分。開源同行裡,Qwen3.5-397B-A17B 需要 4 次取樣才到 25.4,Kimi-K2.5-1T-A32B 約 20.1,GLM5-744B-A40B 約 16.6——專用化在這個基準上確實兌現了。Opus 的 39.6 仍是天花板,但每分成本完全是另一個量級。

取得與部署方式

三條路。第一,Mistral Vibe 零設定:執行 /leanstall 指令、Shift+Tab 選擇 Leanstral,或用 vibe –agent lean 啟動。第二,API:端點 labs-leanstral-2603,限時免費或近乎免費。第三,自架:下載 Apache 2.0 權重,跑在自己的硬體上。對受監管環境或不想把程式碼送出門的團隊,第三條路才是重點——這也是開源權重在 2026 年依然稀缺的價值所在。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵