Mistral

Mistral 開源 Shieldstral:把審查政策變成一句提問的 3B 分類器

Mistral 於 8 月 4 日發表 Shieldstral:3B 開源權重多模態安全分類器,政策以自然語言在推論時下達,單張 16GB GPU 即可運行,以 Apache 2.0 釋出。

Mistral 開源 Shieldstral:把審查政策變成一句提問的 3B 分類器 — 文章封面

2026 年 8 月 4 日,Mistral 發表 Shieldstral——一個 30 億參數的開源權重多模態安全分類器,以 Apache 2.0 釋出。官方數字很直接:在文字安全、拒答偵測、政策適應性與多模態基準上,它能追平或超越體積大它 7 倍的開源護欄模型,並在多模態審查上寫下新水準;一張 16GB 的 NVIDIA GPU 就跑得動。

更值得注意的是它的設計前提:內容審查的標準,不應該寫死在模型權重裡。

老問題:政策固化在權重中

每個上線模型的產品都得回答「這段內容安不安全」,但答案取決於產品、受眾與當下情境——同一則內容放在資安研究工具裡沒問題,放到心理健康平台上就是傷害。多數護欄模型把一套固定的傷害分類寫進權重,換個部署場景就得重訓;而安全定義本來就因應用與領域而異,根本不存在一套「正確」的通用分類。

Shieldstral 換了一條路:政策由你用自然語言寫成問題,在推論時下達,模型回傳校準過的安全分數。不用重訓,文字與圖像共用同一個介面。

審查即問答:單次前向給出判定

技術上,Shieldstral 把內容審查框成二元問答,每個請求有三個部分:Instruct 區塊描述評估情境與嚴格度,可以附上「什麼算不安全」的定義;Query 區塊是一個是非題,例如「這段內容是否鼓吹對受保護群體的暴力」;Document 區塊是被評估的內容——提示詞、回應、成對的提示與回應,或附文字的圖像。

推論時,模型只讀出 yes 與 no 兩個 logits,經 softmax 標準化成連續的安全分數,一次前向就完成。這個簡單的設計同時解決好幾件事:提示詞分類、回應審查、拒答偵測與毒性偵測被統合成同一個問題;政策完全活在提示裡,同一個權重就能在部署當下適應全新的政策;分數是連續的,你可以按信心值設定門檻或排序,而不是只拿到一個離散標籤。

3B 打贏 7 倍大的對手:資料工程取勝

Mistral 的核心主張是:只要資料對,小模型可以贏過大很多的模型。公開安全資料集的分類法、標籤與標註慣例彼此矛盾,團隊把每個資料集轉成相同的「指令—問題—文件」格式,並刻意變換措辭與分隔符,讓模型學會泛化而不是背題;再依來源校準嚴格度——對對抗性越獄樣本嚴格、對回應品質資料寬鬆——讓決策邊界保持一致。所有評估樣本都與訓練資料隔離。

訓練策略的重點是教分辨、不教背誦:如果只用固定的政策標籤訓練,模型只會分類那幾條預設政策,無法推理新政策的邊界。團隊於是構造一批刻意相似、容易混淆的政策,請 LLM 把安全文字改寫成對照組——每次改寫只違反其中一條政策、不觸碰姊妹條款。這逼模型學會「違反的是哪一條」,而這種能力能遷移到沒見過的新政策。

對開發者與產品團隊的意義

三件事。第一,護欄的成本門檻大幅下降:3B 權重在單張 16GB GPU 上運行,自查核、低延遲的審查層不必再排隊等 API 配額,邊緣與私有環境也部署得起。第二,審查政策從「改程式碼、重訓模型」變成「改一行提示」——面對法規與產品場景變動,回應速度本身就成為合規能力。第三,這是 Mistral 以 Open Secure AI Alliance 創始成員身分、與 NVIDIA 等組織一同推出的開源權重模型,Apache 2.0 代表商用、微調、再發布都自由;安全基礎設施的供應商鎖定,多了一個出口。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵