AI Safety

當核安遇上分類器:Anthropic 與 NNSA 的合作,對開發者意味著什麼

Anthropic 與美國 NNSA 共同開發核相關內容分類器,初步測試準確率 96%,並已部署於 Claude 流量。

當核安遇上分類器:Anthropic 與 NNSA 的合作,對開發者意味著什麼 — 文章封面

核技術的雙用途性質,讓它成為 AI 安全評估裡最難處理的一類題目。同樣的物理原理可以驅動反應爐,也可以被拿去發展武器;當模型能力持續上升,開發者很難單靠自己判斷「這個回答到底算不算危險」。Anthropic 在 2025 年 8 月 21 日發布的公告,講的正是他們怎麼處理這個判斷問題。

從「評估風險」走到「建監測工具」

根據 Anthropic 的公告,他們在 2025 年 4 月與美國能源部(DOE)轄下的國家核安全管理局(NNSA)合作,評估自家模型的核擴散風險。這次更進一步:Anthropic 與 NNSA 及 DOE 國家實驗室共同開發了一個分類器(classifier),用來區分「有疑慮」與「無害」的核相關對話,初步測試準確率為 96%。

公告指出,這個分類器已經部署在 Claude 流量上,作為其模型濫用識別系統的一部分;早期部署資料顯示它在真實對話中運作良好。Anthropic 也計劃把做法分享給 Frontier Model Forum,希望這套公私協作模式能成為其他 AI 開發者可以沿用的藍圖。

為什麼這件事需要政府坐在同一張桌子

公告裡有一句關鍵判斷:核武相關資訊特別敏感,私人企業單獨行動很難做好這類評估。這不是客套話,而是資料與判準的問題——什麼算「有疑慮」,需要領域專家與官方機構的判準,不是產品團隊自己開會就能定出來。

對開發者來說,這裡的訊號是:當你的產品碰到高風險領域,外部機構不只是審批者,也可能是標註與判準的來源。這條路徑和 Anthropic 與蓋茲基金會的合作 有相似的結構——把市場不願觸及的領域,用合作關係補上能力與正當性。

96% 這個數字,該怎麼讀

公告說的是「初步測試」的 96% 準確率,並補充早期部署資料顯示運作良好。但公告沒有說明測試集怎麼組成、誤判的代價如何分布、以及 4% 的錯誤偏向哪一側。

這對產品開發者是重要的區分。安全分類器的錯誤不是對稱的:漏放一個真正危險的對話,和誤擋一個核子物理學家的正常提問,代價完全不同。公告沒有提供這層細節,而這正是任何要抄這套做法的人,第一個要自己補上的規格。

可以帶回自己產品的三個問題

第一,你的高風險類別有沒有外部判準來源?如果沒有,你的分類器其實是在猜。

第二,分類器上線後,你怎麼量測它在真實流量的表現?Anthropic 的做法是直接部署在 Claude 流量上,用早期資料驗證,而不是只停在離線測試。

第三,你的誤判成本怎麼分攤?把「漏放」與「誤擋」分開設定門檻,通常比追求單一準確率數字更實用。

這套合作的價值不在於 96% 這個數字本身,而在於它示範了一種分工:政府與國家實驗室提供判準與領域知識,AI 公司提供模型與部署管道。對多數團隊來說,核安場景可能永遠碰不到,但「高風險類別需要外部判準」這個原則,換到金融、醫療或資安場景一樣成立。

公告沒有交代分類器的誤判分布與測試集細節,這是後續要觀察的地方;在那之前,把它當成一個可參考的流程範本,而不是可以直接複製的技術規格。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵