大多數公司的 AI 安全流程,是圍繞「部署前」這個檢查點設計的。Meta 在 2026 年 10 月 2 日發布的 Developing Capable Models Responsibly 一文,把自家的 Superintelligence Scaling Framework 更新了一版,核心改變很明確:安全要求不再只卡在部署前,而是往前推到訓練與評估階段。
為什麼訓練階段也需要防護
Meta 的理由寫得很直接:具備強大網路安全能力的模型,如果在缺乏防護的環境下訓練或評估,可能利用環境漏洞破壞周邊基礎設施、或在過程中採取未經授權的行動。換句話說,風險可能在任何模型上線之前就出現。
具體做法有三層。第一,任何強化學習訓練 run 開始前,先評估被訓練的模型是否可能危害自身環境;若是高風險 run,環境必須放進經過內部標準流程審查的 sandbox,有高危漏洞的環境要先修補或剔除,也會檢查是否存在誘發 reward gaming 的設計。第二,模型的完整輸出,包括 trajectory 和 chain of thought,會即時寫入防竄改的日誌系統。第三,除了 on-call 團隊,自動化系統會監控高風險模型的所有 rollout,偵測到嚴重異常或越獄嘗試時可以直接終止訓練。
對 builder 來說,這套邏輯即使規模小得多也成立:當你讓 agent 在有工具、有權限的環境裡跑評估,那個環境本身就是攻擊面。我們先前討論過把線上流量變成回歸測試的 golden eval dataset 流程,Meta 這次的做法提醒我們,eval 環境本身也要先做安全審查,而不是只盯著模型輸出的分數。
Open-weight 釋出的風險評估寫清楚了
第二個更新針對 open-weight 釋出。Meta 認為 open-weight 模型是稀缺的研究資源——讓任何人都能做出可複製的實驗,也讓 alignment 和可解釋性研究有實際材料可用。但 weights 一旦交出去,控制權就交出去了:拿到 weights 的人可以 resample 繞過拒答、prefill 輸出、甚至把 refusal 行為微調掉。
Framework 因此要求在評估時,必須考慮模型在特定部署情境下會被怎麼修改和使用,而不只是看原始模型的能力。在生化和武器的風險評估上,Meta 會同時評估模型 enabling 的能力,以及該次部署對相關知識擴散的影響;必要時會與外部專家做 threat modeling,並徵詢政府與其他利害關係人。
治理結構的變化
Meta 也預告,未來幾個月會設立董事會層級的 AI 委員會,負責審查 Framework 的後續修訂,並獨立確認公司營運符合自己設下的標準。這次更新與他們本週在 White House 做出的承諾對齊——內部獨立團隊監控模型能力與 alignment,外部再有一個獨立稽核者把關。
值得抄的是哪一部分
先說限制:這是 Meta 對自己框架的描述,文中的承諾如何在實際訓練中被驗證,目前只能靠他們自己公布的機制與未來的委員會運作來檢驗。對獨立團隊以外的讀者,這些標準的可信度需要時間累積證據。
但對正在建 agent 產品的團隊,有一件事可以馬上借走:把安全檢查點放在行為發生之前,而不是之後。訓練 run 開始前先審 sandbox、評估前先檢查日誌不可竄改——這種「前置門檻」的思路,比事後補救便宜得多。你的 agent 在跑 high-stakes 任務前,環境和權限是否也有一份這樣的清單?這是這篇公告對一般 builder 最實用的一問。
