2026 年 2 月 24 日,Anthropic 發布第三版 Responsible Scaling Policy(RSP 3.0),TIME 以獨家報導直稱 Anthropic「放棄旗艦安全承諾」,CNN 與 WSJ 在 2 月 25 日跟進。一家以安全為創立身分的公司,正式修改了自己最有名的安全規則。
改動的核心只有一句話:Anthropic 不再承諾「模型接近危險能力門檻就自動暫停開發」。新政策明說,若一家開發商為了實施安全措施而暫停,其他業者卻在無緩解措施下照常訓練與部署,結果可能是「一個更不安全的世界」——「防護最弱的開發者設定節奏,負責任的開發者將失去做安全研究的能力」。這段文字經執行長 Dario Amodei 與董事會一致同意。
舊承諾是什麼
RSP 於 2023 年 9 月推出,是自願性的 if-then 框架:模型能力跨越某門檻(ASL 層級),就必須先部署對應等級的安全措施。它的影響力遠超一家公司:OpenAI 與 Google DeepMind 幾個月內跟進類似框架,加州 SB 53、紐約 RAISE Act 與 EU AI Act 行為準則都看得到它的影子。Anthropic 的前沿模型自 2025 年 5 月起在 ASL-3 防護下運作。
舊版的關鍵條款是訓練前就備妥嚴格的模型安全措施——TIME 形容為「鐵板一塊」的保證。它從未真的觸發暫停,卻是整個自願安全論述的錨點。
RSP 3.0 改了什麼
三個實質變化。
第一,刪除自動暫停承諾:只有當領導層同時認定「Anthropic 是競賽領先者」且「災難風險顯著」,才會考慮延後開發,改為承諾「匹配或超越競爭對手的安全努力」。
第二,把公司自訂標準與產業建議分開:一套緩解措施用於自家系統,另一套是對全產業的建議。
第三,新增 Frontier Safety Roadmap 與風險報告。Roadmap 是公開、非約束的目標清單,例子包括資安研發 moonshot、自動化紅隊超越人類 bug bounty 的貢獻、模型憲法遵循措施、以 AI 分析內部紀錄偵測內部威脅,以及「監管階梯」政策路線圖。風險報告每 3 至 6 個月發布,特定情況下引入可讀未刪節內容的第三方專家審查。
Anthropic 的理由
共同創辦人暨首席科學家 Jared Kaplan 對 TIME 的說法很直白:「我們認為停止訓練模型對任何人都沒有好處」,以及「在 AI 快速進展下,如果競爭對手猛衝,單方面承諾對我們沒有意義」。
官方公告另給了幾個結構性理由:能力評估存在「模糊地帶」,模型接近但未確定跨越門檻時,舊機制沒有對應方案;單方面達到 RAND 建議的 SL5 資安等級「目前不可能」;政治與監管環境也已轉向。TIME 補充背景:Anthropic 才在 2 月以約 3,800 億美元估值募得 300 億美元,年化營收以每年約十倍速度成長。Mashable 引述 Axios 報導,美國國防部曾施壓 Anthropic 開放軍事應用,否則威脅施以限制。
外部反應
METR 政策總監 Chris Painter 告訴 TIME,AI 實驗室正處於「分診模式」,「社會還沒準備好」;他擔心移除二元門檻後,風險以「溫水煮蛙」方式緩慢累積,失去明確絆網。倡議團體 Transparency Coalition 把它當成「自願承諾不可靠」的最新證據,主張標準入法。
值得記錄的對照是:Anthropic 同時加碼透明度——新版 RSP、定期風險報告,加上 1 月以 CC0 全文公開的 Claude 憲法,都走「公開可供檢驗」路線。放掉的是暫停的硬承諾,留下的是揭露的軟承諾。
對開發者與企業的意義
三點實際影響。第一,採購與治理:「模型商自我約束」這道最後防線明確讓位給競爭邏輯——紅線要寫進自己的合約與評估流程。第二,政策:把 RSP 思路入法的州級法案(加州 SB 53、紐約 RAISE Act)參考價值不變,但「自願框架已足夠」的論述被自家發明人削弱,立法派拿到新彈藥。第三,產業動態:OpenAI 與 Google DeepMind 的同類框架是否跟進修改,是下個關鍵訊號——若三家同步鬆綁,「競逐底線」就從口號變成描述。
參考來源
- Responsible Scaling Policy Version 3.0 — Anthropic
- Exclusive: Anthropic Drops Flagship Safety Pledge — TIME
- Anthropic’s AI safety policy just changed for this reason — Mashable
本文由 AI 協助自上述來源整理,經人工審核後發布。
