Anthropic

Anthropic RSP 3.0:拿掉「危險模型自動暫停」承諾

2026 年 2 月 24 日,Anthropic 發布 Responsible Scaling Policy 3.0,移除「接近危險能力門檻就先暫停訓練」的核心承諾,改為衡量競爭對手行動。TIME 以放棄旗艦安全承諾報導,本文解析改動內容、官方理由與 METR 等外部反應。

Anthropic RSP 3.0:拿掉「危險模型自動暫停」承諾 — 文章封面
本頁內容6 個段落
  1. 舊承諾是什麼
  2. RSP 3.0 改了什麼
  3. Anthropic 的理由
  4. 外部反應
  5. 對開發者與企業的意義
  6. 參考來源

2026 年 2 月 24 日,Anthropic 發布第三版 Responsible Scaling Policy(RSP 3.0),TIME 以獨家報導直稱 Anthropic「放棄旗艦安全承諾」,CNN 與 WSJ 在 2 月 25 日跟進。一家以安全為創立身分的公司,正式修改了自己最有名的安全規則。

改動的核心只有一句話:Anthropic 不再承諾「模型接近危險能力門檻就自動暫停開發」。新政策明說,若一家開發商為了實施安全措施而暫停,其他業者卻在無緩解措施下照常訓練與部署,結果可能是「一個更不安全的世界」——「防護最弱的開發者設定節奏,負責任的開發者將失去做安全研究的能力」。這段文字經執行長 Dario Amodei 與董事會一致同意。

舊承諾是什麼

RSP 於 2023 年 9 月推出,是自願性的 if-then 框架:模型能力跨越某門檻(ASL 層級),就必須先部署對應等級的安全措施。它的影響力遠超一家公司:OpenAI 與 Google DeepMind 幾個月內跟進類似框架,加州 SB 53、紐約 RAISE Act 與 EU AI Act 行為準則都看得到它的影子。Anthropic 的前沿模型自 2025 年 5 月起在 ASL-3 防護下運作。

舊版的關鍵條款是訓練前就備妥嚴格的模型安全措施——TIME 形容為「鐵板一塊」的保證。它從未真的觸發暫停,卻是整個自願安全論述的錨點。

RSP 3.0 改了什麼

三個實質變化。

第一,刪除自動暫停承諾:只有當領導層同時認定「Anthropic 是競賽領先者」且「災難風險顯著」,才會考慮延後開發,改為承諾「匹配或超越競爭對手的安全努力」。

第二,把公司自訂標準與產業建議分開:一套緩解措施用於自家系統,另一套是對全產業的建議。

第三,新增 Frontier Safety Roadmap 與風險報告。Roadmap 是公開、非約束的目標清單,例子包括資安研發 moonshot、自動化紅隊超越人類 bug bounty 的貢獻、模型憲法遵循措施、以 AI 分析內部紀錄偵測內部威脅,以及「監管階梯」政策路線圖。風險報告每 3 至 6 個月發布,特定情況下引入可讀未刪節內容的第三方專家審查。

Anthropic 的理由

共同創辦人暨首席科學家 Jared Kaplan 對 TIME 的說法很直白:「我們認為停止訓練模型對任何人都沒有好處」,以及「在 AI 快速進展下,如果競爭對手猛衝,單方面承諾對我們沒有意義」。

官方公告另給了幾個結構性理由:能力評估存在「模糊地帶」,模型接近但未確定跨越門檻時,舊機制沒有對應方案;單方面達到 RAND 建議的 SL5 資安等級「目前不可能」;政治與監管環境也已轉向。TIME 補充背景:Anthropic 才在 2 月以約 3,800 億美元估值募得 300 億美元,年化營收以每年約十倍速度成長。Mashable 引述 Axios 報導,美國國防部曾施壓 Anthropic 開放軍事應用,否則威脅施以限制。

外部反應

METR 政策總監 Chris Painter 告訴 TIME,AI 實驗室正處於「分診模式」,「社會還沒準備好」;他擔心移除二元門檻後,風險以「溫水煮蛙」方式緩慢累積,失去明確絆網。倡議團體 Transparency Coalition 把它當成「自願承諾不可靠」的最新證據,主張標準入法。

值得記錄的對照是:Anthropic 同時加碼透明度——新版 RSP、定期風險報告,加上 1 月以 CC0 全文公開的 Claude 憲法,都走「公開可供檢驗」路線。放掉的是暫停的硬承諾,留下的是揭露的軟承諾。

對開發者與企業的意義

三點實際影響。第一,採購與治理:「模型商自我約束」這道最後防線明確讓位給競爭邏輯——紅線要寫進自己的合約與評估流程。第二,政策:把 RSP 思路入法的州級法案(加州 SB 53、紐約 RAISE Act)參考價值不變,但「自願框架已足夠」的論述被自家發明人削弱,立法派拿到新彈藥。第三,產業動態:OpenAI 與 Google DeepMind 的同類框架是否跟進修改,是下個關鍵訊號——若三家同步鬆綁,「競逐底線」就從口號變成描述。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵