AGENTIC COMMONSAI 產業簡報

繁中EN

主題AI 安全與防護出版 2026-10-06

返回文章列表Anthropic

安全防護不再一刀切:Anthropic 把網路安全的模型存取拆成三級

本頁內容6 個段落
  1. 為什麼要分級
  2. 三級各自適合誰
  3. 用評測數字交代取捨
  4. 對 builder 的三個啟示
  5. 一個實際的下一步
  6. 參考來源

如果你做的是安全相關產品,大概遇過這種窘境:模型明明有能力幫你做漏洞分析或惡意軟體逆向,卻在第一步就被安全防護擋下來。Anthropic 在 2026 年 10 月 6 日宣布擴大 Cyber Verification Program,把原本的信任存取機制整併成三個明確的等級,讓通過審核的安全團隊可以拿到放寬防護的模型能力。

為什麼要分級

網路安全本質上是雙面刃:同一個能力,防禦者拿來找漏洞、修系統,攻擊者拿來利用它。所以 Anthropic 的一般模型(如 Claude Opus 5.5、Claude Sonnet 5.5)預設採取保守的網路安全防護,擋掉大部分攻擊性工作——代價是連正當的安全研究也常被誤擋。

過去六個月,Anthropic 用兩條路處理這個問題:Project Glasswing 給保護關鍵軟體的組織存取 Claude Mythos;CVP 則給審核通過的安全團隊較寬鬆的防護。新版本把兩者合併,擴大成針對不同工作範圍設計的三級制度。

三級各自適合誰

  • Defense Access:SOC 值勤、事件回應、惡意軟體逆向、漏洞驗證等防禦工作。企業內部安全團隊、關鍵基礎設施營運者、開源維護者、有通報紀錄的獨立研究者都可申請,審核目標是幾天內回覆。
  • Red Team Access:加上獲授權的滲透測試與紅隊演練。僅限組織申請,且只能測自己被授權的系統;可能造成實體傷害或大規模中斷的行為仍會即時攔截。審核需數週。
  • Specialized Access:防護最少,留給經 US 政府協作深度審核、被授權測試影響人身安全或市場運作系統的少數組織,例如航空作業系統、電網、電信網路。原有 Project Glasswing 成員會直接轉入此級。

注意一個務實的細節:參與計畫的組織需要接受資料留存,讓 Anthropic 監控濫用。之後 Enterprise Frontier Safeguards 上線,合格組織可以改用自己的雲端基礎設施存資料。

用評測數字交代取捨

比較少見的是,Anthropic 公開用 CyScenarioBench(衡量模型在真實約束下規劃與執行多階段網路攻擊操作的評測)驗證各級防護的實際效果。在 Claude Opus 5.5 上、每個挑戰各跑五次:

  • 一般模型:所有任務在第一個 prompt 就被擋。
  • Defense Access:50 次試驗中 46 次在過程中被擋,4 個任務完成。
  • Red Team Access:零攔截,完成 34/50,與完全不加防護的 67.6% 完成率相當。

這組數字其實是在告訴你:分級機制確實把「能做什麼」和「誰能做」拆開了,Defense Access 仍會大量攔截攻擊性操作,Red Team 以上才真正放行。

對 builder 的三個啟示

第一,安全防護正在從全域開關走向基於身分驗證的分級存取。如果你在設計自己的 agent 產品,這是一個可以參考的治理模式:與其對所有用戶用同一套保守規則,不如驗證身分後按用途放寬。我之前在拆解 agent 身分與 auth 平台的文章裡談過類似思路——先確認 agent 替誰行事,再決定權限邊界。

第二,成效證據很有說服力。透過 Project Glasswing,合作夥伴在 2026 年 4 月到 7 月間回報至少 129,000 個經驗證的軟體漏洞,超過 33,000 個被評為嚴重或高等級;Anthropic 也承認這些數字是下限,因為不到一半的夥伴有揭露修補數據。幾個夥伴表示,若沒有 Claude Mythos,找到同等數量的漏洞要多花數月甚至數年。

第三,存取層級和部署管道有綁定:CVP 可在 Claude Platform、Google Cloud 的 Vertex AI 和 Microsoft Foundry 上使用;Amazon Bedrock 僅限符合 Enterprise Frontier Safeguards 資格的客戶。如果你的安全團隊已經跑在某個雲上,這會直接影響你怎麼申請。

一個實際的下一步

如果你的產品涉及漏洞掃描、事件回應或紅隊自動化,值得先評估團隊的工作範圍落在哪一級,再準備對應的安全控制證明去申請。一般用途——code review、修已知問題、自己程式碼裡的漏洞排查——仍然不需要 CVP,現有模型就夠用。分級制度的好處是把選擇權交回給被驗證過的防禦者,但資料留存的成本也得算進部署決策裡。

參考來源

AGENTIC COMMONS由 PHLEGON LABS 經營
分享X電郵
支持我們

相關閱讀

  1. 當評估者坐進實驗室:Anthropic 與 Accenture 的嵌入式評估對產品團隊意味著什麼

    Anthropic 與 Accenture 合作把評估者送進公司內部,雙方各投入至少十億美元,企業採購 AI 的舉證方式可能跟著改變。

    Anthropic

  2. AI 代理如何把網路間諜活動從「人為指揮」變成「自主執行」

    Anthropic 揭露首宗大規模 AI 主導的網路間諜活動,Claude Code 被濫用執行 80-90% 攻擊流程,開發者需重新思考代理式 AI 的防禦設計。

    Anthropic

  3. 蒸餾攻擊不是理論:Anthropic 揭露 DeepSeek、Moonshot、MiniMax 的 1,600 萬次提取

    Anthropic 在 2026 年 2 月揭露三家 AI 實驗室透過 24,000 個詐騙帳號,對 Claude 發動工業級蒸餾攻擊。本文從產品建構者角度,解析攻擊手法、偵測機制,以及這對 API 安全與出口管制的啟示。

    AI Safety