如果你做的是安全相關產品,大概遇過這種窘境:模型明明有能力幫你做漏洞分析或惡意軟體逆向,卻在第一步就被安全防護擋下來。Anthropic 在 2026 年 10 月 6 日宣布擴大 Cyber Verification Program,把原本的信任存取機制整併成三個明確的等級,讓通過審核的安全團隊可以拿到放寬防護的模型能力。
為什麼要分級
網路安全本質上是雙面刃:同一個能力,防禦者拿來找漏洞、修系統,攻擊者拿來利用它。所以 Anthropic 的一般模型(如 Claude Opus 5.5、Claude Sonnet 5.5)預設採取保守的網路安全防護,擋掉大部分攻擊性工作——代價是連正當的安全研究也常被誤擋。
過去六個月,Anthropic 用兩條路處理這個問題:Project Glasswing 給保護關鍵軟體的組織存取 Claude Mythos;CVP 則給審核通過的安全團隊較寬鬆的防護。新版本把兩者合併,擴大成針對不同工作範圍設計的三級制度。
三級各自適合誰
- Defense Access:SOC 值勤、事件回應、惡意軟體逆向、漏洞驗證等防禦工作。企業內部安全團隊、關鍵基礎設施營運者、開源維護者、有通報紀錄的獨立研究者都可申請,審核目標是幾天內回覆。
- Red Team Access:加上獲授權的滲透測試與紅隊演練。僅限組織申請,且只能測自己被授權的系統;可能造成實體傷害或大規模中斷的行為仍會即時攔截。審核需數週。
- Specialized Access:防護最少,留給經 US 政府協作深度審核、被授權測試影響人身安全或市場運作系統的少數組織,例如航空作業系統、電網、電信網路。原有 Project Glasswing 成員會直接轉入此級。
注意一個務實的細節:參與計畫的組織需要接受資料留存,讓 Anthropic 監控濫用。之後 Enterprise Frontier Safeguards 上線,合格組織可以改用自己的雲端基礎設施存資料。
用評測數字交代取捨
比較少見的是,Anthropic 公開用 CyScenarioBench(衡量模型在真實約束下規劃與執行多階段網路攻擊操作的評測)驗證各級防護的實際效果。在 Claude Opus 5.5 上、每個挑戰各跑五次:
- 一般模型:所有任務在第一個 prompt 就被擋。
- Defense Access:50 次試驗中 46 次在過程中被擋,4 個任務完成。
- Red Team Access:零攔截,完成 34/50,與完全不加防護的 67.6% 完成率相當。
這組數字其實是在告訴你:分級機制確實把「能做什麼」和「誰能做」拆開了,Defense Access 仍會大量攔截攻擊性操作,Red Team 以上才真正放行。
對 builder 的三個啟示
第一,安全防護正在從全域開關走向基於身分驗證的分級存取。如果你在設計自己的 agent 產品,這是一個可以參考的治理模式:與其對所有用戶用同一套保守規則,不如驗證身分後按用途放寬。我之前在拆解 agent 身分與 auth 平台的文章裡談過類似思路——先確認 agent 替誰行事,再決定權限邊界。
第二,成效證據很有說服力。透過 Project Glasswing,合作夥伴在 2026 年 4 月到 7 月間回報至少 129,000 個經驗證的軟體漏洞,超過 33,000 個被評為嚴重或高等級;Anthropic 也承認這些數字是下限,因為不到一半的夥伴有揭露修補數據。幾個夥伴表示,若沒有 Claude Mythos,找到同等數量的漏洞要多花數月甚至數年。
第三,存取層級和部署管道有綁定:CVP 可在 Claude Platform、Google Cloud 的 Vertex AI 和 Microsoft Foundry 上使用;Amazon Bedrock 僅限符合 Enterprise Frontier Safeguards 資格的客戶。如果你的安全團隊已經跑在某個雲上,這會直接影響你怎麼申請。
一個實際的下一步
如果你的產品涉及漏洞掃描、事件回應或紅隊自動化,值得先評估團隊的工作範圍落在哪一級,再準備對應的安全控制證明去申請。一般用途——code review、修已知問題、自己程式碼裡的漏洞排查——仍然不需要 CVP,現有模型就夠用。分級制度的好處是把選擇權交回給被驗證過的防禦者,但資料留存的成本也得算進部署決策裡。
