Anthropic 在 2025 年 8 月 12 日發布了一篇官方文章,詳細說明其 Safeguards 團隊如何為 Claude 建立多層防護。這不是一篇公關稿,而是難得公開的內部運作細節——對於正在打造 AI 產品的團隊來說,這些做法可以直接對照自己的安全設計。
Safeguards 團隊的成員來自政策、執法、產品、資料科學、威脅情報與工程等領域,目標是在 Claude 的整個生命週期中都內建保護,而不是事後補救。他們的做法橫跨五個層面:政策制定、模型訓練、測試評估、即時偵測與持續監控。
從政策到訓練:安全不是最後才加上去的
Safeguards 團隊負責設計 Claude 的 Usage Policy,這份政策定義了 Claude 應該與不應該被如何使用,涵蓋兒童安全、選舉誠信、網路安全等關鍵領域,同時也為醫療、金融等產業提供細緻的指引。
政策制定仰賴兩個機制:Unified Harm Framework 與 Policy Vulnerability Testing。前者是一個持續演進的框架,從身體、心理、經濟、社會與個人自主五個維度,幫助團隊理解 Claude 可能造成的潛在傷害;後者則邀請外部領域專家(例如恐怖主義、激進化、兒童安全與心理健康專家)對政策進行壓力測試,直接影響政策、訓練與偵測系統的調整。例如在 2024 年美國大選期間,Anthropic 與 Institute for Strategic Dialogue 合作,發現 Claude 可能提供過時資訊,於是加上橫幅引導用戶至 TurboVote 等權威來源。
在模型訓練階段,Safeguards 與微調團隊密切合作,討論 Claude 應該具備哪些行為,並在訓練過程中建立這些特質。當評估或偵測發現潛在有害輸出時,他們會更新獎勵模型或調整系統提示詞。Anthropic 也與 ThroughLine 等危機支援專家合作,讓 Claude 在處理自傷或心理健康話題時,能夠以細膩的方式回應,而不是一味拒絕或誤解使用者意圖。
上市前的測試:不只是跑幾個測試案例
在釋出新模型前,Anthropic 會進行三類評估:安全評估、風險評估與偏見評估。安全評估測試 Claude 對 Usage Policy 的遵守程度,涵蓋明確違規、模糊情境與多輪對話;風險評估針對高風險領域(如網路攻擊、CBRNE 武器)進行能力提升測試,並與政府與民間夥伴合作;偏見評估則檢查 Claude 在不同情境與使用者之間是否提供一致、準確的回應。
這些評估的結果會記錄在 system cards 中,隨每個新模型家族發布。值得注意的是,Anthropic 在評估電腦使用工具時,發現它可能被用於大量產生垃圾訊息,因此在上市前就開發了新的偵測與執法機制,包括對疑似濫用的帳號停用該工具,以及針對 prompt injection 的新保護。
即時偵測與執法:分類器與帳號層級行動
模型上線後,Anthropic 使用自動化系統與人工審查來偵測與執法。核心是一組稱為 classifiers 的 Claude 模型,它們被提示或微調來即時偵測特定類型的政策違規。這些分類器可以同時部署多個,各自監控不同類型的傷害,同時不干擾主對話流程。此外,Anthropic 也使用雜湊比對來偵測兒童性虐待素材(CSAM)。
執法行動分為兩類:回應引導與帳號執法。回應引導是即時調整 Claude 對某些提示的解讀與回應,例如偵測到使用者可能嘗試產生垃圾訊息或惡意軟體時,自動在系統提示詞中加入額外指示,甚至在少數情況下完全停止回應。帳號執法則是在偵測到重複違規時,採取警告或終止帳號等措施。
Anthropic 坦言,建立這些執法系統是相當大的挑戰,因為分類器必須處理數兆個輸入與輸出 token,同時限制運算開銷與對良性內容的誤傷。
持續監控與威脅情報:從單一提示到帳號層級
除了單一提示與個別帳號,Anthropic 也監控有害的 Claude 流量,以了解特定傷害的普遍性並識別更複雜的攻擊模式。他們使用 insights 工具以隱私保護的方式分析流量,將對話分組為高層級主題;使用 hierarchical summarization 技術,將個別互動濃縮為摘要,再分析這些摘要以識別帳號層級的疑慮,例如自動化的影響力操作。
威脅情報團隊則研究最嚴重的模型濫用案例,透過比對異常帳號活動與外部威脅資料,並監控社交媒體、訊息平台與駭客論壇,來找出既有偵測系統可能遺漏的模式。這些發現會公開在威脅情報報告中。
對產品開發者的啟示
Anthropic 的 Safeguards 架構提供了一個可參考的安全設計藍圖:安全不是單一環節,而是從政策到訓練、測試、偵測與監控的連續過程。對於資源有限的團隊,不需要一次到位,但可以從幾個關鍵點開始:
- 明確定義你的使用政策,並邀請外部專家壓力測試。
- 在訓練與微調階段就考慮安全行為,而不是事後加上過濾器。
- 建立多層偵測機制,包括即時分類器與帳號層級的分析。
- 持續監控實際使用情況,並公開分享威脅情報。
Anthropic 也強調,AI 安全不能只靠單一組織,他們持續尋求使用者、研究人員、政策制定者與公民社會的回饋,並透過漏洞獎勵計畫邀請公眾測試防禦機制。對於產品開發者而言,這提醒我們:安全是一個持續的對話,而不是一次性的檢查清單。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
