2026 年 1 月 21 至 22 日之間,Anthropic 發布了 Claude 的新憲法(constitution)。這份文件約 80 頁,全文公開在 anthropic.com,授權方式是 CC0——等於放棄所有版權限制,任何人都可以自由閱讀、重製、改作與引用。SiliconANGLE 將它報導為 AI 業界罕見的透明度舉措。
第二個重點在內容方向:新憲法朝「理由本位」(reason-based)的對齊思路調整。價值規範不再只是抽象宣示,而是帶著可以檢視的理由與推論結構。
把價值觀變成可審閱的公開文件
model 的行為不是憑空而來:訓練與系統設計中的價值規範,會沉澱成它面對兩難時的選擇。過去外界能看到的多半是摘要或論文裡的間接描述,這次 Anthropic 直接把整份約 80 頁的文本攤開。研究者和使用者第一次可以逐條檢視:Claude 被期待遵守什麼、這些規範如何被組織、彼此的優先順序怎麼安排。文件規模本身也是訊息——要把一個前沿 model 的行為傾向講清楚,需要的篇幅遠超過一頁行為準則。
理由本位的對齊是什麼思路
對齊規範有兩種常見寫法。一種是列規則:告訴 model 什麼可以做、什麼不能做;規則列得再長,也追不上現實世界的邊角案例。另一種是給理由:讓規範附帶原則與推論,model 面對沒見過的情境時,依原則推導而不是比對清單。新憲法朝這個方向調整,等於把重點從「遵守條目」移到「理解為什麼」。對安全研究來說,這也讓行為預測有了更好的基礎:原則比清單更容易被外推與檢驗。
CC0 授權的戰略意涵
CC0 是最徹底的開放:不要求署名、允許商業使用、允許任何改作。放在 AI 憲法上,這個選擇至少有三層意義:
- 競爭對手可以直接引用、借用甚至整份採用——對齊方法論被當成公共財,而不是護城河
- 研究者可以逐條批評與重做,文件本身成為可累積的研究素材
- 對產業形成透明度壓力:下一家實驗室很難再用「商業機密」迴避同樣的問題
對安全研究與企業採用的意義
對安全圈,這是第一手材料:討論 Claude 的行為傾向時,不必再只依賴黑箱測試的間接推論。對企業採購方,多了一份可查閱的文件——評估 AI 產品的價值立場與風險態度時,有了明確的錨點,而不是只看行銷頁面的承諾。當然,憲法寫得再清楚,最終仍要看實際行為是否與文件一致。這也是公開文本的真正價值:它讓「說的」與「做的」可以被對照,而對照的結果,所有人都看得見。
參考來源
- Anthropic releases new AI constitution for Claude — SiliconANGLE
- Claude’s New Constitution — Anthropic
本文由 AI 協助自上述來源整理,經人工審核後發布。
