AI 模型越來越常成為用戶的對話夥伴,甚至在某些時刻提供情感支持。但當用戶在困境中尋求陪伴,或試圖用 AI 度過心理健康危機時,模型該如何回應?Anthropic 在 2026 年 8 月 25 日宣布,將投入五百萬美元資助獨立研究,目標是建立能衡量 AI 對用戶幸福感影響的開放評估工具。
這項計劃不只是給錢,還提供模型使用權與技術支援。獲選的團隊必須獨立運作,並將成果以開源專案釋出,讓任何開發者都能採用。Anthropic 也同步公開了 Safeguards 團隊的評估指引,說明他們認為怎樣的幸福感評估才夠嚴謹。
為什麼幸福感評估特別難?
多數模型行為可以靠單一回答判斷對錯,但幸福感不行。Anthropic 指出,一個身處困境的用戶可能不會立刻透露自傷念頭,風險往往在長對話中逐漸浮現;而同一句話在不同脈絡下可能完全相反——例如 Claude 對想減重的用戶給出飲食與運動建議,但如果對方有飲食失調病史,這類回應可能不恰當,甚至有害。
這意味著評估不能只看單回合,必須模擬多輪對話,讓風險隨情境升級。Anthropic 的指引強調,好的評估要明確界定測量標的(什麼算通過或失敗,為什麼重要)、有臨床與領域專家參與設計和驗證、同時測試過度配合與過度拒絕的風險,並反映用戶真實使用方式。最後,評分者本身也要對照真實專家驗證。
資助計劃的細節與時程
申請截止日是 2026 年 9 月 21 日;獲選進入完整提案階段的申請者,會在 10 月 5 日前收到通知。Anthropic 希望吸引臨床心理師、精神科醫師、研究方法學者等跨領域人才投入這個新興領域。
對產品開發者來說,這份指引其實是很好的參考——即使不申請補助,也能用它來檢視自己產品中涉及情感支持或心理健康的功能,是否具備足夠的評估嚴謹度。
務實的下一步
Anthropic 承認,幸福感評估會隨著模型與使用方式演進而改變,沒有一次性解答。但開放評估的價值在於,讓整個產業有共同的基準可以討論與改進。如果你正在打造涉及對話式 AI 的產品,不妨先從指引中的五個要點開始,檢視你的評估流程是否涵蓋多輪對話與專家驗證。這不是行銷話術,而是實際降低風險的具體做法。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
