Anthropic

Reddit 控告 Anthropic 未經授權抓取訓練資料

2025年6月4日,Reddit 在加州舊金山法院起訴 Anthropic,指控其在無授權協議下抓取平台內容訓練 Claude,並在宣稱封鎖爬蟲後仍存取逾10萬次。這是大型平台首度直接控告AI模型開發商的訓練資料訴訟。

Reddit 控告 Anthropic 未經授權抓取訓練資料 — 文章封面
本頁內容6 個段落
  1. 訴狀的核心指控
  2. 雙方的公開表態
  3. 這起案子特別在哪
  4. Reddit 的授權談判路線
  5. 接下來看什麼
  6. 參考來源

2025 年 6 月 4 日,Reddit 在加州舊金山的高等法院起訴 Anthropic,指控對方未經授權、未付費地抓取 Reddit 內容訓練 Claude 模型。蓋章的訴狀直接公布在 Reddit 的投資人關係網站上,TechCrunch 與美聯社等媒體當日報導。

這是首度有大型網路平台直接控告 AI 模型開發商的訓練資料爭議,也把「平台內容該如何計價」的問題正式帶進法庭。對開發者來說,這不只是大公司之間的角力,而是可能決定未來資料取得成本的案件。

訴狀的核心指控

Reddit 的主張有三層。第一,Anthropic 在沒有任何授權協議的情況下,使用 Reddit 內容訓練商業模型並從中獲利。第二,Anthropic 的自動化爬蟲無視 robots.txt 的排除規則,持續抓取平台。第三,也是最尖銳的一點:Reddit 指控 Anthropic 在 2024 年公開宣稱已封鎖爬蟲之後,仍持續存取平台超過 10 萬次。

訴狀還指控 Anthropic「故意在未經 Reddit 使用者同意的情況下,使用其個人資料進行訓練」。求償方面,Reddit 要求補償性賠償、吐出 Anthropic 因抓取所得的利益,並請求法院禁止 Anthropic 繼續使用 Reddit 內容。訴狀把 Reddit 定位為內容的授權方,而非免費的資料來源;一旦這個定位被法院接受,賠償計算就會以 Anthropic 從中獲得的利益為基準,規模可能相當可觀。

雙方的公開表態

Reddit 法律長 Ben Lee 的聲明措辭強硬:Reddit 不會「容忍 Anthropic 這類以營利為目的的實體,將 Reddit 內容商業化剝削、創造數十億美元價值」,卻不回饋平台、也不尊重使用者隱私。Reddit 另指控,當它向 Anthropic 表明對方缺乏授權後,Anthropic「拒絕認真協商」。

Anthropic 發言人的回應相對簡短:「我們不同意 Reddit 的主張,將全力為自己辯護。」雙方各說各話,但接下來的訴訟程序——管轄權、證據開示、爬蟲伺服器日誌——才是真正決定走向的戰場。值得注意的是時間點:各大平台正陸續與 AI 公司簽下新的內容授權合約,Reddit 此舉無疑為授權市場豎起了價格與法律風險的參考點。

這起案子特別在哪

之前的 AI 訓練資料訴訟,多由內容創作者發動:紐約時報控告 OpenAI 與微軟,多位作家(包括 Sarah Silverman)控告 Meta。Reddit 這次不同——它是第一個直接控告 AI 模型開發商的大型科技公司,爭的不是版權侵權那麼單純,而是「平台資料的商業使用權」。

耐人尋味的是利益關係:OpenAI 執行長 Sam Altman 持有 Reddit 約 8.7% 股份,並曾是其董事會成員。Reddit 先與各家簽約、再對未付費者興訟的順序,說明它把「談判失敗」視為進法院的前提。值得注意的是 Reddit 選的戰場:加州舊金山的高等法院,是兩家公司所在地,也是美國科技訴訟最成熟的法院之一。在地提告意味著程序更快、執行更直接。

Reddit 的授權談判路線

Reddit 的訴訟策略必須放在它的授權版圖來看。它已經與 Google(2024 年 2 月報導)和 OpenAI(2024 年 5 月)簽下付費授權協議,讓模型廠商合法存取其內容。換句話說,Reddit 並不反對 AI 訓練,它反對的是不付錢的訓練。

起訴 Anthropic,某種程度上是在告訴整個產業:授權市場存在,而且 Reddit 會執行它。對其他坐擁高品質語料的平台——論壇、問答站、垂直社群——這也是一次示範:資料的價值可以透過合約變現,不付錢的代價是律師函。對依賴公開論壇資料做評測或微調的團隊,這起案子同樣值得追蹤:什麼算「商業使用」、抓取多少算「合理」,判決與和解條款都會給出參考答案。

接下來看什麼

對開發者與企業,這起案件有兩個實際影響。一是高品質語料的成本:真實使用者的提問與討論,是模型後訓練最需要的資料類型之一,若平台全面收費,訓練資料的採購成本會繼續上升。二是爬蟲紀律的法律風險:robots.txt 的遵從程度、抓取頻率、宣稱與實際行為的一致性,都可能成為呈堂證供。這起案件也會檢驗 robots.txt 的實際法律地位:它長期只是產業慣例,若法院認定明知故犯的抓取構成加重情節,整個爬蟲生態的成本結構都會改變。

無論判決結果如何,「先簽約、後訓練」都會加速成為產業預設。而 Reddit 選擇在自家法院管轄區提告、並公開訴狀的做法,也顯示其目標不只是賠償,而是把授權談判的籌碼攤在陽光下。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵