OpenAI

大英百科全書控告 OpenAI:近十萬篇文章的訓練與記憶化爭議

大英百科全書與韋氏詞典在曼哈頓聯邦法院控告 OpenAI,指控其未經授權複製近十萬篇文章訓練 GPT 模型,GPT-4 更能依要求輸出近乎逐字的原文。記憶化證據、流量蠶食與出版商訴訟潮,構成這場版權戰的三條戰線。

大英百科全書控告 OpenAI:近十萬篇文章的訓練與記憶化爭議 — 文章封面

2026 年 3 月 13 日,大英百科全書(Encyclopedia Britannica)與旗下子公司韋氏詞典(Merriam-Webster)在曼哈頓聯邦法院對 OpenAI 提起訴訟,路透社於 3 月 16 日率先報導。訴狀指控 OpenAI 未經授權複製近 100,000 篇 Britannica 文章與韋氏詞典詞條,用於訓練 GPT 系列大型語言模型,並主張版權與商標侵權。

這起訴訟的策略值得注意:原告不只挑戰訓練資料本身,更直接出示模型輸出的「記憶化」(memorization)證據——GPT-4 能在提示下逐字重現原文。對所有用網路內容訓練模型的團隊來說,這等於把「訓練是否侵權」與「輸出是否侵權」兩條戰線,同時推上法庭。

指控內容:訓練、輸出與商標

綜合路透社與 The Verge 的報導,原告的主張分三層。第一,OpenAI 大規模複製近 100,000 篇文章作為訓練語料;第二,模型會產出與原告內容「實質相似」(substantially similar)的結果;第三,韋氏詞典的商標權益同遭侵害。

訴狀中最有力的部分是並排對照的證據:OpenAI 模型的回答與 Britannica 原文並列,部分段落幾乎逐字吻合。原告寫道,GPT-4 本身已「記憶」(memorized)大量 Britannica 版權內容,且會依要求輸出「近乎逐字」的複本。

記憶化證據:訴訟的核心戰場

「模型學的是風格與統計規律,不是複製原文」是 AI 公司歷來答辯的主軸。Britannica 的訴狀正面挑戰這個說法:一旦模型能在提示下重現原文,合理使用的抗辯空間就會被壓縮,因為輸出本身就構成替代性的複本。

《紐約時報》自 2023 年 12 月起對 OpenAI 提起的訴訟,走的正是同一條舉證路徑。Britannica 案把戰線延伸到百科與詞典這類結構化的知識內容,測試的問題更廣:條目與釋義的選材、編排與文字,是否足以受到版權保護。

流量蠶食與出版商訴訟潮

訴狀對商業損害的描繪也很直白:AI 的回答「取代、或直接競爭」Britannica 的內容,而不是像傳統搜尋引擎那樣把使用者導回原網站——原告稱之為「蠶食」(cannibalize)網站流量。對仰賴訂閱與流量變現的知識出版商而言,這是生存層級的威脅。

訴訟與授權的拉鋸正在整個產業上演。《紐約時報》案纏訟超過兩年仍未落幕;2025 年 9 月,Anthropic 以 15 億美元和解了作者對書籍訓練資料的集體訴訟,顯示「先授權、再訓練」的壓力已轉化為真實的和解金額。Britannica 選在此時提告,等於把「授權或訴訟」的二選一,從新聞業進一步擴大到整個知識出版業。

對開發者與產品團隊的意義

三個實際影響。第一,RAG 與引用設計的優先順序提高:先檢索、再標註來源,比讓模型閉卷生成,在法律風險上安全得多。第二,訓練資料治理成為合規議題——資料來源、授權狀態與去重策略需要文件化,輸出端的記憶化檢測也應納入評估流程。第三,內容授權市場可能擴大:若 Britannica 勝訴或以高額和解收場,百科、詞典與資料庫內容的授權定價都會被重新估計。

提告時間點對 OpenAI 尤其尷尬——同一週,它才剛發表 GPT-5.4 mini 與 nano 兩款新模型。模型能力越強、生成越流暢,這類「依要求重現原文」的證據只會越容易取得,輸出端的法律風險也隨之上升。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵