
百年百科全书巨头杠上 OpenAI:起诉生成式 AI 版权侵权
诉讼概要
Encyclopedia Britannica(不列颠百科全书)与 Merriam-Webster(韦氏词典)已向 OpenAI 提起诉讼,指控这家 AI 巨头涉嫌“大规模版权侵权”。原告方在诉讼状中称,Britannica 拥有近10万篇在线文章的版权,这些内容未经授权被 OpenAI 抓取并用于训练其大语言模型。
侵权指控
Britannica 指出,OpenAI 的侵权行为包括三个方面:
- 训练数据侵权:在未经许可的情况下,使用 Britannica 的文章内容训练 LLM
- 输出内容侵权:生成的回答中包含对其内容的“完全或部分逐字复制”
- RAG 工作流侵权:在 ChatGPT 的 RAG(检索增强生成)工作流中使用其文章——当 LLM 响应用户查询时,该工具会扫描网页或其他数据库获取最新信息
此外,Britannica 还指控 OpenAI 违反美国《兰纳法》(Lanham Act,商标法规),因为 ChatGPT 会生成虚假“幻觉”内容并错误地归咎于该出版商。
商业影响与诉求
诉讼文件直言:“ChatGPT 通过生成直接替代和竞争出版商内容的回答,让 Britannica 等网络出版商失去收入来源。”Britannica 还声称,ChatGPT 的幻觉内容危及“公众持续获取高质量、可信赖在线信息的机会”。
行业趋势:出版商集体维权
Britannica 并非首家起诉 OpenAI 的出版商。此前已有多个重量级原告发起类似诉讼:
- 纽约时报 — 已提起诉讼
- Ziff Davis(拥有 Mashable、CNET、IGN、PCMag 等媒体)— 已起诉
- 十余家美国和加拿大报纸(包括芝加哥论坛报、丹佛邮报、佛罗里达太阳哨兵报、多伦多星报、加拿大广播公司)— 已联合起诉
此外,Britannica 对 AI 搜索公司 Perplexity 的类似诉讼仍在进行中。
法律先例与前景
目前尚无明确的法律先例判定使用版权内容训练 LLM 是否构成侵权。在 Anthropic 相关案件中,美国联邦法官 William Alsup 曾认定“将内容作为训练数据使用”具有足够的转换性,属于合法行为;但同时判定 Anthropic 非法下载数百万本图书而非付费获取,判处 15 亿美元集体诉讼和解金。


评论