
据科技媒体 404 Media 报道,研究人员将一枚追踪设备放入一本珍本图书,随后追踪到该书最终抵达了亚马逊位于拉斯维加斯的一处设施,编号 VGT3。该设施对外标识为一只恐龙爪夹着图书的符号。
亚马逊随后在一份声明中确认:"我们通过商业渠道购买图书,以提升客户使用的产品和服务。"
核心变化:珍本图书正被大规模销毁用于 AI 训练
为何大模型需要这些书
主流大语言模型(LLM)已几乎吞噬了互联网上所有可爬取的数据。各公司对训练语料的需求近乎无穷无尽。珍本,尤其是已绝版或从未数字化的图书,成为一片尚未被染指的数据金矿——这些文本的价值在于,它们不可能出自 AI 之手。
模型崩溃的隐忧
2022 年之前出版的内容,必然出自人类之手。当 AI 在训练中摄入过多 AI 生成的文本时,会面临"模型崩溃"(model collapse)风险,导致输出质量逐步退化。珍本图书所承载的历史语料,恰好填补了这一时间窗口的空白,成为修复与丰富模型能力的稀缺资源。
采集方式引发争议
404 Media 的调查揭示了这些图书的最终命运:亚马逊将珍本图书的书脊切除后进行扫描,完成后图书本身即被销毁。这一操作方式意味着大量不可复得的文献资料就此消失,而非进入图书馆或档案馆保存。
影响与建议
对出版与文献保护而言,这是一条值得警惕的信号:AI 训练需求正在将文化遗存转化为消耗性资源,相关法律法规尚属空白。
对 AI 行业而言,合法获取高质量训练数据的路径正在收窄,各公司需正面回应数据来源的伦理问题,而非以"商业渠道采购"一笔带过。


评论