数十家公益与消费者权益组织8月21日联合致信美国联邦贸易委员会(FTC),要求对主要AI开发商展开调查。这些组织指控AI公司大量购买实体书籍,拆解扫描后用于训练大,随后将原书彻底销毁。

被销毁的书籍中包括一些原著仅存最后几本的珍稀版本。联名信指出,这种做法不仅剥夺了公众和其他AI公司获取原始资料的机会,还可能构成《联邦贸易委员会法》第五条所禁止的“不公平竞争方式”。信中写道:“AI公司通过大规模永久销毁书籍,正在构建一个只有最富有的既得利益者才能构建高质量、独占人类文字作品的未来。”
此次联名信的导火索之一是Anthropic内部代号“巴拿马计划”的项目曝光。根据版权诉讼中解封的4000多页法庭文件,Anthropic于2024年初启动该项目,斥资数千万美元从Better World Books和World of Books等二手书商处购入数百万本纸质书。承包商使用液压切割设备切除书脊,将散开的书页送入高速扫描仪,扫描完成后原书被销毁或送去回收。一份内部文件将该项目描述为“破坏性扫描全世界所有书籍”,并明确表示不希望外界知晓。
2025年6月,加州北区联邦地区法院法官威廉·阿尔苏普在作家安德烈亚·巴茨等人诉Anthropic案中裁定,Anthropic使用合法购买的书籍训练属于“转换性使用”,构成合理使用。法院同时认定,从盗版网站下载超过700万本电子书的行为不构成合理使用。Anthropic随后与作者及出版商达成15亿美元(约合人民币109亿元)和解协议,涉及约50万部作品。2026年7月20日,联邦法官正式批准该协议。
科技媒体404 Media本周的独立调查则指向亚马逊。调查人员将苹果AirTag藏入一批珍稀书籍货件中追踪,货件最终抵达亚马逊位于拉斯维加斯的仓库。仓库员工称,他们接收大量印刷图书后先切掉书脊再扫描,扫描结束后将原书撕碎或打成纸浆。扫描所得数据用于训练亚马逊Nova模型。亚马逊发言人回应称公司通过正常商业渠道采购书籍用于改进产品。
争议背后是AI行业对“干净数据”的迫切需求。2022年以前出版的书籍不含AI生成内容,可避免因反复使用AI生成文本导致的“模型坍缩”问题。与此同时,美国联邦法院的合理使用裁决改变了科技公司获取训练数据的成本计算——与出版社逐一协商授权相比,购买二手书后销毁被认为更具经济性。
这些团体要求FTC查明这一做法的规模,以及被销毁的书籍中有多少是原著最后存世版本。FTC目前尚未就是否立案调查作出回应。