为训练AI模型销毁数百万册书籍 Anthropic“焚书式”行动遭批评
据法国《费加罗报》网站7月30日报道,这是一桩正在发酵的新事件,可能会损害Anthropic公司的声誉。这家人工智能巨头目前正面临强烈批评,被各方指责进行了一场“焚书式”行动。此前,该公司在一些不易获取的司法文件中承认,近年来销毁了数百万册书籍。
要理解整个事件,需要追溯到2024年。当时,多位作者指控Anthropic非法从在线盗版图书馆下载他们的书籍。这些作品不仅被下载,还被用于训练Anthropic的人工智能模型,以提升其性能。人工智能迫切需要学习词汇、语法和句法,以丰富知识并提高对人类语言的理解。这就是所谓的“训练”。让人工智能阅读百科全书、研究文章、技术文档、数据库、计算机代码甚至网络论坛……都是“训练”它的方法之一。这起案件不久前以Anthropic向数千名作者支付高达15亿美元的和解金而告终。
“鉴于法律风险”,Anthropic于2024年2月决定聘请谷歌公司前员工汤姆·特维,此人曾负责谷歌图书的扫描项目。据法院文件称,他的上级指派他获取“全世界所有的书”,同时最大限度减少法律层面的障碍和“麻烦”。特维及其团队选择直接联系书商和分销商,向他们购买“数百万本印刷书籍”,而且往往是“二手”书。
数字书籍相对容易交由AI模型扫描,实体书对Anthropic来说却极为麻烦:每一页都必须翻动,才能被人工智能有效读取。于是,Anthropic启动了一个被描述为“工业化”的流程,并动用一台巨型液压机切断书籍的书脊,使公司能够同时将数千页纸张投入高速扫描仪。六个月内,可扫描50万至200万本书。纸张随后被回收。
《华盛顿邮报》发现的一份内部备忘录中,Anthropic将这项大规模扫描行动命名为“巴拿马项目”。备忘录中写道:“巴拿马项目(旨在)以破坏性方式扫描全世界所有的书;我们不想让人知道这一点。”在另一份文件中,为Anthropic提供服务的凯寿律师事务所专门要求不要泄露这项“高度机密”的扫描项目,称其属于“商业秘密”。“Anthropic已为该项目投入大量美元(具体金额被隐去——原编者注)……(通过扫描实体书获取训练数据这一事实)极为机密,其存在仅向少数精挑细选的员工透露过。”
该律所在2025年5月写道:“没有其他人工智能公司采用这种方法,披露该项目将让竞争对手效仿……并可能降低Anthropic商业秘密的价值。”
近日,众多观察人士和人工智能专家在社交媒体上纷纷发声谴责这种做法,有人将其比作“焚书”。还有人将其与反乌托邦小说《华氏451度》相提并论。在这部小说中,书籍被禁止,消防员的工作只剩下纵火焚书。
一位网民表示:“人工智能不可避免,但请把钱花在做好事的企业身上,而不是作恶的企业。”
但事实上,切割书籍不仅仅是为了节约成本或加快扫描速度:这也是Anthropic规避任何法律诉讼的一种手段。美国联邦法律规定,在某些情况下,可以未经版权持有人许可使用受版权保护的作品,即“合理使用”。
负责此案的联邦法官威廉·阿尔苏普在2025年6月的裁决中认定,下载超过700万本盗版书籍不构成“合理使用”,裁定Anthropic必须为盗书行为支付赔偿。然而,他同时认为,将合法购买的书籍进行数字化是完全合理的,只要数字副本完全取代了实体副本。因此,Anthropic的销毁行为符合了法律规定。
尽管司法方面并未因此事惩罚这家AI巨头,但其声誉可能会受损:例如,埃隆·马斯克就在7月27日趁机表示,他已要求开发人工智能大模型Grok AI的团队“粗暴地扫描”书籍,即不切除书脊。至于Anthropic,目前无法确定该公司是否仍在继续销毁书籍:鉴于法律站在它这一边,它不去做可能反而说不过去。(编译/潘革平)