观点

偷书要赔15亿美元,AI巨头烧几百万本书反而合法了

文 | 蓝字计划,作者|Chester

一场现代版的“焚书”,正在美国发生。

最近几年,美国二手书市场出现了一个奇怪现象:不少神秘买家,一次性采购成百上千本书,不挑书、不问价,甚至连冷门旧书都照买不误。

随着电子阅读的普及,现在还有多少人看实体书?更别说这种成百上千的扫货始买书。书商们自然也开始好奇:究竟是谁在买走这批书?

最近,美国科技媒体404 Media联系到一名二手书商。对方刚刚通过书籍交易平台Biblio,接到了一笔大约1000本旧书的订单,其中还包括不少稀有、绝版和具有收藏价值的书。

为了找出背后的买家,404 Media把一枚AirTag塞进其中一本书里,然后一路追踪。

最终,这本书被送进了亚马逊位于拉斯维加斯的一家仓库。

据404 Media调查,这些书到了亚马逊仓库后,命运却只有三步:切掉书脊、批量扫描、然后扔进碎纸机。

负责这项工作的VGT3团队,甚至还给自己设计了一个颇为应景的Logo:一只露着牙齿、手里抓着书的霸王龙。

 

自己也卖书的亚马逊却干起了销毁实体书的活已经够惊奇了,但更惊奇的是同样这样干的,不只有亚马逊。

在更早之前,Anthropic就被曝光过一个代号为“巴拿马计划”的秘密项目。他们的目标,是把全世界的书都“破坏性扫描”一遍。

在大约一年时间里,Anthropic为此花费数千万美元,买下数百万本实体书,然后切掉书脊、扫描内容,再把剩下的纸张送去回收。

美国的AI大公司,怎么就和旧书干上了?

互联网内容,不够AI用了

AI公司疯狂买二手书,其实是想买下书里的内容和数据。

过去,互联网是大模型最方便的数据来源。新闻、论坛、百科、博客,抓下来就能拿去训练,成本低,数量还大。

但经过这么多年的反复抓取,网上那些容易找到、质量较高的内容,早就被各家AI公司吃得差不多了。更麻烦的是,互联网里开始混入越来越多由AI生成的文章。

2024年,《Nature》发表的一项研究就发现,如果下一代模型不断使用上一代模型生成的内容进行训练,可能出现所谓的“模型坍缩”:

模型会逐渐丢失原始数据中的信息,尤其是那些不常见、但真实存在的内容。最后,它生成的东西越来越单一,甚至开始胡言乱语。

因此,真正由人类生产的数据,也开始变得越来越珍贵。

而那些出版于几十年前的旧书,不仅完全不存在使用AI生成的内容,其中还有大量冷门专业书和小众著作,至今没有被完整数字化。

此外,相比互联网上随手抓来的帖子和营销文章,正式出版的书籍至少经过了一套完整的写作与编辑流程,经过了作者、编辑、出版社等多层审核,内容质量有保证多了。

后来公开的Anthropic内部文件就显示,早在2023年,公司内部就有人提出,书籍可以教AI“怎样把文章写好”,免得模型只会模仿那些低质量的网络表达。

于是,过去在二手书市场里无人问津的冷门旧书,突然成了AI公司眼中的优质数据。对模型来说,只要里面的文字还没有被收进训练数据库,就值得买回来扫描。

但如果事情就停在这里,还能算上一个“AI需要人类知识结晶”的好故事;但问题就在于,这些被AI公司买回去,扫了之后又被销毁的书,可不全是烂大街的通贩货。

404 Media追踪的那批旧书里,还包括一些稀有、绝版和具有收藏价值的书。然而在扫描设备面前,一本普通旧书和一本稀有藏书,最后可能都是等待被拆开的几百页纸,最终等待着他们的,无一例外是被销毁、粉碎、融掉的命运。

那些珍贵的藏书一旦被销毁,就有可能世间再无此书了。

这就构成了不少人对亚马逊、Anthropic愤慨的理由。书买了就买了,为什么非得切掉书脊,甚至扫描完就直接销毁?

非拆书不可?

Anthropic最早盯上书籍时,走的其实是另一条更省事的路:盗版。

2021年,Anthropic联合创始人Ben Mann曾连续11天,从盗版书库LibGen下载大量书籍。

一年后,另一个名叫Pirate Library Mirror的盗版书库上线,甚至公开承认自己“故意违反大多数国家的版权法”。Ben Mann看到后,立刻把链接发给了同事,还兴奋地附上一句:“来得正是时候!!!”

不用联系作者,也不用和出版社谈授权,点几下鼠标,就能把几百万本电子书搬回公司。

不过,这条捷径后来让Anthropic付出了不小的代价。

2024年,包括作家Andrea Bartz在内的几名作者,把Anthropic告上了法庭,指控该公司未经授权,下载并使用了他们的作品。

这场官司最后甚至催生了一个影响整个AI行业的判决。

2025年6月,美国联邦法官William Alsup认定,使用书籍训练大模型,属于具有高度转化性的合理使用。

简单来说,在法官看来,AI学习这些书,和学生通过阅读学习写作差不多,都是法律允许的学习行为。

但书是怎么来到Anthropic手里的这件事,就得另说了。

法院认为,Anthropic从盗版网站下载数百万本书,再把它们长期保存在自己的中央数字图书馆里,这种行为已经涉嫌违反了相关法律。

实际上,Anthropic后来确实为此达成了15亿美元的和解,涉及接近50万部作品,平均每部作品大约3000美元。

但很快,Anthropic就发现上帝给你关了一扇门的时候,又留了一扇窗,就是前面提到的花钱买来实体书,再扫描成电子文件的“巴拿马计划”,却得到了法院认可。

因为在法官看来,Anthropic合法买下了一本纸质书,扫描之后又把原件销毁,相当于用一份数字文件替代了一本实体书。

“一本变一本”,没有额外增加副本数量。

这也让整件事出现了一个颇为荒唐的结果:从盗版网站下载电子书,可能要付出15亿美元;花钱买下实体书,再把它切碎扫描,反而成了更加合规的办法。

当然,法律并没有规定AI公司买书之后必须销毁。只是把书拆掉,对这些AI公司来说是最符合经济效益的做法罢了。

首先是扫描的便利程度。

书脊还在的时候,想要把书放到扫描设备里还得把书翻开,也不算翻页;书脊切掉以后,几百页纸就可以像普通文件一样,连续送入高速扫描设备。

对于一次处理几千本、几万本,甚至数百万本书的项目来说,这个差别非常大。

其次是成本。扫描完成之后,原来的纸书既占仓库空间,又需要运输、整理和保存。继续留下它们,还得专门花钱把它们运走,再花钱租个仓库放着它们。

但是像Anthropic的“巴拿马计划”,要在六个月内处理50万至200万本书,这样干要额外付出的成本可太高了。既然都用液压切割机切掉了书脊,切了之后的书也不太可能还原成书了,还不如把剩下的纸直接销毁更省事。

 偷书要赔15亿美元,AI巨头烧几百万本书反而合法了

|用于“巴拿马计划”的仓库

对AI公司来说,这样做合法、快速,还能省钱。

也就是说,对于“买旧书来训练AI”这件事,事实上就是效率和法律都站在碎纸机一边。只是,谁来替那些稀有藏书踩下刹车?

马斯克也看不下去了

“巴拿马计划”在X上引发争议后,一直看不惯Anthropic的马斯克,率先贴脸开大了。

美国时间7月27日,马斯克表示,他已经要求xAI团队,如果在收购的书里发现稀有书籍,就应该把原件保存在图书馆里。扫描的时候宁可采用更困难的方式,也不要直接切掉书脊。

 偷书要赔15亿美元,AI巨头烧几百万本书反而合法了

也就是说,普通书可以追求效率,但遇到稀有书,还是得给它留下一条活路。

从技术上看,这并不是做不到。

Google Books过去就长期使用非破坏性的方式扫描图书。把书固定在专门的设备上,不需要切掉书脊,也能一页一页完成拍摄和数字化。

只是正如前面所说,在几十万本、几百万本书的规模下,这种方式肯定更低效,也更费钱。

但就算AI公司真的听了马斯克的话,一本稀有藏书都没有拆,事情也没有完全解决。

因为这些书被数字化之后,最终并没有进入一座所有人都能访问的公共图书馆。

一本旧书摆在书店里,至少还有机会被普通读者买走,也可能被大学、图书馆或者收藏机构收入馆藏。可当它被AI公司买走、扫描,里面的文字就会进入企业内部的数据库,最后变成商业模型的一部分。

书里的内容或许没有消失,公众接触它的渠道却可能变少了。

尤其是那些没有电子版、没有进入公共数字档案的绝版书。数字化原本应该让知识更容易保存和传播。到了AI公司这里,却可能让一份原本公开流通的知识,变成封闭的训练资产。

而前面的法院判决,又让这件事变得更加微妙。

按照“一本变一本”的判断,Anthropic销毁纸质书并变成电子书,在美国的法律里是合法的;如果留下了原件,那就等于同时保留了原件和电子书两本书,反而是不合法的了。

那就意味着,企业留下原书,要承担更多成本和法律风险;直接把书送进碎纸机,反而更合法。

这就相当于法律没有要求AI公司焚书,却在无意中给“焚书”提供了奖励。

这恐怕才是整件事最细思极恐的地方。

如今,世界各国对AI训练应该怎样使用版权内容,至今没有统一答案。美国法院这次却先给出了一次示范:合法买下纸质书,销毁原件,再把电子版留在公司内部,就有机会被认定为合理使用。

至少从结果来看,亚马逊的“焚书”,就很像一次有样学样。

如果未来这种做法被更多AI公司采用,“销毁原件”就会从一种节省成本的办法,逐渐变成规避版权风险的标准操作。

甚至连现在义正辞严批评Anthropic的马斯克,也很难说会不会在未来的某一天发现:既有效率,又有法院背书的“销毁旧书”,或许才是训练AI的“正道”。

只要能训练出更好的大模型,究竟要销毁多少本实体书,甚至在实体书之外还会消耗多少前AI时代的“资产”,也许就再也没人关心了。

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
维泛智能完成过亿元种子+轮融资,机器人端侧算力芯片进入产品化阶段
« 上一篇 08-24
中国PD-1启示录
下一篇 » 08-24

相关内容

一款灵巧手打磨14个月才发售:这家交大系公司在攒什么
离开了上海家化,丝芙兰如何破解连亏三年的困局?
世界互联网大会秘书处公开招聘工作人员公告
机器人会干活了,但还没学会“别多管闲事”