群发资讯网

AI巨头真的开始“吞书”了:百万册旧书被切开扫描,真正消失的不只是纸张 20

AI巨头真的开始“吞书”了:百万册旧书被切开扫描,真正消失的不只是纸张

2022年以前出版的旧书,突然成了AI时代的新矿藏。

不是因为收藏热,更不是读书的人多了,而是部分AI企业看中了这些书里的“纯人类内容”。与今天混杂大量机器生成文字的互联网相比,老书经过作者写作、编辑审校和出版社筛选,更适合作为高质量训练材料。

但拿走这些知识的方式,比许多人想象得更直接:买下实体书,切掉书脊,高速扫描,再把无法恢复原状的纸页送去回收。

这不是网络传闻。美国加州北区联邦法院在Anthropic版权案的裁定中确认,该公司购买了数百万册纸质书,拆除装订、裁切书页并完成数字化。

2026年解封的诉讼材料又显示,这项行动内部代号为“巴拿马计划”,目标是大规模“破坏性扫描”图书。

在我看来,真正值得警惕的并不是AI“读了多少书”,而是人类知识可能正在经历一次单向转移:原本能够被书店再次出售、被读者收藏、被图书馆保存的实体书,退出了公共流通;留下来的数字副本,却只存在于企业服务器里,外界既看不到,也无法借阅。

书没有被公开保存,而是从公共市场进入了私人数据库。

部分旧书供应商还把2022年前出版、未受生成式AI内容影响,当成新的卖点。相关采购服务一次可涉及数千乃至上百万册,而且可以隐藏买家身份。

旧书商发现,一些彼此毫无关联、销量很低的书突然被成批买走,因此怀疑背后买家与AI训练有关。

不过,这里必须把事实说清楚。目前没有可靠证据证明“18世纪植物学孤本的最后几册已经被AI公司粉碎”。

能够确认的是,大规模破坏性扫描确实存在,绝版书和少量存世版本可能混在旧书供应链中,由此产生文化遗产损失风险。把一种尚未证实的风险写成已经发生的惨剧,只会削弱真正问题的分量。

AI企业为什么非要回头找旧书?原因也不神秘。2024年《自然》发表的研究指出,如果生成模型不断使用其他模型生成的内容进行训练,数据中的错误和偏差可能被反复放大,最终出现所谓“模型崩溃”。说得通俗一点,就是AI吃了太多自己生产的东西,答案可能越来越单一,距离真实世界越来越远。

这反而说明,再先进的AI也离不开人类长期积累的原创知识。问题在于,人类作者、编辑和出版机构用了几十年甚至几百年形成的内容,究竟应该以什么价格、什么规则进入商业模型,不能只由资金最雄厚的公司决定。

美国法院在这起案件中认为,将合法购买的纸质书转换成内部数字副本并用于训练,可以构成合理使用;但对Anthropic此前下载并保存数百万册盗版电子书的行为,法院并未给予同样保护。

后来达成的15亿美元和解,针对的重点也是盗版书来源,不能被误读为“销毁所有纸质书都获得了全球法律许可”。

我认为,合理的底线并不复杂:普通库存书可以依法交易和数字化,珍稀版本则应在破坏性扫描前进行识别;数字副本应留下可核验的保存记录;作者和出版方也应有透明的授权与补偿渠道。

AI可以学习人类写下的书,但不能让知识只剩下一份锁在企业机房里的影子。技术进步的价值,应当是让更多人接近知识,而不是让公共文化资源在沉默中减少。