美国AI巨头秘密销毁200万册绝版古书喂大模型,合法焚书,15亿赔偿却堵不住文化掠夺
当下风头无两、推Claude大模型的美国AI公司Anthropic,藏着个代号“巴拿马计划”的黑暗项目:斥资数千万美元扫空全球二手绝版书,工业切割扫描后全部粉碎销毁,整200万册纸质典籍彻底消失,其中大量存世仅孤本,人类独一份的文字实物载体,只为给机器凑“干净训练数据”。
市面上海量网络文字随便抓取,何必花钱毁书?这里藏着AI行业所有人都心知肚明痛点:2022年之后互联网内容大半是AI生成文本,用这类数据训练模型会出现逻辑混乱、文笔空洞“模型崩坏”。2022年前印刷的纸质书,全部是纯人类原创文字,没机器污染,是大模型争抢的顶级语料。
和出版社谈正版授权成本太高、流程繁琐,盗版电子书又直接踩版权红线,Anthropic索性想出套钻法律空子的掠夺方案。从纽约老牌斯特兰德二手书店、各地私人藏书收藏家、线下旧书批发商匿名下大额订单,单笔采购动辄十万册,不问题材、不议价,冷门地方志、小众学术专著、绝版外文译本、上世纪民间手写批注旧刊,全部照单全收。
图书运进封闭厂房后,全程流水线机械化处理:液压切割机一刀切碎书脊,完整书页剥离,高速工业扫描仪逐页提取文字,识别精度高达99.5%。数字化流程走完,所有实体图书统一送往纸厂粉碎回收,绝不留存一本原件。内部员工爆料,销毁环节是硬性要求,目的是防止这批绝版书二次流入市场,造成数据重复,同时规避后续图书流通带来的版权追责风险。
更讽刺的是这套操作居然完全符合美国现行版权法“合理使用”条款。加州北区法院法官明确裁定:企业花钱买下实体书籍,就拥有物品完整处置权,切碎、扫描、销毁都不算侵权;可公司此前偷偷从盗版网站下载700多万本电子书训练AI,被作家集体诉讼坐实侵权,最终赔付15亿美元天价和解金,创下美国版权诉讼赔偿纪录。
两条处理路径,两种截然不同的判决结果,直接催生行业畸形风气:毁书合规,存书侵权,等于法律变相鼓励企业毁灭纸质文化载体。这笔15亿美元赔偿金看似数额巨大,分摊到数百万创作者头上人均寥寥无几,那些早已离世、无后代继承版权的绝版书作者,一分收益都拿不到。小众历史学家、独立乡土作家耗费半生心血写成的著作,实体孤本被销毁,数字文本无偿供商业AI盈利,创作者权益彻底被架空。
图书馆界、文史学者看完卷宗集体震怒,直言这是数字时代新版《华氏451》式焚书。数字扫描只能复刻文字内容,原版纸张纹理、插画版画、读者手写批注、古籍独特装帧,都是不可复制的文化印记。一本仅存单册的地方民国史旧书,销毁之后,人类再也没实物史料佐证一段小众历史,文字之外所有人文细节永久灭失,这种损失没任何数字档案能够弥补。
事件曝光后,二手绝版古籍市场直接动荡,大批匿名大额收购单涌入,旧书价格翻倍暴涨,私人藏书家不敢轻易出售冷门孤本,生怕流入AI销毁流水线。行业跟风乱象已经出现,多家美国中小AI企业照搬“巴拿马计划”模式,低价批量收购老旧图书破坏性扫描。
舆论发酵后马斯克紧急在社交平台X表态切割,要求旗下SpaceX AI全线采用无损扫描设备,珍稀古籍扫描完成后统一捐赠公共图书馆存档,绝不切割损毁书籍。此举也撕开行业两面派现状:一边头部企业为压缩成本疯狂毁书,一边少数企业靠保护古籍打造品牌形象,行业至今没有统一伦理规范约束数据采集行为。
部分科技支持者认为,AI数字化是永久保存文字的最优解,实体书籍占用仓储资源,销毁只是物理形式更替,文字内容永久留存,没必要过度悲情;但文史从业者给出尖锐反驳:文字不等于完整文明,数字副本永远无法替代实物典籍的史料价值,商业科技不能以牺牲小众文化遗产为代价换取技术迭代。
更深层的隐患在于知识垄断。200万册绝版典籍转化的完整数据集,仅掌握在Anthropic一家商业企业服务器中,公立图书馆、高校文史研究所没权限调取完整档案,公共文化资源单向流入私人科技巨头,普通人再无机会接触绝版古书实物。
目前全球多国作家联盟、国际图书馆协会已经联合提交立法提案,要求区分普通流通旧书与珍稀绝版古籍,明令禁止对孤本、古籍实施破坏性扫描,商用AI使用图书文字必须建立集体授权付费机制。但法案落地周期漫长,在此之前,海量绝版纸质书仍持续面临被机器“吞噬销毁”的风险。
我们总以为焚书只会发生在动荡年代,却没料到数字时代,资本披着“技术创新” 的外衣,用合法合规的方式批量抹除人类纸质文明。当机器的训练需求凌驾于千年积累的文字载体之上,我们究竟是在拥抱技术进步,还是悄悄丢失无可复刻的人文根脉?

