一只霸王龙,嘴里叼着一本书,露出獠牙。
这不是什么AI生成的搞笑图,这是亚马逊拉斯维加斯仓库VGT3团队的官方logo。一群员工每天的工作就是接收大批量的书籍,用刀片切掉装订,把散落的书页塞进扫描仪,然后把残骸扔进垃圾堆。
他们管这个叫「改善产品和服务」。

这件事被彻底公开确认,是因为404 Media的记者Emanuel Maiberg做了一件非常朋克的事。他们联系到一个二手书商,这个书商在Biblio平台上接到了一笔约1000本的匿名大宗订单,觉得非常可疑,于是同意配合调查。他们在其中一本珍本书的书页之间,悄悄夹了一个Apple AirTag。
然后就是等。看着那个小蓝点在地图上移动。
AirTag从书商的仓库出发,经过一个中间处理站,横跨大半个美国,最终停在了内华达州拉斯维加斯一个巨大的仓库门口。那个仓库就是VGT3。一切谜底揭晓。
亚马逊的员工在一个内部论坛上写道,「我在VGT3工作,我们整天就是扫描书。有人负责切书,有人负责收书和扫条码。以前没有工作量指标,现在有了,但还好不算累。」
注意他的用词。「切书」。不是翻开书小心翼翼地扫描,是把书的脊柱切断,让书页像扑克牌一样散落,这样过扫描仪更快。效率优先。工业流水线式的效率。

扫完之后呢?书就没了。不会退回去,不会捐赠,不会放回任何一个书架上。一本存世可能只剩几十本的珍本,就这样变成了某个大模型训练数据里的一串token,而它的物理载体,那个承载了墨水和纸张气味和前人批注的实体,永远从世界上消失。
「它们只想要内容,以一堆连在一起的词的形式。」
这是那位配合调查的书商说的原话。他卖的是珍本书,每一本都有自己独特的来路。不一定是什么初版莎士比亚,可能是某个1960年代的小众学术著作,全球只剩三四十本,可能是某个地方志,记录了一个早已消失的社区如何生活。有人曾经翻阅过这些书、在页边用铅笔写过潦草的想法、把它从一个城市带到另一个城市传了三代人。
这些在亚马逊眼里全都不重要。他们要的只是字符序列,只是可以被模型吞下去转化成权重的语料。
其实吧,书商们早就有察觉了。过去一年多,全球各地的旧书商都收到过非常可疑的批量订单。几百本、几千本地买,什么类型什么领域都有,唯一的共同点是每本书都有ISBN编号。下单的人永远匿名,通过中间商走平台,你根本查不到最终买家是谁。
欧洲的书商也收到了。有人一开始还以为是钓鱼诈骗,后来才意识到这可能是AI公司在系统化地按ISBN清单「收割」全球图书。一个中间商在接受采访时甚至私下承认了一句大实话,「'AI公司销毁200万本书'这种标题不会给任何人带来好感。」 所以这些操作全部在保密协议和匿名账号背后进行,尽可能远离公众视线。
ISBNdb,一个做图书元数据的公司,去年在自己官网上公开写了一句营销文案,「世界上最好的AI训练数据就放在书架上。」被媒体曝光后他们秒删页面,声称这只是「一次市场兴趣测试」,从未实际执行。
你信吗。
回到一个关键问题,为什么偏偏是实体旧书。
这里面有一个精妙但也残酷的逻辑,理解了它你就理解了整件事的底层驱动力。
互联网上的文字已经被AI生成内容严重污染了。你今天在网上随便打开一篇博客、一篇产品评测、一个问答帖子,可能有三成的概率是某个大模型写的。用这样的数据去训练下一代模型,会导致一个技术圈子叫「模型坍缩」的问题。说直白点就是AI在吃自己的排泄物,越吃越歪,像一面镜子对着另一面镜子,反射到第五六次画面就完全扭曲了。
但2022年之前印刷出版的实体书,情况完全不同。
那个时候ChatGPT还没发布,Stable Diffusion刚出来没多久,市面上压根不存在ChatGPT、Claude这类能批量生成像样文本的东西。所以每一本2022年之前出版的实体书,几乎可以100%保证里面的每一个字都是人类写的、人类编辑的、人类校对的。
这是地球上最后一批「纯人类文本矿藏」。不可再生。
所以AI公司不是在买书。它们是在开采一种用完就没了的资源。书架上那些落灰的旧书,在它们眼里就是未被开发的油田。买下来(获取矿权),切开(钻探),扫描(抽取原油),扔掉残骸(废弃井架)。流程如此工业化,如此高效,如此冷酷。
这个逻辑一旦想通,你就会意识到事情比「版权争议」要深刻得多。
在传统的版权争议框架里,书还在,作者只是没拿到合理报酬,事情还有谈判和补偿的空间。但亚马逊做的不是复印或数字化存档,是「开采后销毁」。物理载体被切碎、被扔掉、从世界上永远消失。一本全球只剩三十本的珍本,被切开扫描后就只剩二十九本了。那第三十本包含的页边批注、历代藏书者的印章、纸张本身的物理状态所承载的信息,全部化为乌有。
这跟十九世纪欧洲探险家做的事有什么区别?
他们去埃及,去希腊,去中美洲,把独一无二的文物「合法购买」或者直接搬走,运回自己的博物馆和私人收藏室,然后对全世界说这叫「保护」「研究」「推动人类知识进步」。埃尔金勋爵从帕特农神庙上撬走大理石雕塑的时候,手里也揣着一份奥斯曼帝国的「合法许可」。
形式变了,逻辑一模一样。合法获取,提取价值,丢弃载体。
我是真的觉得,VGT3那个霸王龙logo暴露了一种深层的集体无意识。你想想,一群人坐在会议室里讨论团队标志的时候,最终选了一只凶猛的恐龙在吞噬一本书。这不可能是随意的。这是一种「我们就是食物链顶端」的自豪宣言,是一种对自身行为的黑色幽默式认领。书是猎物,我们是捕食者,我们吞噬知识然后变得更强大。
有点黑色幽默的是,恐龙最终灭绝了。但那是后话。
顺着这个往法律层面看一眼。Anthropic在去年的Bartz案里已经为类似行为付出了代价。法官裁定他们从盗版网站LibGen和Pirate Library Mirror下载了700万本书来训练Claude,这不构成合理使用。最终赔了15亿美元,大约每本书3000美元。美国版权案历史上单笔最大赔偿。Anthropic的法律团队事后说,「法院已经认定训练AI本身属于合理使用,我们只是为盗版获取渠道付了代价。」
但这个判决里最致命的部分,恰恰是那个看似对AI公司有利的裁定。
2025年6月,主审法官William Alsup在同一案件中同时裁定,如果你通过合法渠道购买了一本实体书,然后把它拆开扫描用于AI训练,那这属于「极其具有变革性」的合理使用,不侵权。
翻译成大白话就四个字,合法买的?随便拆。
你现在回头看亚马逊的整条操作链。通过Biblio匿名下单→中间商转运→VGT3接收→工人切割装订→扫描全部页面→扫描ISBN条码→销毁原件。每一步都是正规的商业交易,每一环都在Alsup法官的判决框架下无懈可击。
整条产业链的设计,就是为了精准地踩在那条15亿美元判例画出的合法线上。
没有监管机构在追踪有多少书被这样处理了。作者拿到的报酬是零,因为这些是二手书交易,版税在第一次出售时就已经结清。作者甚至不会收到任何通知,不知道自己的心血之作正在一个沙漠仓库里被一台机器切碎。
没有人知道自己的书正在被一只霸王龙吞食。
坦率的讲,我自己这两天一直在想这件事,脑子里总闪出一个画面。
公元前48年的亚历山大港。凯撒攻城时一把火烧掉了港口仓库,据说波及了亚历山大图书馆的部分藏书。此后几百年间,这座人类最伟大的知识殿堂在战争、宗教冲突和政治动荡中逐渐消亡,无数古代文本永远失传。我们至今只能从其他文献的引用中拼凑那些失落著作的只言片语。
每一个时代毁掉图书馆的人,都觉得自己有充分的理由。
凯撒在打仗。基督徒在捍卫信仰。哈里发在执行教令。
亚马逊在「改善产品和服务」。

区别在于,古人是因为战争或愚昧而毁掉知识载体。我们这个时代不一样。我们是在用最高效的工业流水线、最精密的法律架构、最无懈可击的商业逻辑,系统化地、安静地、一本接一本地把人类的知识载体切碎、扫描、丢弃。没有火光,没有暴力,只有扫描仪的嗡嗡声和碎纸机的沙沙声。
我们不是在焚书。我们是在用一种更体面的方式,完成同样的事情。
那位书商在采访最后说了这样一段话。
「书有不同类型的价值。有货币价值,这是显而易见的。但也有历史价值、知识价值、情感价值。各种各样的价值。而所有这些,AI公司都不在乎。它们只想要内容,以一堆连在一起的词的形式。」
一堆连在一起的词。
两千五百年来,从竹简到羊皮纸到活字印刷到精装本,人类一代一代想尽办法让思想跨越时间传递下去。每一本书都是这场漫长接力赛中的一棒。有些棒已经传了几百年,从一双手到另一双手,跨越战争、迁徙、遗忘,奇迹般地存活到今天。
现在,有人在系统化地把这些接力棒折断。吸取里面的能量,然后把壳丢掉。
他们唯一付出的代价,是每本几美元的二手书价格。
而那只霸王龙,还在logo里龇着牙笑。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。

评论区
欢迎留下你的看法,支持匿名评论。
你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。