文章 / #098

亚马逊买书喂 AI:毁书合法,偷书赔了 15 亿

昨天最招骂的 AI 新闻,主角是一千本书,和一枚塞进书箱的 AirTag。记者让书商把它夹进发往平台的大单,一路跟到拉斯维加斯——终点是一座亚马逊仓库。仓库北段有个代号 VGT3 的团队,员工在论坛上说,这里只干一件事:扫书。有人切书,有人扫条码——按他们的说法,纸本扫完就没用了。评论区火力最集中的两个字:毁书。

骂毁书,我不拦着。把书当一次性耗材、对文化没有敬畏,该骂——这一层不归法律管,是价值观的事。但骂完之后还有一层基本没人看见:书从哪来。那一层里有钱、有判例,判例的主角还不是亚马逊。

一枚 AirTag 能证明什么

先把证据分层说清楚。404 Media 的标题写着「扫描并销毁书籍」,可把证据链逐格拆开:AirTag 直接证明的只有一件事,那批书进了拉斯维加斯 LAS8 仓库的北段,那里是独立运营的 VGT3。扫描、销毁,来自匿名员工的论坛自述,加「货到了 VGT3 区域」的位置推断。没有照片,没有单据,404 自己也没声称目击销毁。

书进了那栋楼,是真的。楼里有人切书扫书,是员工自述,可信但没法独立验证。这批书被用来训练 AI,是推断。推断不丢人,把推断当事实写才丢人。

半个月前 Atlantic 的调查刚给这个叙事泼过冷水:被指认批量收书的 ISBNdb 公开否认,从未购买、扫描或销毁过一本书;书商指认的大买家 Zoom Books 和 2077AI,前者明确否认扫描销毁。

被买走的所谓珍本,大多是 1970 到 90 年代的滞销非虚构——1995 年的丹佛城市指南,1991 年的 WordPerfect 教程。把 404 当假新闻是另一种过度解读,跟进媒体标题一家比一家肯定,证据没多出一格。

为什么非得是纸书

如果只是要内容,电子书更省事,但电子书只有授权,没有所有权——你拿到的是使用许可,许可协议通常禁止复制、抓取、再分发,更不会允许把一百万本书送进扫描仪。纸书不一样,买的是这个物理副本。美国版权法上的首次销售原则,Alsup 法官一句话讲完:「每笔购买都使 Anthropic 有权按自己的意愿处置该副本。」它管的是这份纸,撕了、烧了、扔了都行;管不了扫描——扫描出来的是新的数字复制件,复制权还在作者手里。

数据质量是另一层原因。2022 年之前出版的纸书,不可能是 AI 写的。当年给 AI 公司代采书的平台,广告原话是「结构上保证不含 AI 污染」。想要干净语料库的公司,纸书是少数同时满足「合法取得」和「内容干净」的货源。

切书脊是纯工程。工业扫描用自动馈纸扫描仪,散页一叠叠送进去,正反两面一次过,胶装的书脊进不了馈纸器,机器只吃散页,所以要拆掉装订、把书页裁到统一尺寸。VGT3 员工那句「有人被分配去切书」,和「以前没有绩效指标,现在有了」,说的是同一条流水线:有产量、有绩效。

另一家公司,两条路

「买书、切脊、扫描、销毁纸本」这套动作,真有一家公司干过,而且被法院判过。Anthropic。

2025 年 6 月,加州北区联邦地区法院在 Bartz v. Anthropic 案里认定:Anthropic 花了数千万美元购买数百万本纸书,多为二手;服务商拆掉装订、裁切书页,扫描成数字文件,丢弃纸本原件。

法院对同案里的两种行为,给了相反的结论。买正版纸书这一路,合理使用。判决书写得清楚:纸质原版被销毁了,一个取代了另一个;不存在多余的复制;所购纸本被销毁、数字替身未被再分发,此为合理使用。

盗版这一路,侵权。Anthropic 从 LibGen、PiLiMi 这类盗版站下载了超过七百万本书,法院用词不留余地:固有地、不可救药地侵权,即使盗版件立刻用于转换性使用并销毁,也不豁免。这条路以 15 亿美元和解收场,美国版权史上最大的一笔,摊到每部作品约 3000 美元。

两条路,结果完全相反,逻辑却很朴素。你花钱买了一本,变成电子版,纸本销毁,数字件锁在公司里不外流,等于把买来的书换个格式存放:副本没有多,也没人因此损失。Napster 被罚就是因为副本暴涨还对外共享;这一路副本一份没多,还锁在公司里。反观盗版,连买都没买,直接从盗版站拿的,拿它干什么、用完烧不烧,源头就是偷。

把话说准

先拆一个流行简化:毁书合法,不等于必须毁书才合法。销毁从来不是成文法要件,同一判决里 Alsup 就举过 Texaco、Google Books、Sony 三个先例,副本数都比原物多一份,照样合理使用。撑起合理使用的是四件事:转换性使用,书被用来训练模型生成新文本,没被复刻拿去卖;合法取得;一份换一份、不增殖;不外流。「必须毁书」是媒体把判决推过头了。

这份判决的法律分量,比热搜说的轻。它是地区法院的即决判决——法官认为事实够清楚了,跳过庭审直接下结论;案子以和解终结,没经过上诉审。同一个月,Kadrey v. Meta 的法官对盗版下载加训练给出了相反的合理使用分析,美国 AI 训练数据的法律,现在是地区法院各说各话。和解协议也写明:不构成对行为合法性的认可,不设立未来许可框架。Anthropic 还声称,那些盗版数据从未进入任何商业发布模型的训练语料,15 亿赔的是「持有盗版副本」本身,不是「用了它」。把 15 亿说成「法院判训练违法」,或把 Alsup 说成「给毁书开了绿灯」,都是各取一半的误读。

Anthropic 案有海量卷宗,法院是在内部文件、合同、证词上认定的;亚马逊案目前只有一枚 AirTag 的轨迹、匿名员工的论坛帖、一句连「AI 训练」都没提的官方声明,证据强度不是一个量级。Alsup 认定的是「买来只用于公司内部研究和训练、数字件不外流」这个完整事实,亚马逊这批书买来干什么、数字件怎么处理,没人知道。

跟中文读者最相关的是最后一条:这是美国法。fair use 是美国版权法的制度,中国《著作权法》只列了 13 种合理使用,商业性大规模复制用于 AI 训练不在其中;《生成式人工智能服务管理暂行办法》第 7 条要求训练数据有合法来源、不侵害知识产权。「毁书合法」这个结论,别平移成国内也合法。

你的字有价,定价权不在你手上

这场戏里信息量最大的,是训练数据开始有价格了。书在 AI 训练市场已经有了两个公开的单价:微软×哈珀柯林斯的授权,每本 5000 美元;Anthropic 和解摊薄,约 3000 美元一本。价格合不合理另说,至少是个数,后面跟着合同、谈判、法庭。但就算有出版合同的作者,也没真坐上谈判桌:哈珀柯林斯给作者一半,布鲁姆斯伯里给两成。定价权在出版社和平台手里。

你在网上写的那些字,市场给过定价。Reddit 把用户帖子打包卖给 Google,每年 6000 万美元,用户一分没拿。Reddit 联合创始人 Steve Huffman 说过:语料很值钱,但没必要免费送给全球最大的公司。值钱,然后卖掉了,卖的钱跟写帖子的人无关。知乎的协议 3.4:你发布的一切内容,包括已经删除的,授权知乎免费、永久、不可撤销地使用,还可再授权。3.10 禁止任何单位或个人未经书面许可抓取知乎内容训练大模型,禁的是第三方;平台自己那份,3.4 早就写完了。你的字有价,只是定价那个环节,在你点「同意」那天就结束了,而且你没参与。

番茄小说给过一个答案。它的签约协议 3.2.10 写着:签约作品连同作者个人信息,可用于 AI 研发、机器学习、模型训练、深度合成。2024 年 7 月,作者们干过一件真事:条款被曝光后,全网刷「我们不想投喂 AI!」,平台被迫开放了解除通道,新合同不再含 AI 条款。那不是判决,是平台让步——但让步说明,定价权可以被组织起来的作者掰回来。

大单收多了,书商先怀疑是不是骗局——2024 年就有卖家在论坛上晒过这类单子;404 递来一枚 AirTag,他就想看看书到底去了哪。你点「同意」的时候,没有人递给你一枚 AirTag——你的字去了哪,永远不会有定位。

来源

DAVID YIN · 2026 · 08 · 18 · 杭州
← Older · #097
蚂蚁百灵和千问,AI模型互相供货却不是一家