AI 公司买书、拆书、毁书,只为找到一句机器没碰过的话

2026.07.28 20:17
调查媒体 404 Media 披露,多家 AI 公司正通过中间商 ISBNdb 大规模收购二手图书用于训练大模型,以获取互联网上已无法找到的纯净数据。Anthropic 的巴拿马计划暴露了这场隐秘行动的规模:数百万本纸质书被切脊、扫描、销毁,只为在 AI 模型塌缩之前,找到最后一批未被机器污染过的文本。

人类花了几个世纪写出来的书,正在被 AI 公司以每分钟几十本的速度拆掉。不是读,是拆。切掉书脊,送进高速工业扫描仪,变成数字文件,然后碎掉。这场隐秘的收购行动背后,是一个 AI 行业不愿公开承认的真相:互联网已经被自己污染了,最后的纯净数据,躺在旧书店的货架上。

旧书收购潮:从一本到一百万本

2026年7月,调查媒体 404 Media 披露了一则令人不安的报道:多家 AI 公司正通过数据中间商 ISBNdb 大规模收购二手图书,用于训练大语言模型,同时严格保密买家身份。

ISBNdb 自称全球最大的图书数据库,拥有超过 1.11 亿本图书的目录信息。这家原本服务于图书馆、书商和发行商的公司,如今正在将业务重心转向 AI 行业。它的官网上赫然写着:全世界最好的 AI 训练数据,正躺在书架上。它把旧书形容为密集、经过编辑、权威的素材。

订单规模惊人。据 404 Media 报道,单次采购从 1000 本到 100 万本不等。一位不愿透露姓名的职业书商表示,今年 4 月以来,他的销量出现了前所未有的增长。过去生意好的时候,一周只能卖出约 20 本书;而近几个月,每周销量已飙升至数百本,是平时的五倍。Alibris、Biblio 等二手书交易平台上的其他书商也反映出现了类似的大宗采购现象。

这些采购行为有几个异常特征:采购对象几乎全部是带有国际标准书号(ISBN)的图书;完全没有主题、类型或作者偏好,小说、教材、专业书籍一视同仁;最关键的是,买家似乎完全不在意价格,即使部分图书明显高于市场价,也会直接买下。

但这批书的下场,远比被买走更令人不安。

AI 的自我污染:为什么旧书成了最后的净土

AI 面临一个自己制造的问题:模型塌缩(model collapse)。

当一个模型用 AI 生成的内容继续训练时,每一代模型的质量都会比上一代更差。细微的语言特征消失,系统性错误累积,输出趋于同质化。这就像复印机不断复印复印件,每一张都比上一张模糊。2026 年,合成数据已占到大模型训练管道的 10% 到 30%,而公开的网络数据集中,超过 60% 来源于 Common Crawl 等开放的网页抓取。这些数据中 AI 生成内容的占比正在快速攀升,学术界已经发出警告:按照当前趋势,高质量文本数据可能在 2026 年之内耗尽。

ISBNdb 在官方博客中指出:2022 年之前印刷的纸质书,在结构上保证没有受到过这种污染。仅此一点,就是巨大的优势。这里的污染指的是两件事:一是 AI 生成内容的无意污染,二是作者主动发起的数据投毒。

作者们已经开始反击。他们利用 Nightshade 等工具,在文本中嵌入对人类阅读无影响但会让模型中毒的字符。Anthropic 联合英国 AI 安全研究所和艾伦·图灵研究所发布的研究显示,只需 250 份精心构造的恶意文档,就能在数万亿 token 的语料库中为模型植入后门,无论模型本身的规模有多大。这意味着,互联网上爬取的数据即使数量再庞大,也无法保证干净。

而纸质书,出版于 2022 年之前的纸质书,从时间线上就天然免疫。买书,保留发票,法务团队就拥有了一条完整的数据溯源链。ISBNdb 把这套逻辑包装成了一句口号:收据就是新的许可证。

巴拿马计划:两百万本书如何被吃掉

获取旧书只是第一步,更难的是如何把纸质内容变成 AI 能消化的数据。

Anthropic 的巴拿马计划(Project Panama)提供了一个标本级的案例。2024 年初,Anthropic 高管启动了一项他们试图严格保密的计划。内部文件写道:巴拿马计划是我们对全世界所有图书进行破坏性扫描的努力。我们不想让人知道我们在做这件事。

此后一年内,该公司花费了数千万美元,购买了数百万本纸质书。负责这一项目的汤姆·特维(Tom Turvey)是一位曾参与 Google Books 项目的硅谷老兵。Anthropic 切掉书脊,将散页送入高速工业扫描仪,然后销毁了物理副本。据法庭文件显示,供应商提案中标注的扫描量在 50 万到 200 万本之间,完成周期约为六个月。这些书主要通过 Better World Books 和英国 World of Books 等二手书零售商采购,每次批量数千到数万本。

Anthropic 聘请了多家专业文档扫描公司,其中 Datamation Information Services 同时提供非破坏性扫描和破坏性扫描两种服务。非破坏性扫描使用俯拍扫描仪或 V 型扫描设备,不拆解图书;破坏性扫描则直接拆开书籍,效率更高、成本更低。AI 公司普遍选择后者。

ISBNdb 的服务条款中也明确说明了这一点:大规模扫描通常会毁掉书籍。工人切掉书脊,让散页通过机器,这比小心翼翼的替代方案更快、更便宜。因此,他们提供严格保密,每笔合作都签署 NDA,买家姓名永不披露。

该公司自己的营销文案也承认:AI 公司销毁两百万本书确实不是一个能博取同情的标题。它建议客户将这一行为重新包装为数字化保存。

法律的灰色地带:买书合法,但偷书不行

这场买书-拆书-训练的链条,在法律上处于一个微妙的位置。

2025 年 6 月,联邦法官威廉·阿尔苏普(William Alsup)裁定,Anthropic 的破坏性扫描行为属于合理使用,因为训练是变革性的。他将此比作教师教学生写作。但 Anthropic 的麻烦并没有结束。同一法官认定,该公司在启动巴拿马计划之前,曾下载了一个包含 700 万本盗版图书的数据库,侵犯了作者和出版商的版权。2025 年 9 月,阿尔苏普初步批准了 Anthropic 以 15 亿美元(约合 101.62 亿元人民币)和解的提案。2026 年 7 月,法官阿拉塞莉·马丁内斯-奥尔金(Araceli Martínez-Olguin)批准了最终和解。这是美国版权案件中已知的最大和解金额,超过 91% 的作者和出版商已经领取了赔偿份额。

这组判决传递了一个清晰的信号:买书、拆书、扫描,只要书是合法购买的,法院可能不拦你。但如果你先偷了再说,代价会极其昂贵,每本侵权作品最高可判罚 15 万美元。

ISBNdb 显然读懂了这一信号。它向客户提供的核心服务之一就是溯源文档:每笔订单附带发票、批次记录和保管链材料,为法务团队提供完整的合规证据。

与此同时,谷歌也面临类似的诉讼。一个出版商联盟已对谷歌提起诉讼,指控其未经授权使用数百万本受版权保护的图书训练 Gemini AI 模型。这场官司的结果,将决定图书训练数据的法律边界到底在哪里。

盗版路线与合法路线:两种逻辑的冲突

Anthropic 的案例揭示了一个奇怪的产业逻辑。在巴拿马计划之前,该公司曾从盗版网站下载了 700 万本电子书,零成本获取了大量训练数据。但正是这些免费数据,最终让公司付出了 15 亿美元的代价。而巴拿马计划虽然成本高昂,买书、运输、扫描、销毁,每个环节都要花钱,却被法院认定为合法。

这种合法但更贵的路径,正在重塑整个 AI 训练数据的供应链。ISBNdb 的商业模式正是在这一背景下应运而生:它不生产数据,只是图书的搬运工,但搬运的是法律上干净的数据。对于估值数百亿美元的 AI 公司来说,这笔成本是划算的保险。

问题在于,这种模式能否规模化。全球每年出版的纸质书数量有限,而且其中大部分并非 2022 年之前的纯净作品。二手书市场虽然庞大,但高质量、未被数字化过的图书存量正在快速减少。当 AI 公司把旧书店的货架扫空之后,下一站是哪里?

当人类知识被锁进黑箱

这场旧书争夺战揭示了一个反讽的现实:AI 公司一边承诺让人类知识触手可及,一边在悄悄地买断、拆毁人类知识最坚实的载体。

更深层的问题在于,这些扫描后的数字内容最终进入了 AI 公司的私有数据库,仅用于训练其模型,普通公众无法访问。这意味着,公众可能获得更智能的 AI 助手,但代价是人类积累的大量知识资源正在从公共领域消失,被锁进几家公司的黑箱。

批评者还担心,在批量采购中,AI 公司是否会区分普通图书与珍贵或绝版图书。如果稀有书籍被拆毁,它们可能永久退出流通。这与图书馆的数字化使命有着本质区别:图书馆数字化是为了保存和传播,而 AI 公司的数字化是为了消耗和训练,而非保存。

Ingram,美国最大的图书分销商,已经向出版商发出警告,并提供了选择退出的方式。但问题是,当 AI 公司通过中间商匿名采购时,出版商甚至不知道自己的书被谁买走了。正如评论者 Josh Bernoff 所指出的,出版商可以选择退出,但 AI 公司找到绕过这一限制的渠道,并不困难。

还有一个更深层的悖论:即便 AI 公司今天买光了所有旧书,下一代模型训练时,还能找到纯净的数据吗?每一轮 AI 生成的文本都在污染互联网,而新一轮模型又要从这片被污染的海域中捞取训练素材。收购旧书只是延缓了模型塌缩的速度,并没有解决根本问题。当旧书也被耗尽,当二手书店的货架空空如也,AI 将不得不吞下自己制造的毒药。

当 AI 把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有 AI 自己说过的话了。

作品声明:内容由AI生成