返回信息流
新闻事件
S信号88
DeepTech深科技
1 个来源

AI公司为获取训练数据,大量收购稀有纸质书并销毁

AI公司为获取高质量训练数据,开始大量收购稀有纸质书并扫描后销毁。Anthropic的“巴拿马计划”曝光,计划在六个月内处理50万到200万本书。美国法院裁定扫描合法购买的实体书用于AI训练属于合理使用,引发争议。

SynthePulse Insight · AI 深度解读

AI公司的“绝版书”饥渴:合法销毁人类文化遗产的背后

版本 1 · 1 个来源

当AI公司开始批量购买并销毁稀有纸质书以获取训练数据,一场关于法律、伦理与文明存续的争议浮出水面。

  • 2026年起,AI公司通过中间商批量采购稀有纸质书,扫描后销毁,用于大模型训练。
  • Anthropic的“巴拿马计划”计划在6个月内扫描50万至200万本书,全程保密。
  • 美国法院裁定扫描合法购买的实体书用于AI训练属于“转化性合理使用”,合法但引发伦理争议。
  • 人类所有书籍仅能提供30-40万亿tokens,而下一代模型需求达100万亿tokens,数据缺口巨大。
  • 中间商ISBNdb公开提供保密采购服务,曝光后短暂删除页面又恢复,并引用判决作为背书。
展开章节目录数据饥荒:从互联网到纸质书的转向

数据饥荒:从互联网到纸质书的转向

大模型训练依赖高质量文本,但互联网语料库正被AI生成内容污染,导致“模型坍塌”——模型在自身输出上反复训练,质量退化。因此,2022年前出版的纸质书成为最后的干净数据源,它们由人类撰写,不含AI生成内容。

稀有书籍因发行量少,成为AI公司争夺的独家优势。2026年4月起,美国书商发现订单激增,买家只列ISBN清单,不问品相不砍价;荷兰、德国等地书商也收到来自新加坡2077AI、加拿大Zoom Books的大批量订单。调查揭示,这些订单来自AI公司,书籍被扫描后销毁。

“巴拿马计划”:合法但争议重重的扫描行动

2026年初解封的法庭文件曝光了Anthropic的“巴拿马计划”,始于2024年初,旨在“破坏性扫描世界上所有书籍”。公司从二手书商采购纸质书,切掉书脊后高速扫描,纸张回收,数字副本仅供内部使用。项目规模为6个月内处理50万至200万本,花费数千万美元。

Anthropic此前因使用盗版书籍面临法律风险,2026年7月达成15亿美元和解协议,覆盖48万余部作品,但仅占其年营收470亿美元的3%。

法律悖论:销毁反而更安全

2025年6月,美国加州北区联邦法院在Bartz诉Anthropic案中裁定:扫描合法购买的实体书用于AI训练属于“转化性合理使用”。逻辑是:书合法购买(首次销售原则),复制为数字版具转化性,数字副本未再分发。销毁原件反而强化了“替代”主张,使企业在法庭上更有利。

此后其他联邦法官在涉及OpenAI和Meta的案件中作出类似裁定。但Anthropic早年使用的盗版扫描已被认定侵权。

影子产业链与无法满足的胃口

中间商ISBNdb公开提供AI训练数据采购服务,承诺保密,每单规模从1000本到100万本。曝光后曾删除相关页面,但很快恢复并引用判决作为法律背书。其他中间商如2077AI、Zoom Books也参与其中,但大客户身份未知。

人类历史上约1.3亿本独特书籍仅能提供30-40万亿tokens,而下一代模型需求达100万亿tokens,即使扫尽所有书也无法满足。

伦理争议与行业反应

埃隆·马斯克要求其AI团队保留稀有书籍,非破坏性扫描。前AI高管埃德·牛顿-雷克斯称这是科技巨头与创作者权力失衡的证据。白宫科技顾问大卫·萨克斯批评Anthropic伪善:自己免费使用世界产出,却反对竞争对手用其输出训练。

书商态度复杂:经济上受益,但不喜欢稀有书籍被变成纸浆。作者群体愤怒于未经许可使用创造性劳动,而Anthropic购买的书籍作者可能已去世数十年,著作权追讨困难。

可信度边界

本文基于DeepTech深科技报道,其引用了华盛顿邮报、404 Media等来源,并提及法庭文件。关键事实如法院裁定、和解金额、项目规模等均有出处,但部分细节(如中间商客户身份)仍属推测。

核心结论

AI公司为获取干净训练数据,正合法但不可逆地消耗人类文化遗产,而法律漏洞和巨大数据需求使这一行为难以遏制,引发深刻的伦理与文明存续问题。

主报道

DeepTech深科技

主报道来源