AI公司为获取训练数据,大量收购稀有纸质书并销毁
AI公司为获取高质量训练数据,开始大量收购稀有纸质书并扫描后销毁。Anthropic的“巴拿马计划”曝光,计划在六个月内处理50万到200万本书。美国法院裁定扫描合法购买的实体书用于AI训练属于合理使用,引发争议。
AI公司为获取高质量训练数据,开始大量收购稀有纸质书并扫描后销毁。Anthropic的“巴拿马计划”曝光,计划在六个月内处理50万到200万本书。美国法院裁定扫描合法购买的实体书用于AI训练属于合理使用,引发争议。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
当AI公司开始批量购买并销毁稀有纸质书以获取训练数据,一场关于法律、伦理与文明存续的争议浮出水面。
大模型训练依赖高质量文本,但互联网语料库正被AI生成内容污染,导致“模型坍塌”——模型在自身输出上反复训练,质量退化。因此,2022年前出版的纸质书成为最后的干净数据源,它们由人类撰写,不含AI生成内容。
稀有书籍因发行量少,成为AI公司争夺的独家优势。2026年4月起,美国书商发现订单激增,买家只列ISBN清单,不问品相不砍价;荷兰、德国等地书商也收到来自新加坡2077AI、加拿大Zoom Books的大批量订单。调查揭示,这些订单来自AI公司,书籍被扫描后销毁。
2026年初解封的法庭文件曝光了Anthropic的“巴拿马计划”,始于2024年初,旨在“破坏性扫描世界上所有书籍”。公司从二手书商采购纸质书,切掉书脊后高速扫描,纸张回收,数字副本仅供内部使用。项目规模为6个月内处理50万至200万本,花费数千万美元。
Anthropic此前因使用盗版书籍面临法律风险,2026年7月达成15亿美元和解协议,覆盖48万余部作品,但仅占其年营收470亿美元的3%。
2025年6月,美国加州北区联邦法院在Bartz诉Anthropic案中裁定:扫描合法购买的实体书用于AI训练属于“转化性合理使用”。逻辑是:书合法购买(首次销售原则),复制为数字版具转化性,数字副本未再分发。销毁原件反而强化了“替代”主张,使企业在法庭上更有利。
此后其他联邦法官在涉及OpenAI和Meta的案件中作出类似裁定。但Anthropic早年使用的盗版扫描已被认定侵权。
中间商ISBNdb公开提供AI训练数据采购服务,承诺保密,每单规模从1000本到100万本。曝光后曾删除相关页面,但很快恢复并引用判决作为法律背书。其他中间商如2077AI、Zoom Books也参与其中,但大客户身份未知。
人类历史上约1.3亿本独特书籍仅能提供30-40万亿tokens,而下一代模型需求达100万亿tokens,即使扫尽所有书也无法满足。
埃隆·马斯克要求其AI团队保留稀有书籍,非破坏性扫描。前AI高管埃德·牛顿-雷克斯称这是科技巨头与创作者权力失衡的证据。白宫科技顾问大卫·萨克斯批评Anthropic伪善:自己免费使用世界产出,却反对竞争对手用其输出训练。
书商态度复杂:经济上受益,但不喜欢稀有书籍被变成纸浆。作者群体愤怒于未经许可使用创造性劳动,而Anthropic购买的书籍作者可能已去世数十年,著作权追讨困难。
本文基于DeepTech深科技报道,其引用了华盛顿邮报、404 Media等来源,并提及法庭文件。关键事实如法院裁定、和解金额、项目规模等均有出处,但部分细节(如中间商客户身份)仍属推测。
AI公司为获取干净训练数据,正合法但不可逆地消耗人类文化遗产,而法律漏洞和巨大数据需求使这一行为难以遏制,引发深刻的伦理与文明存续问题。
主报道
主报道来源