昊梵体育网

为了干净的训练数据,AI 巨头已经疯到破坏文物了!就因为 2022 年之前的老书

为了干净的训练数据,AI 巨头已经疯到破坏文物了!就因为 2022 年之前的老书没有 AI 生成内容污染,他们通过第三方匿名买断古董孤本,切书脊、高速扫描后直接粉碎销毁,连 18 世纪存世极少的植物学孤本都没能逃过被绞碎的命运。
 
这件事真正令人警惕的地方,不是旧书突然涨价,而是部分科技公司正在把实体书当成一次性训练材料。

书买回来以后不收藏、不转售,也不供人阅读,而是拆掉装订,裁齐书页,送进工业扫描设备,完成文字识别后丢弃纸张。
 
最直接的证据来自Anthropic。美国加州北区联邦法院2025年公开的判决文件显示,这家公司曾花费数百万美元购买数百万册纸质书,其中很多是旧书。服务商拆掉装订,裁切书页,再扫描成带有可检索文字的PDF,纸质原件随后被丢弃。
 
到了2026年,这种采购已经出现产业化迹象。ISBNdb原本主要提供图书信息检索,现在公开向AI客户提供大宗纸质书采购服务,单笔规模从1000册到100万册,并提供保密安排。欧洲书商收到的订单往往不是按作者和主题挑选,而是直接给出大批ISBN编号。
 
荷兰书商收到的一份清单包含3000种英文书,内容从岩土力学、先进陶瓷到爱尔兰民间故事研究,彼此几乎没有关联。
 
瑞士、西班牙和德国也出现相似情况。一名德国旧书商发现,从今年5月开始,每天凌晨3点到5点都会集中出现订单,购买对象大多是专业性很强、平时销量很低的书。
 
为什么AI公司突然看上这些老书?答案很直接:公开网络上的高质量人类文本正在变得稀缺。
 
大模型需要的不是简单堆积文字,而是结构完整、事实密集、表达稳定的内容。研究机构Epoch AI估算,经过质量和重复度调整后,可供训练的公开人类文本大约为300万亿个词元。按照当前训练规模增长,这部分资源可能在2026年至2032年间被充分利用。
 
与此同时,互联网新增内容中已经混入大量机器生成文本。2022年并不是绝对分界线,早期自动生成内容在此前已经存在,但ChatGPT发布以后,生成式AI内容的数量明显增加。因此,2022年前出版的纸质书被一些数据公司视为相对容易判断来源的人类文本。
 
这种担忧并非企业自我炒作。《自然》发表的研究显示,如果后续模型反复使用前代模型生成的内容训练,数据分布会逐渐变窄,低频信息和少数表达更容易消失,最终可能出现“模型坍塌”。所以,经过作者写作、编辑加工和出版社校对的旧书,重新获得了训练价值。
 
我认为,购买普通库存书用于扫描,与无差别收购珍稀版本,必须分开讨论。大量滞销教材、普通再版书和常见旧书本来就可能被回收处理,企业合法购买后进行数字化,并不必然等于破坏文化遗产。
 
真正的问题是,目前这套采购流程主要按照ISBN和内容需求运行,未必识别初版、签名本、批注本、地方小印本以及存世极少的专业著作。
 
同一个ISBN之下,也可能出现不同印次、不同装帧和带有独特记录的个体。文字被扫描下来,不代表纸张、装帧、印刷错误、手写批注和流传信息也被完整保存。
 
美国法院当时认为,Anthropic购买纸质书后,以一份数字文件替代一份被丢弃的实体书,而且没有把数字副本对外传播,这种内部格式转换可以构成合理使用。
 
但这只是美国一家联邦地区法院针对具体案件作出的判断,并不等于所有国家都允许同样操作,更不等于企业可以不经筛选地销毁珍稀书。
 
Anthropic的另一条取书渠道就没有得到法院认可。法院文件显示,该公司还从盗版网站下载了超过700万册电子书。
 
相关诉讼后来以15亿美元达成和解,最终确认涉及482460部作品,平均每部约3100美元。这个结果已经说明,购买实体书、扫描自有副本与直接取得盗版文件,在法律上不是一回事。
 
在我看来,AI训练需要高质量数据可以理解,但技术竞争不能以不可逆的文化损失为代价。
 
企业既然有能力投入数百万美元批量收书,也完全有能力增加版本鉴定、珍稀书拦截和保存程序。成本低不是省略这些程序的正当理由。
 
最基本的规则应该尽快建立:大宗采购前核对图书馆馆藏和珍本目录;对稀有版本禁止破坏性扫描;公共领域作品完成数字化后,向公共图书馆存交副本;采购商保存来源、版本和处理记录;涉及版权的内容优先通过出版社、作者和专业数据库取得许可。
 
AI公司需要旧书,是因为人类长期积累的知识具有不可替代的质量。
 
这反而更能说明,实体书不能只按照纸张成本处理。技术进步和文献保存并不冲突,真正缺少的是明确规则和企业责任。
 
现在如果不把边界划清,等到某些版本真正消失,再完整的扫描文件也无法恢复它原来的全部信息。