警惕!大模型露出可怕真面目,现在居然开始吃纸了!
日本古书圈最近爆出一件让怪事,一大批身份模糊的买家,在日本各地到处扫荡二手旧书。
历史、哲学、老医学、旧法律文献,还有地方上的地方志,几十年前印的小众政治小册子,只要纸上印着字,几乎全都收,根本不挑品相。
这事从今年8月开始冒头,日本各地线上旧书店,接连收到大批量订单。不少古书店老板都懵了,平时店里生意温温吞吞,一天能卖个十几本就不错,突然订单砸过来,有的店铺一天就能卖掉一百本,单日销售额直接翻五倍。
有意思的是,下单的账号五花八门,看着像是一堆零散的个人买家,但所有包裹最后都会汇总到同一个冈山的物流中心,再统一打包外运,压根不是藏书爱好者在淘宝贝。
日本电视台顺着进出口记录深挖,查到日本大型图书批发商的子公司,去年起已经往美国出口超过50吨标注为日本书籍的货物。按普通精装旧书估算,差不多就是十万册纸质文献。
背后的源头,就是之前法庭文件曝光的巴拿马计划,是美国AI公司Anthropic的秘密项目。
他们砸下数千万美元,专门收购这类纸质旧书。书运到之后,直接用机器切掉书脊,高速扫描仪一页页扫成电子文本,纸质原件扫描完成之后,直接粉碎打成纸浆,彻底毁掉。
为啥非要费这么大劲去收几十年前的纸质旧书?网上能扒的公开文字,早就被各大模型啃得差不多了,网上的内容里还掺了大量AI生成的假文字,拿这些东西训练,模型会越学越乱。
而2022年之前出版的纸质书,全都是人类一笔一笔写出来的,没有AI污染,是质量极高的训练素材。
绝版的老文献,网上根本找不到电子版,谁拿到这批书,谁就能攥住独一份的语料资源。
最让人心里堵得慌的点就在这。很多被收走的是存世量极少的绝版资料,有些甚至是市面上仅存的实体副本。
扫描件只能记录文字,书页上前人随手写的批注、纸张老化留下的痕迹、原版的装帧细节,这些东西扫进电脑就彻底丢了。实体书一旦粉碎,这份承载了几十年人文痕迹的实物,就永远消失,再也找不回来了。
日本出版行业现在已经炸开锅,日本书籍出版协会专门发函质问这家图书批发商,这批外流的书籍里有没有会员出版社的出版物。
批发商的说法很含糊,说他们当初卖书的时候,根本没料到这些书本会被拿去给AI做训练。可不管知不知情,整条链条已经跑通了,中间商收购、集中转运、海外扫描销毁,出版社和原作者从头到尾都被蒙在鼓里。
美国法院认定,花钱合法买来的二手纸质图书,扫描之后用来训练AI,属于合理使用,不算侵权。可这家公司之前从网上下载盗版书籍训练AI,最后赔了十五亿美元。同一家公司,两条路子,两种截然不同的结果。
靠着买二手书、毁原件的操作,绕开了版权纠纷,这也难怪大批AI公司跟风盯上全球旧书市场,不止日本,欧洲多国的古董书商也收到过类似的匿名大额订单。
我们总觉得AI是轻飘飘的代码,可现在才看清,它的成长,要消耗实实在在的人类文明沉淀。
这些旧书不是一堆文字素材那么简单,是一代代人留下来的思考记录。资本为了训练更强的模型,为了搭建数据壁垒,把纸质典籍当成一次性耗材,读完就销毁。
这已经不是简单的买书卖书的生意了。互联网上的文字被搜刮干净之后,战场转移到了旧纸堆里。那些安静躺在旧书店角落,躲过战火、岁月留存下来的老书,现在迎来了一种全新的消亡方式。
我们很难不去担心,再过些年,很多绝版纸质文献,只剩下AI公司手里的一份电子副本,普通人再也摸不到、见不到原本的实体。技术向前跑的时候,可不能把人类留下来的纸质文明,当成饲料一口口吃掉。


