所以AI实验室正成托盘地购买旧书,把它们拆开,扫描页面,然后把剩下的部分制成纸浆。这些订单是根据ISBN号输入的,对稀缺性视而不见。流水线上的没人会检查被撕碎的书是不是地球上最后几本之一。其中一些很可能就是。AI公司正在大量购买稀有书籍,通过高速机器扫描它们,这些机器会切开书脊,然后将原版书籍销毁。一项名为ISBNdb的服务促成了多达一百万本书的订单,并为买家保持匿名。2022年之前的书籍是优质资源,因为它们不含AI。

这些实验室需要海量的人类高质量文本用于训练大语言模型,而旧书正好提供了未经数字化的纯净语料——没有AI生成的垃圾,没有网络上的重复冗余。
扫描流水线被优化到极致:一本精装书被送入拆页机,刀刃沿着书脊处切开,书页被快速送入高速扫描仪,平均每本书只需几分钟就能完成数字化。随后,所有纸张连同封面直接被投入工业碎纸机和制浆池,几乎没有回头路。由于ISBNdb只根据国际标准书号接受订单,系统不会调取馆藏的副本数量或拍卖记录来判断一本书是否稀有。
例如,一本1893年印行的农学手册,全球可能只剩三册,其中两册已入库深藏,这第三册刚刚被一台扫描机碾碎。流水线工人无法辨识书的版本价值,他们的绩效指标只有每小时处理的册数。据业内人士透露,ISBNdb在高峰期一天内能处理超过三千个订单,买家的身份由多层代理和加密钱包隐藏,无人监督这些书对人类知识遗产意味着什么。更棘手的是,2022年之前的书籍之所以受到追逐,不仅因为它们没有AI生成内容,还因为这些文本反映了更纯粹的人类创作痕迹——错别字、排版习惯、时代语境,这些软特征对训练反映真实世界的模型至关重要。但代价是,一些本应被图书馆、博物馆或私人收藏者保护的稀有副本,正在以一种不可逆的方式消失。



发表回复
要发表评论,您必须先登录。