核心动因:互联网数据遭“AI污染”,旧书成“纯净语料”最后堡垒
数据质量危机
2022年ChatGPT爆火后,互联网上新增内容超半数由AI生成,这些“AI垃圾内容”充斥网站。若继续用网络数据训练新模型,会导致AI“自产自销”、逻辑混乱甚至模型崩塌。数据质量的下降使得AI公司急需寻找更优质的训练数据来源。
旧书的时间锚点
2022年之前出版的纸质书,其内容全部由人类创作并经过专业校对,未被AI文本污染,是公认的“纯净高质量数据集”。随着公开网络数据被“毒化”,这批旧书成了AI公司维持模型性能的稀缺资源。
操作模式与法律依据:批量扫货、破坏性扫描、“合理使用”的灰色地带
匿名采购流水线
以Anthropic为首的公司通过ISBNdb等数据库服务平台,向二手书商下达千本到百万本不等的匿名订单,不限题材、不问价格,专挑带有国际标准书号(ISBN)的2022年前旧书。这种大规模的采购行为引起了二手书市场的关注。

“切脊-扫描-销毁”流程
为追求效率与低成本,买家采用破坏性扫描——直接切掉书脊,将书页送入高速工业扫描仪,数字化后实体书即被粉碎销毁,数百万册纸质书因此永久消失。这种做法虽然高效,但也引发了对文化遗产保护的担忧。
法院裁定“合法”
美国联邦法院在审理Anthropic版权案时认定,合法购买实体书后,将其一对一转换为数字副本并销毁原书,属于“合理使用”,不构成侵权。这一判例给大规模“焚书”行为提供了法律庇护。
商业考量:规避版权费、构建护城河
绕过高昂版权谈判
正规获取出版社授权流程繁琐、费用高昂。Anthropic曾尝试与出版社洽谈,但高层嫌麻烦而放弃,转而直接买二手书——买断后销毁原件,等于以极低成本获取了海量独家训练素材。这种方式为AI公司节省了大量的版权成本。
打造数据垄断壁垒
扫描后的内容被锁入AI公司私有数据库,公众无法访问。这意味着只有该公司拥有这批“纯净语料”的数字副本,从而在模型训练上形成独家优势,本质是用物理消灭公共知识载体来构建商业护城河。
AI公司批量抢购旧书这一现象,反映了当前AI发展过程中对高质量数据的迫切需求,以及在商业竞争中对数据垄断的追求。这一行为不仅引发了对数据质量和版权的思考,也对文化遗产的保护提出了挑战。随着AI技术的不断发展,如何在满足技术需求的保护好人类的知识遗产,将成为一个重要的课题。

相关问答
AI公司为什么要批量抢购2022年之前出版的旧书?
2022年ChatGPT爆火后,互联网充斥AI生成的低质量内容,污染了训练环境。2022年前的旧书由人类创作,未被AI污染且逻辑严谨,是优质的训练数据。
AI公司获取旧书的操作模式是怎样的?
通过ISBNdb等平台向二手书商下达匿名订单,不限题材价格,专挑2022年前带ISBN的旧书。采用破坏性扫描,切掉书脊扫描后销毁实体书。
美国联邦法院对AI公司购买旧书是如何裁定的?
法院认定合法购买实体书后,将其一对一转换为数字副本并销毁原书,属于“合理使用”,不构成侵权,给相关行为提供了法律庇护。
AI公司批量抢购旧书有哪些商业考量?
一方面可绕过高昂的版权谈判成本,另一方面能打造数据垄断壁垒,将扫描内容锁入私有数据库,形成独家优势。
这种行为对文化遗产保护有何影响?
扫描过程不区分普通书和绝版珍本,稀有书籍可能被拆毁永久消失,且内容进入AI公司私有数据库,公众无法访问,不利于文化遗产传承。
如何看待AI公司批量抢购旧书这一现象?
反映了AI发展对高质量数据的需求和商业竞争中对数据垄断的追求,引发了对数据质量、版权及文化遗产保护等多方面的思考。
简短标题:AI公司为何批量抢购旧书?背后有何秘密?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化
