AI公司为何批量抢购旧书?背后有何秘密?

2026-08-01 21:16:00  阅读 7712 次 评论 0 条
摘要:

多家海外AI公司通过中间商批量抢购2022年之前出版的旧书,扫描内容后销毁实体书,此行为引发广泛关注,背后原因涉及数据质量、商业考量等多方面因素。

核心动因:互联网数据遭“AI污染”,旧书成“纯净语料”最后堡垒

数据质量危机

2022年ChatGPT爆火后,互联网上新增内容超半数由AI生成,这些“AI垃圾内容”充斥网站。若继续用网络数据训练新模型,会导致AI“自产自销”、逻辑混乱甚至模型崩塌。数据质量的下降使得AI公司急需寻找更优质的训练数据来源。

旧书的时间锚点

2022年之前出版的纸质书,其内容全部由人类创作并经过专业校对,未被AI文本污染,是公认的“纯净高质量数据集”。随着公开网络数据被“毒化”,这批旧书成了AI公司维持模型性能的稀缺资源。

操作模式与法律依据:批量扫货、破坏性扫描、“合理使用”的灰色地带

匿名采购流水线

以Anthropic为首的公司通过ISBNdb等数据库服务平台,向二手书商下达千本到百万本不等的匿名订单,不限题材、不问价格,专挑带有国际标准书号(ISBN)的2022年前旧书。这种大规模的采购行为引起了二手书市场的关注。

AI公司为何批量抢购旧书?背后有何秘密?

“切脊-扫描-销毁”流程

为追求效率与低成本,买家采用破坏性扫描——直接切掉书脊,将书页送入高速工业扫描仪,数字化后实体书即被粉碎销毁,数百万册纸质书因此永久消失。这种做法虽然高效,但也引发了对文化遗产保护的担忧。

法院裁定“合法”

美国联邦法院在审理Anthropic版权案时认定,合法购买实体书后,将其一对一转换为数字副本并销毁原书,属于“合理使用”,不构成侵权。这一判例给大规模“焚书”行为提供了法律庇护。

商业考量:规避版权费、构建护城河

绕过高昂版权谈判

正规获取出版社授权流程繁琐、费用高昂。Anthropic曾尝试与出版社洽谈,但高层嫌麻烦而放弃,转而直接买二手书——买断后销毁原件,等于以极低成本获取了海量独家训练素材。这种方式为AI公司节省了大量的版权成本。

打造数据垄断壁垒

扫描后的内容被锁入AI公司私有数据库,公众无法访问。这意味着只有该公司拥有这批“纯净语料”的数字副本,从而在模型训练上形成独家优势,本质是用物理消灭公共知识载体来构建商业护城河。

AI公司批量抢购旧书这一现象,反映了当前AI发展过程中对高质量数据的迫切需求,以及在商业竞争中对数据垄断的追求。这一行为不仅引发了对数据质量和版权的思考,也对文化遗产的保护提出了挑战。随着AI技术的不断发展,如何在满足技术需求的保护好人类的知识遗产,将成为一个重要的课题。

AI公司为何批量抢购旧书?背后有何秘密?

相关问答

AI公司为什么要批量抢购2022年之前出版的旧书?

2022年ChatGPT爆火后,互联网充斥AI生成的低质量内容,污染了训练环境。2022年前的旧书由人类创作,未被AI污染且逻辑严谨,是优质的训练数据。

AI公司获取旧书的操作模式是怎样的?

通过ISBNdb等平台向二手书商下达匿名订单,不限题材价格,专挑2022年前带ISBN的旧书。采用破坏性扫描,切掉书脊扫描后销毁实体书。

美国联邦法院对AI公司购买旧书是如何裁定的?

法院认定合法购买实体书后,将其一对一转换为数字副本并销毁原书,属于“合理使用”,不构成侵权,给相关行为提供了法律庇护。

AI公司批量抢购旧书有哪些商业考量?

一方面可绕过高昂的版权谈判成本,另一方面能打造数据垄断壁垒,将扫描内容锁入私有数据库,形成独家优势。

这种行为对文化遗产保护有何影响?

扫描过程不区分普通书和绝版珍本,稀有书籍可能被拆毁永久消失,且内容进入AI公司私有数据库,公众无法访问,不利于文化遗产传承。

如何看待AI公司批量抢购旧书这一现象?

反映了AI发展对高质量数据的需求和商业竞争中对数据垄断的追求,引发了对数据质量、版权及文化遗产保护等多方面的思考。

本文地址:https://www.caiair.com/post/ai-gongsi-jiushu-xunlian-shuju-530982-151057.html
简短标题:AI公司为何批量抢购旧书?背后有何秘密?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化