前沿研究TechCrunch

research · 海外 AI 灵感

亚马逊收购绝版书破解AI训练数据荒

亚马逊大量收购稀有书籍,拆解扫描用于AI训练,解决高质量文本数据枯竭问题。

发布于 2026年8月17日来源 TechCrunch查看原文

为什么有市场空间

国内AI公司同样面临高质量中文数据短缺,且中文书籍数字化程度低,存在大量未上网的绝版书和文献。与出版社合作数字化,或开发版权清晰的文本获取方案,可缓解数据荒,同时保护知识产权,符合国家鼓励AI发展与版权保护并重的政策导向。

01

背景故事

随着AI大模型训练对高质量文本的需求激增,互联网上的可用数据几乎被消耗殆尽,且存在大量AI生成内容导致模型崩溃的风险。亚马逊曾以在线书店起家,深知稀有书籍的价值,尤其是那些绝版或无法在线上找到的作品,它们成为独特且纯净的训练数据源。为了获取这些内容,亚马逊通过商业渠道大量收购,甚至不惜破坏书籍装帧进行扫描,这一做法虽引发争议,但也凸显了数据稀缺的紧迫性。

02

落地效果

据404 Media报道,亚马逊已在拉斯维加斯建立名为VGT3的设施,专门处理这些书籍,其标识为恐龙抱书图案。亚马逊确认购买书籍用于改善产品和服务,但具体训练数据量和模型效果尚未公开落地数据。

栏目说明

本栏目内容由 AI 对海外科技媒体公开报道进行中文改写,并经创新性筛选、国内相关性门控与 MVP 可行性分析生成。 金点子用于灵感参考,不构成投资或创业建议。点击「查看原文」可追溯出处。