前沿研究TechCrunch

research · 海外 AI 灵感

扫描绝版书脊:亚马逊用实体书训练AI防模型崩溃

亚马逊购买稀有书籍,切断书脊扫描内容,用于训练AI模型,以获取纯净的预2022年文本数据。

发布于 2026年8月17日来源 TechCrunch查看原文

为什么有市场空间

国内大模型训练同样面临数据瓶颈,尤其需要高质量中文语料。古籍、地方志、内部刊物等稀缺文本未被充分数字化,类似模式可帮助获取独特数据。此外,国内版权环境复杂,但商业采购方式可规避部分风险,同时符合AI发展政策对高质量数据的需求。

01

背景故事

随着大语言模型训练数据日益枯竭,互联网上的文本已被大量摄取,且充斥AI生成内容,导致模型可能发生'模型崩溃',质量下降。亚马逊作为曾经的在线书商,利用其图书采购渠道,大量购买稀有书籍,尤其是绝版或无法在线获取的文本,通过物理扫描将其转化为训练数据。这些书籍因出版时间早于2022年,确保内容非AI生成,为模型提供高质量、纯净的语料。此举虽引发争议,但揭示了AI训练数据来源的新思路。

02

落地效果

据404 Media报道,亚马逊通过商业渠道购买稀有书籍,在拉斯维加斯的VGT3设施进行扫描。尚未公开具体用户量或营收数据。

栏目说明

本栏目内容由 AI 对海外科技媒体公开报道进行中文改写,并经创新性筛选、国内相关性门控与 MVP 可行性分析生成。 金点子用于灵感参考,不构成投资或创业建议。点击「查看原文」可追溯出处。