Signal YCurated AI News
更新于 8/20 09:5261 个信源

靠卖书起家的亚马逊,正在销毁稀有文本以训练 AI

通用 AI8/18 00:38TechCrunch AI2 个来源报道查看原文 ↗
摘要

报道称,亚马逊为训练大模型而销毁稀有文本;因为这些模型已充分学习网上公开语料,线下稀缺书籍成为新的关键训练数据。

核心要点
  • 亚马逊以“销毁”这一不可逆方式获取稀有书籍文本用于 AI 训练,与其卖书起家的历史形成强烈反差。
  • 稀有书籍的训练价值在于其包含互联网上不存在的独特内容,能弥补公开语料的空白。
  • 该做法意味着主流大模型已基本耗尽可公开获取的在线文本,训练数据来源正从线上转向线下稀缺资源。
  • 销毁稀有文献涉及档案保存、版权和文化遗产保护等问题,可能引发外部争议。
  • 这一事件显示高质量私有语料的战略价值正在上升,掌握稀缺资料者有望获得更强议价权。
原文佐证
  • Rare books are incredibly valuable for training LLMs, since these models have already trained on whatever's available online.
AI 洞察
这起事件折射出大模型训练的“数据天花板”已经到来:当在线公开语料被充分吸收,线下稀有文献便成了新的数据边疆。亚马逊愿意以破坏性方式获取数据,说明语料资源的战略价值急剧攀升,未来图书馆、档案馆和版权方的议价能力将显著增强。AI 公司之间的竞争也可能从模型规模转向数据来源的合法性、可持续性与稀缺性。