亚马逊开始买旧书训练 AI:大模型真正缺的,可能已经不是算力了
今天看到一条新闻,Amazon 在大量购买一些稀有、绝版,甚至网上根本找不到电子版的实体书。
这些书被送到专门的处理设施,直接切掉书脊、拆页、高速扫描,数字化之后再用于 AI 相关的数据处理。书基本也就没了。
第一眼看到的时候,我关注的其实不是“Amazon 居然开始拆书”这件事,而是另一个问题:
现在的大模型,是不是真的开始缺数据了?
这里说的“缺”,并不是互联网上没东西可抓了。恰恰相反,现在网上的内容比任何时候都多。
问题是,还能不能找到足够多的、干净的、真正由人产生的数据。
这几年做大模型,最容易拿到的训练数据基本都在公开互联网里。网页、论坛、新闻、论文、GitHub、问答网站,大规模爬取之后清洗、去重、分类,再进入预训练或者后训练流程。
这套方法以前很好用。
但到了现在,有个问题越来越绕不过去:你今天重新抓一遍互联网,里面到底有多少内容已经是模型写的?
博客是 AI 写的,SEO 文章是 AI 批量生成的,论坛回答里也混着 AI,代码仓库里甚至开始出现大量 Copilot、Claude Code 之类辅助生成的代码。
于是会出现一个挺尴尬的情况:
模型正在越来越多地吃自己生产出来的数据。
从训练角度看,这并不是一个特别理想的状态。
因为生成数据当然可以用,甚至很多模型训练本身就会主动使用 synthetic data。但前提是你知道这些数据是怎么来的、质量怎么样、由什么模型生成、经过什么筛选。
最麻烦的是另一种情况:AI 生成内容已经混进公开互联网,你抓数据的时候根本分不出来。
久而久之,训练集里面的人类原始分布会越来越少,模型自己的语言习惯、错误模式和偏差反而可能被一轮轮放大。
这也是为什么 2022 年以前的内容现在反而越来越有价值。
一本 1995 年出版、从来没有电子化的小众专业书,过去看可能只是旧书市场里几十美元的一本书。
但站在模型公司的角度,它有几个很特殊的属性:
它大概率完全由人写成;没有被 ChatGPT 改写过;网上没有重复版本;可能从来没有进入过主流训练集;而且经过出版、编辑和校对,信息密度往往比普通网页高。
这种数据突然就有价值了。
这也是 Amazon 买这些旧书让我觉得很有意思的地方。
我们以前讨论 AI 基础设施,最容易想到的是 GPU、显存、网络、存储、推理成本。
但模型继续往下做,数据本身其实也正在变成一种基础设施。
而且这个资源可能比算力更麻烦。
GPU 不够还能买,至少理论上供应链成熟以后是可以扩的。模型架构也很难形成永久壁垒,今天一家做出来,过一段时间论文、开源实现、工程经验都会慢慢扩散。
但一份别人从来没有拿到过的数据,不一定能复制。
比如企业几十年的内部知识库、医生积累的病例、制造业现场数据、专业领域文档、没有数字化的档案,甚至就是这些从来没有上过互联网的旧书。
这些东西以前可能只是“资料”。
现在开始变成训练资产。
我甚至觉得,接下来模型厂商真正拉开差距的地方,可能越来越不只是模型参数多少、benchmark 高几分,而是谁能拿到更好的数据,以及谁能把自己的数据闭环跑起来。
包括现在大家都在做 Agent,也会碰到类似的问题。
Agent 本身的框架其实越来越容易做,模型 API 也可以买。但真正决定一个 Agent 能不能在某个行业里长期工作的,最后还是它能不能接触到企业真实的数据、流程、反馈和结果。
没有这些东西,换再强的模型,很多时候还是一个“很聪明但不了解业务的人”。
所以回头看 Amazon 拆旧书这件事,我倒不觉得它只是一个猎奇新闻。
它更像是一个信号:
互联网这个曾经几乎免费的 AI 数据矿,正在变得越来越脏,也越来越不够用了。
下一阶段的竞争,很可能会重新回到那些过去大家觉得很传统的东西上——档案、数据库、行业资料、企业内部数据,甚至纸质书。
有时候技术发展挺有意思。
我们花了几十年把所有东西数字化,现在为了训练最新的 AI,又开始回头找那些还没来得及数字化的东西。
更多推荐

所有评论(0)