本文是 RAG 系列的第 1 篇:不堆术语、不甩公式,5 分钟带你彻底搞懂大模型最重要的"外挂"。

大模型好像什么都懂——直到你问它一个对你真正重要的问题。

不信?找一个关掉联网搜索的 AI 对话工具,做个小实验,问它三个问题:

第一问:“上个月 XX 公司发布的新模型,有什么亮点?”

它多半会告诉你:抱歉,我的知识有截止日期,最近的事我不清楚。

第二问:“我们公司的差旅报销流程是怎样的?”

它要么坦白不知道,要么现场给你编一套——格式规范、条理清晰,唯一的问题是:纯属虚构。

第三问:挑一个你非常熟悉的领域,问一个冷门的专业细节。

你大概率会发现:它答得流利又自信,但关键细节是错的。

这三个问题,正好对应大模型的三个"先天缺陷"。而今天要讲的 RAG,就是眼下业界解决这些缺陷最主流的方案。

一、大模型的三个先天缺陷

1. 知识有"保质期"

大模型的知识全部来自训练数据,而训练有一个明确的截止时间。在那之后世界上发生的事,它一概不知。

有人会问:那重新训练一次不就行了?

不行。训练一次大模型的成本高得惊人(数百万美元只是起步价),不可能为了更新知识天天重训。

2. 不认识"你的"数据

公司的规章制度、产品手册、历史工单,你个人的笔记和资料库——这些私有数据从没出现在模型的训练语料里,它自然一问三不知。

就算你愿意花钱把数据"喂"进模型(也就是微调),也得面对不低的技术门槛,以及敏感数据外流的顾虑。

3. 会一本正经地胡说八道

这是最要命的一条。

大模型的本质,是一台超强的"文字接龙"机器:根据上文,预测下一个最可能出现的词。

注意,是"最可能",不是"最正确"。

它并不真正"知道"事实,只是在生成看起来合理的文字。所以面对没把握的问题,它往往不说"我不知道",而是流畅自信地编一个答案。

这个现象有个专门的名字:幻觉(Hallucination)

二、RAG:让大模型从闭卷考试变成开卷考试

RAG,全称 Retrieval-Augmented Generation,中文叫检索增强生成

名字唬人,原理却可以浓缩成六个字:

先查资料,再回答。

打个比方:

  • 普通的大模型,像一个闭卷考试的学生:全靠脑子里记住的东西答题,没记住的就只能硬编;
  • 用了 RAG 的大模型,则是在开卷考试:先翻资料找到相关章节,再照着资料作答。

所谓"外挂知识库",说的就是这件事——我们不去改动模型本身,而是给它外接一个随时可更新、随时可查阅的资料库。

顺便说一句:你其实每天都在用 RAG。AI 对话工具的"联网搜索"功能,本质上就是把整个互联网当作知识库的 RAG。

三、RAG 是怎么运转的?

一个典型的 RAG 系统,只干三件事:建库、检索、生成

第一步:建库——把资料变成"可搜索"的形态

先把文档(PDF、Word、网页、笔记……)切成一个个小段落,行话叫 Chunk(分块)

再用 Embedding(嵌入) 技术,把每个段落转换成一串数字,也就是"向量"。

你可以把 Embedding 理解成给每段文字生成一个"语义坐标":意思越接近的内容,坐标挨得越近。比如"猫爱吃鱼"和"猫咪喜欢海鲜"的坐标就贴得很近,而它们和"今天股市大涨"离得很远。

所有坐标,统一存进一个专门的仓库——向量数据库

第二步:检索——捞出和问题最相关的段落

用户提问时,系统把问题同样转换成一个"坐标",然后去向量数据库里,找出坐标最接近的那几个段落。

坐标近,就是语义近。捞出来的,自然就是和问题最相关的资料。

第三步:生成——让模型"看着资料"作答

最后,系统把检索到的资料和用户的问题打包发给大模型,相当于对它说:

“请根据以下资料,回答这个问题。”

模型从"凭记忆瞎猜"变成"有据可依"。做得好的 RAG 应用,还会在答案里标注出处,让你能点开原文核对——在法律、医疗这类严肃场景里,这一点是刚需。

整个流程画出来就是:

【提前准备,只做一次】
文档 → 切块 → 向量化 → 存入向量数据库

【每次问答都执行】
用户提问 → 向量化 → 检索最相关段落
        → 问题 + 资料 → 大模型 → 生成回答

四、RAG 已经用在哪儿了?

企业知识库助手:新员工问"年假怎么申请",AI 直接从员工手册里找答案,还附上出处。

智能客服:基于产品文档回答用户问题;文档一更新,客服的"知识"同步更新,不用重新训练任何东西。

专业领域问答:法律条文、医学文献、金融研报——这些对准确性要求极高的场景,"答案可追溯"是硬性要求。

个人第二大脑:把自己的笔记、收藏文章、读书摘录喂进去,得到一个真正"懂你"的问答助手。

五、RAG 是银弹吗?

当然不是。

RAG 的回答质量,高度依赖检索质量:如果检索出来的资料本身不相关、不准确,模型照样答错。老话说得好——Garbage in, garbage out(垃圾进,垃圾出)

文档该切多大一块?中文场景该选哪个 Embedding 模型?怎么让检索又快又准?这些看似不起眼的工程细节,才是一个 RAG 系统能不能真正落地的关键——也正是这个系列接下来要逐一拆解的内容。

写在最后

一分钟回顾今天的要点:

  1. 大模型有三个先天缺陷:知识过时、不懂私有数据、会产生幻觉
  2. RAG 的核心思路是"先查资料,再回答"——把闭卷考试变成开卷考试;
  3. RAG 系统三步走:建库、检索、生成
  4. RAG 不是银弹:检索质量决定回答质量

下期预告:不聊概念,直接动手。《从零搭建你的第一个 RAG 应用》将手把手带你跑通一个属于自己的知识库问答系统,敬请期待。

如果这篇文章帮你搞懂了 RAG,欢迎点赞、在看、转发三连,分享给正在学 AI 的朋友。关注本号,第一时间收到实战教程。

更多推荐