当前,在大模型技术生态中,检索增强生成(RAG)无疑是最受关注的前沿方向之一。恰好我近期参与的实习项目深度围绕 RAG 展开,在实践过程中积累了不少技术细节与研究心得,后续会陆续分享一系列干货内容,不仅包含原理拆解,还会附上可直接运行的 “手搓代码”,助力大家从理论到实践全面掌握 RAG。而今天这篇,我们就从最基础的 “技术溯源” 开始,聊聊 RAG 是如何一步步发展至今的。

一、定义

RAG即检索增强生成(Retrieval-Augmented Generation),是一种通过集成外部知识源来增强大型语言模型(LLM)能力的技术范式。它通过在语言模型生成答案之前,先从广泛的文档数据库中检索相关信息,然后利用这些信息来引导生成过程,可提升内容的准确性和相关性,缓解模型幻觉问题,提高知识更新速度,并增强内容生成的可追溯性。

1、 RAG的发展过程如下:

概念提出:RAG的概念首次于2020年被提出。早期研究焦点集中在如何通过预训练模型注入额外知识,以增强语言模型的能力。

Naive RAG 是 RAG 技术的初始形态,其核心流程为索引→检索→生成三阶段线性架构。具体步骤如下:

  1. 索引阶段:将原始文档(如 PDF、HTML)转换为纯文本,按固定长度分割为文档块(Chunk),使用 BM25 或 TF-IDF 等传统检索模型建立倒排索引。
  2. 检索阶段:将用户问题通过关键词匹配从索引中召回 Top-K 文档块,直接拼接后作为上下文输入生成模型。
  3. 生成阶段:采用预训练语言模型(如 T5、GPT),将 “问题 + 检索结果” 作为提示词生成回答,依赖模型自身知识补全信息。

技术局限

语义理解不足:基于关键词匹配的检索无法捕捉语义关联,例如 “自动驾驶事故责任” 可能无法召回 “AI 算法缺陷” 相关文档。

上下文冗余:直接拼接所有检索结果可能引入噪声,导致生成模型注意力分散,例如包含与问题无关的段落。

幻觉问题:当检索结果不完整或模型依赖内部过时知识时,容易生成虚构信息

2、Advanced RAG 阶段(增强优化的检索生成)
  • 语义检索升级:采用 Sentence-BERT、DPR 等模型生成文档与问题的稠密向量,通过余弦相似度匹配提升召回精度。
  • 上下文精细化处理:

滑动窗口索引:将文档分割为重叠的细粒度块(如 200 字 / 块),保留语义连续性。

重排序机制:引入交叉编码器(如 BERT-CrossEncoder)对召回结果重新排序,过滤低相关文档。

上下文压缩:通过摘要模型(如 BART)对检索结果进行摘要,减少冗余信息。

生成控制增强:

提示词工程:设计结构化提示(如 “根据以下资料回答问题:{context}”),强制模型依赖检索内容。

幻觉检测:在生成后加入事实核查模块,对比检索结果与回答的一致性。

3、Modular RAG 阶段(模块化动态架构)

Modular RAG 将 RAG 系统拆解为可插拔的独立模块,支持动态流程编排,核心模块包括:

  • 索引模块:支持层次化索引(如文档→章节→段落三级结构)和知识图谱索引,提升复杂语义关联能力。
  • 预检索模块:
  1. 查询重写:使用 LLM 扩展用户问题(如将 “血糖控制” 扩展为 “饮食、运动、药物三方面的血糖管理方法”。
  2. 多查询扩展:生成多个变体查询并行检索,覆盖语义多样性。
  3. 后检索模块:

迭代检索:根据初步生成结果中的缺失信息触发二次检索,形成 “生成→检索→再生成” 闭环。

结构化解构: 将检索结果解析为结构化数据(如 JSON),便于生成模型精准调用。

编排模块:通过状态机或 LLM 决策动态调整流程,例如根据问题类型选择不同检索策略(技术问题→产品文档,投诉→处理流程)。

多模态支持:整合图像、表格等非结构化数据,例如用 CLIP 模型检索图片,用 Table-BERT 解析表格。

动态路由:基于用户意图(通过意图分类模型)自动选择最佳检索路径,例如法律咨询优先检索法条库,医疗问题优先检索临床指南。

长期记忆:缓存高频检索结果,建立用户专属知识库,实现个性化响应。

二、RAG 架构

为了更直观地呈现RAG(检索增强生成)的全流程,我将以流程图形式展示核心环节,并针对每个节点的常见问题及解决方案进行说明。

2.1 各节点问题与解决方案对比

2.2.1 RAG的分块策略

选择合适的分块策略,是解决RAG实际应用中准确性、召回率与复杂文档解析等痛点最直接有效的方式,也是我们建设RAG系统最关键的一个环节。最常见的RAG分块策略包括:固定大小分块、语义分块、递归分块、基于文档结构的分块、基于LLM的分块。

三、开源化方案对比

以下是当前主流的开源RAG(检索增强生成)方案及其对比分析,涵盖实现方法、技术特点和适用场景。

1. LangChain
  • 文档支持:支持TXT、PDF、CSV、HTML等常见格式,通过UnstructuredFileLoader处理非结构化数据。
  • LLM模型:支持开源模型(如LLaMA、Alpaca)和API模型(如OpenAI、Anthropic),可通过LLMChain灵活调用。
  • 向量化模型:嵌入模型 | LangChain中文网 向量存储 | LangChain中文网
  • 免费选项:HuggingFaceEmbeddings(如Sentence-BERT、BAAI/bge-small-zh-v1.5)。
  • 配置示例:from langchain.embeddings import HuggingFaceEmbeddings。
  • 框架构造:模块化链式结构,通过ConversationalRetrievalChain整合检索与生成。

检索方式:

混合检索:向量检索(FAISS)+关键词检索(BM25),通过逆序位融合(RRF)重排结果。

查询优化:支持子问题分解(如将“比较两框架star数”拆分为两个子查询)。

数据库选型:FAISS、Pinecone、Elasticsearch(开源版)。

2. LlamaIndex
  • 文档支持:支持PDF、DOCX、PPTX、CSV,通过SimpleDirectoryReader批量加载。
  • LLM模型:支持本地模型(如Qwen2.5、Llama2)和API模型(如OpenAI),通过LLMPredictor封装。
  • 向量化模型:

免费选项:BAAI/bge-m3(中英文高效)、MiniLM-L6,可通过VectorStoreIndex配置。

框架构造:以索引为核心,支持树状索引(Tree Index)和知识图谱索引,动态选择检索策略。

检索方式

智能检索:查询引擎(Query Engine)通过子问题分解和查询重写提升召回率。

上下文管理:使用模糊匹配关联生成内容与原始文档,支持引用标注。

数据库选型:FAISS、Qdrant、Pinecone。

3. LightRAG
  • 文档支持:

支持TXT、PDF、DOC、PPT、CSV,通过LLM提取实体和关系构建知识图谱。

  • LLM模型:

支持本地模型(如Ollama的StableLM)和API模型(如GPT-4o-mini),通过ollama_model_complete调用。

  • 向量化模型:

免费选项:NanoVectorDBStorage(轻量级向量数据库)、Sentence-BERT。

框架构造:双层检索架构(低层次实体检索+高层次主题检索),结合图结构与向量表示。

  • 检索方式:

双层检索:低层检索(实体级)与高层检索(主题级)结合,通过混合模式(Hybrid)提升全面性。

增量更新:仅更新变化部分,减少重复计算。

数据库选型:NanoVectorDB、FAISS。

如何学习大模型 AI ?

由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套 AI 大模型突围资料包

  • ✅ 从零到一的 AI 学习路径图
  • ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
  • ✅ 百度/阿里专家闭门录播课
  • ✅ 大模型当下最新行业报告
  • ✅ 真实大厂面试真题
  • ✅ 2025 最新岗位需求图谱

所有资料 ⚡️ ,朋友们如果有需要 《AI大模型入门+进阶学习资源包》下方扫码获取~
在这里插入图片描述

① 全套AI大模型应用开发视频教程

(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)
在这里插入图片描述

② 大模型系统化学习路线

作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!
在这里插入图片描述

③ 大模型学习书籍&文档

学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。
在这里插入图片描述

④ AI大模型最新行业报告

2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。
在这里插入图片描述

⑤ 大模型项目实战&配套源码

学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。
在这里插入图片描述

⑥ 大模型大厂面试真题

面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余

图片

以上资料如何领取?

在这里插入图片描述

为什么大家都在学大模型?

最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!

图片

不出1年,“有AI项目经验”将成为投递简历的门槛。

风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!
在这里插入图片描述
在这里插入图片描述

这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
在这里插入图片描述
在这里插入图片描述

以上全套大模型资料如何领取?

在这里插入图片描述

Logo

分享最新、最前沿的AI大模型技术,吸纳国内前几批AI大模型开发者

更多推荐