提高模型准确率依靠模型微调不是特别合适
因为模型微调需要高质量数据,因此优化模型输出不是特别适合,相对而言RAG(结合外部知识库动态补充模型知识)就比较合适了;

模型微调:
1、知识更新成本高、周期长:若知识库新增内容,需要重新收集标注数据、重新训练模型,迭代一次通常需要数天到数周。
2、存在知识固化问题:微调后的模型只能掌握训练数据中的知识,无法实时获取最新信息(如政策更新、产品迭代)。
3、适合知识相对稳定的场景(如固定流程的客服问答、专业领域的标准化知识)
4、若训练数据覆盖全面,回答的专业性和一致性较高;但如果数据存在偏差或覆盖不全,模型仍会产生幻觉(通过统计泛化出答案),且幻觉难以追溯
5、擅长复杂任务范式的学习,如特定的对话风格、多轮交互逻辑、格式输出要求(如生成报告、代码、结构化表单)

RAG检索增强生成:
1、知识更新灵活高效:只需将新文档加入知识库并更新索引,模型即可立即检索到新内容,迭代周期可缩短至分钟级。
2、支持实时动态知识:可对接数据库、API 等动态数据源,适合需要获取实时信息的场景(如电商商品信息、金融行情、企业内部公告)。
3、适合知识频繁迭代的智能问答机器人(如产品客服、企业内部助手)
4、回答基于检索到的真实数据源,可有效降低幻觉率,且支持溯源(标注回答引用的文档来源),适合对准确性要求高的场景(如法律、医疗、企业合规问答)
5、擅长知识密集型的问答任务,但对复杂任务范式的适配能力较弱,需要结合提示词工程或微调来优化。

RAG的优势:成本低(不需要额外的算力进行训练)、解决幻觉(基于提供的文本知识进行回答)、知识更新(可以随时更新知识库内容)、领域定制(可以为它提供特定的领域的专业知识)、提高答案可解释性(可以知道答案是基于哪些原始资料得出的)

RAG步骤:分片、检索、召回、重排、生成;
检索:回答问题之前不直接回答,而是查找一些参考答案,输出top-N

向量数据库:除了存储之外,还会通过各种巧妙的数据结构(图、树、哈希表等)和索引策略,可以加速查找,这个功能是自带的,但是会缺少精度但是这个精度是可以接受的,主流开源可用向量数据库:ChromaDB

RNN的缺点:时效性(只有第一个处理结束才可以处理第二个…),质量低(等处理最后一个的时候可能第一个的内容已经忘记,而且经过处理有可能最原始的第一个的内容可能被强化也可能被淡化);所以引入了Self-Attention(自注意力机制),不需要等待第一个处理完成后才可以生成第二个,每一个都可以并行处理而且第二个可以直接读取第一个的原始内容,在速度以及质量上更加可靠;
在这里插入图片描述在这里插入图片描述
RNN的特点:
1.顺序处理:信息从左到右逐个传递,
2.局部依赖:右边的每圆圈,接受上一个圆圈的输出,和本次输入的x3.信息衰减:最右边的圆圈,可能衰减最左边圆圈的输出
4.最大路径长度:(序列中任意两个位置信息传递要警告的最大部署)因顺序关系,最左到最右的等于序列长度-1,0(n-1),因为1是常数,可以看作为0(),即最大路径长和序列长度成正比

Self-Attention特点:
1.并行处理:每个圆圈可以同时接受输入信息
2.全局依赖:每个圆圈同时关注每一个位置的信息
3.最大路径长度:因为全局依赖,每位置的信息和和其他信息可以直接传递,即最大路径长恒定为1:0(1)

Transformer 架构:
是一种基于 自注意力机制(Self-Attention) 的深度学习模型架构,主要由编码器和解码器组成
理解意思:编码器(ENCODER),BERT代表
生成目标文本:解码器 (DECODER),CHATGPT代表
多轮对话也是基于Transformer,自动记住前面的内容,为了让LLM记住之前的对话内容,实现多轮对话,需要维护messages列表:每次对话轮都将用户的消息和AI助手的回复追加到messages列表中

更多推荐