现在技术发展得太快了!!
整理一下我理解的新技术:
Agent:自动调用工具的机器人
skills:是一份精心编写的提示词说明书,详细教导AI完成一件具体事务的步骤、可用资源和判断标准。例如,“查天气”Skill会告诉AI:在用户询问天气时,应调用哪个API、如何解析地点、结果如何格式化回复。【一份提前写好的提示词(提示词脚本,说明书)】

openclaw:工作模式:绝大多数时候,AI处于“调用工具→自我检查结果→再调用工具”的循环。
工具挑选的对不对、对执行结果判断得准不准都要看基础模型的实力

【然后一顿操作猛如虎,token账单把人吓哭】

技术栈:
基础模型:权衡性能与价格后接入 MiniMax M2.5(因为minimax在头部开源模型里,token最便宜)
核心工具(Actions):权限极高,可执行终端命令(ClaudeCode精神的延续)。

Vibe coding

vibe coding就是通过对话让AI帮你写代码做产品

基础部分:

概念整理自B站 【闪客】一口气拆穿Skill/MCP/RAG/Agent/OpenClaw底层逻辑

LLM :

具备大规模参数的语言模型被称为大语言模型(Large Language Model, LLM)。
核心能力:本质为文字接龙(Text Continuation),即根据上文预测并输出下一个字符序列。

蒸馏

1,知识蒸馏:通过较大的教师模型训练出较小的学生模型,此时的学习目标是softmax之后的logits
2.现阶段延伸:一个模型的训练数据中使用了另一个模型中的输出数据。用自家的大模型蒸馏出不同尺寸的小模型以满足不同需求

prompt

Prompt(提示词)的引入
定义:用户与模型每次交互的输入内容被定义为Prompt。

结构分解:

  • Context(上下文):包含背景信息、对话历史等辅助内容。
  • Instruction(指令):明确的任务指示。
  • 功能:通过结构化Prompt,引导模型生成符合预期的输出。

Memory(记忆)机制
原理:将历史对话记录作为Context的一部分,伪装成多人对话场景,使模型具备“记忆”能力。
优化:利用模型自身对记忆内容进行总结压缩,以减少Context长度,降低Token消耗。

Agent

定义:该代理程序被称为Agent,其本质是封装了特定逻辑的程序,早期实现可能仅通过Prompt扩展实现。【能操纵工具的智能】

检索增强生成(RAG)

定义:通过向量数据库进行语义检索,将本地文档或数据库中的相关信息注入Context,以增强模型生成的准确性。
技术归属:RAG属于外部信息获取能力的一种,与Web Search同属模型参数外的数据补充手段。

Function Calling(函数调用)

定义:约定LLM以特定结构化格式(如JSON)回复,以便Agent程序解析并执行工具调用。
本质:一种交互协议,类似于前后端接口约定,用于规范LLM的输出格式。

模型上下文协议(MCP)

背景:工具实现若与Agent主程序耦合,扩展性差。
定义:**MCP(Model Context Protocol)**是一套约定规范,用于Agent发现和调用独立的工具服务。
在这里插入图片描述
架构角色:MCP服务作为工具提供方,Agent作为调度中心,LLM作为决策者,形成分层协作架构。

Skill(技能)

设计思路:
预设统一说明文件(如skill.md),描述任务流程及工具选择逻辑。
Agent在执行前读取该文件,根据语义灵活调用对应脚本。
定义:Skill是Agent的技能模块,本质是Prompt加载器与可执行脚本的集合。
定位:介于刚性工作流与完全自主Agent之间的折中方案,兼顾灵活性与可控性。

在这里插入图片描述

从刚性到柔性的技术谱系

技术形态灵活性稳定性适用场景
LangChain(编程)程序员,需高度可控
Workflow(低代码)非程序员,流程固定
Skill(提示词+脚本)中高普通用户,需一定灵活性
纯Agent(自主决策)复杂动态场景,需强适应性

agent 框架解决了封装LLM,管理上下文,增强toolcall的能力以获取各种外部知识,普通人不用直接使用大模型,而是使用agent

RAG

RAG (Retrieval Augmented Generation) 的核心思想

RAG 旨在解决大模型处理长文档时面临的挑战,其核心在于:在将问题提交给大模型之前,仅从长文档中检索并提取与问题最相关的内容片段,然后将这些相关片段连同用户问题一同提供给大模型,作为其生成回答的上下文。

Embedding 模型:判断文本相关性的关键
定义与功能
Embedding 模型是一种特殊的神经网络模型,其输入是一段文本(可以是句子或段落),输出是一个固定长度的数值数组(也称为向量或竖组)。

RAG 的工作流程

1.文档预处理阶段:
在用户提问之前,需对目标文档进行一次性处理:
(1)分块 (Chunking):
将整个长文档切分成多个小片段。
切片方法:按字数、按段落、按句子,或采用更复杂的语义分块算法。
专业术语:chunking。
(2)Embedding 生成:
对每个切分后的小片段,使用 Embedding 模型生成对应的固定长度向量。
(3)向量存储与关联:

  • 将每个生成的向量与其原始文本片段的对应关系保存起来。
  • 向量数据库:专门设计用于存储和检索向量数据,能够高效地查找与输入向量距离最近的数据。这与传统数据库根据精确数值查找记录的模式不同。
  • 常见向量数据库:Pinecone, ChromaDB, 以及 PostgreSQL 配合 PG Vector 插件等。
  1. 用户查询阶段
    当用户提出问题时,RAG 系统执行以下步骤:
    (1)问题 Embedding:
    使用与文档预处理时相同的 Embedding 模型,将用户问题转化为一个向量。
    (2)向量检索:
    将问题向量输入到向量数据库中。
    向量数据库根据距离算法(如余弦相似度)查找与问题向量距离最近的几段文档片段。
    (3)上下文构建与提交:
    将检索到的
    相关文档片段作为上下文
    。将此上下文与用户的原始问题一同发送给大语言模型。
    大语言模型接收到的是强相关内容,从而降低“幻觉”风险,提高回答的准确性。

GraphRAG

RAG存在的问题:
(1)全局问题与局部片段的匹配度太低。——传统RAG的问题
(2)切太大容易漏掉细节,切太小容易失去语义间的联系——这个矛盾就是传统RAG不准确的根源之一 。

知识图谱(Knowledge Graph)被用来解决这个问题,他既不漏掉细节,又保留语义结构。

LPG

图结构LPG(Labeled Property Graph)实体和关系都可以带属性。

利用大模型prompt代替繁琐复杂的知识图谱生成算法
步骤1. Named Entity Recognition 识别实体类型
步骤2. Relation Extraction 识别实体间的关系

GraphRAG通过解析LLM返回的结构化文本,生成了知识图谱。

Data Gleaning

LLM生成完一个知识图谱后,GraphRAG会将该知识图谱连同AI再发送给LLM一次,让其补充信息直至LLM返回不存在任何要补充的信息了 。
在所有的片段都被处理完后,GraphRAG会把所有名字相同的实体进行合并,最后并成一个完整的知识图谱。

GraphRAG会一直维持原文和知识图谱之间的关系,这在其的查询过程中会用到。

莱顿社区检测法:

可以理解为子图优化问题,其把图中边比较密集的节点合并为一个整体,同时会让LLM对每个子图生成一个更高级的总结性描述。LLM在总结时不仅会总结信息,还会推理出额外的逻辑信息。
合并之后的每个节点都代表了原图中的一个和局部信息块,这个过程一层层向上,最终形成一个知识图谱的层级结构,结构越往上,知识就越抽象、越精炼;结构越往下,越接近原文,越具体细节。
在这里插入图片描述
查询时和一般的RAG差不多,将问题也embedding,将其和知识图谱匹配。匹配的过程比较灵活,可以查询知识图谱的某一层、某几层或者是全文。

Local Search

先从最底层的知识图谱里找出和问题最接近的实体,因为GraphRAG会维护知识图谱与原文的映射关系,因此可以反向查出点和边是由那些原文生成的;以及这些点和边出现在哪些上层的图谱结构里;他们相邻的其他点和边都是什么。
接着,GraphRAG会把找到的所有点和边的总结性描述以及他们关联的原文片段,再加上用户提出的问题,一起打包送入LLM。因此,无论问的是高层次的抽象问题还是某段原文的细节性问题,相关信息都会被一并带上。
因为local search是从最底层的知识图谱开始查的,因此擅长处理细节丰富,定位准确的问题。

Global Search

则是从知识图谱的高层开始查起,逐一向下追溯。
因此,比local search更适合回答抽象一点,全局性更强的问题

GraphRAG的所有过程都离不开LLM的参与。

更多推荐