本文基于 CSDN 博主「Bug收容所」的文章《从 LLM 到 Agent Skill:把 AI 的底层概念串起来》进行的学习思考与问答整理。原文链接:从-LLM-到-Agent-Skill-把-AI-底层概念串起来-CSDN博客

前言

最近在读一篇讲 AI 核心概念的文章,把 LLM、Token、Context、Prompt、Tool、MCP、Agent、Agent Skill 这一串概念串了起来。光读还不够,我觉得最好的学习方式是「自问自答」——把每个概念拆成问题,用自己的话讲清楚。

这篇文章就是我的学习笔记。我还琢磨出了一套「旋转餐桌」的比喻体系,用生活场景把所有概念串起来,亲测理解起来快很多。

🎯 一句话总览

先放结论:

LLM 是会生成语言的大脑,Prompt 是任务说明,Context 是它当前能看到的材料,Tool 让它能操作外部世界,MCP 让工具接入标准化,Agent 负责规划和执行,Agent Skill 把一类任务沉淀成可复用的工作方法。

生活化一点说:

LLM 像一个聪明但只坐在房间里的顾问;Tool 给了它手和脚;Agent 让它学会自己拆任务;Skill 则是把它做得好的事情写成标准操作流程(SOP)。

🍽️ 核心比喻:「旋转餐桌」体系

我习惯用比喻来理解抽象概念。这套「旋转餐桌」的类比是我自己想出来的,帮我把整组概念全串通了:

表格

AI 概念 旋转餐桌比喻 一句话解释
LLM 食客的大脑 会思考、会说话,但手被绑着
Token 每一口的大小 决定吃的速度和成本
Context 桌上的菜 食客当前能看到的全部信息
Context Window 桌面大小 一次能摆多少菜
System Prompt 永远在对面的主菜 核心规则,不会被转走
User Prompt 食客刚点的菜 当前的问题/需求
RAG / 知识库 后厨菜单 不用全摆上桌,需要再端上来
Tool 刀叉筷勺 让食客能"动手"而不只是"动口"
MCP 通用餐具接口 所有工具统一标准,即插即用
Agent 食客本人 自己规划、自己动手、自己调整
Agent Skill 用餐礼仪 把经验沉淀成可复用的规范

演进路线:

plaintext

9

1

2

大脑(LLM)→ 有菜吃(Context + Prompt)→ 有餐具(Tool)→ 餐具标准化(MCP)→ 会自己点菜(Agent)→ 懂餐桌礼仪(Skill)

后面的每个问答,你都可以把这个比喻翻出来对照着看。

❓ 问答环节:十个问题搞懂 AI 核心概念

Q1:Context 到底是什么?是模型加工出来的,还是人和模型交流产生的?

先说结论:Context 是系统组装的、喂给模型的全部输入材料,不是模型自己"想"出来的。

模型本身没有主动记忆。它不会"记住"昨天跟你聊了什么,也不会自己去检索知识。每次你发一条消息,系统会把一堆东西打包拼接成一段长文本,然后整段喂给模型——这段长文本就是 Context。

Context 里通常包含:

  • System Prompt(角色、规则、风格)
  • 历史对话记录
  • 检索到的文档/知识库片段(RAG)
  • 工具返回的结果
  • 用户当前的问题

模型拿到这段文本后,做的事情只有一个——预测下一个 Token 是什么。它不会区分"这是系统提示""这是之前的对话",在它眼里全都是同一段文本。

所以准确说,Context 是「系统组装 + 对话累积 + 外部检索」的混合体,模型只是被动接收和处理。

Q2:Context 能持续多久?会不会"失忆"?

它不按时间算,按 Token 量算。超出窗口就会被"挤掉"。

很多人以为"我三天前聊的它还记得吗"——其实跟时间没关系,跟上下文窗口大小和对话长度有关系。

假设模型窗口是 128K Token,聊到第 130K 的时候就超了,怎么办?常见策略有几种:

表格

策略 做法 影响
截断(Truncation) 直接丢掉最早的几轮对话 最早的信息"失忆"
摘要(Summarization) 把前面的对话压缩成摘要 细节丢失,只剩要点
滑动窗口 只保留最近 N 轮 老信息直接没了
RAG + 记忆系统 重要信息存到外部,需要时再检索 不会真"忘",但得检索得到才行

所以"持续多久"的答案是:只要还在窗口里就一直在;窗口满了,早的就没了。

Q3:Context 的语义和准确度靠什么维持?

Context 的质量 = 模型输出质量的天花板。主要靠四层保障:

第一层:输入质量(Garbage In, Garbage Out)

  • Context 里的信息本身准不准确?
  • 信息相不相关?无关内容会干扰判断。
  • 排序和结构有没有逻辑?(开头和结尾效果更好,中间容易丢)

第二层:模型本身的理解能力

  • 参数量大的模型对长上下文的理解能力更强。
  • 但即使是最好的模型,上下文越长,中间部分的信息召回率也会下降("Lost in the Middle"现象)。

第三层:应用层的工程设计

  • RAG 检索质量:找得准不准、全不全。
  • Prompt 工程:告诉模型"只根据给定材料回答""不知道就说不知道"。
  • 记忆系统:把重要信息结构化存储,而不是全靠对话堆着。

第四层:多轮校验

  • 让模型自己检查、交叉验证。
  • 工具调用结果的二次确认、事实核查。

Q4:Context 是模型返回的内容吗?人的输入占多少?

正好反过来!Context 里装的是「给模型看的东西」,不是「模型吐出来的东西」。

你可以把模型想象成一个只会"读题→答题"的考生:

plaintext

9

1

2

3

4

5

6

7

8

考卷(Context) 考生(LLM) 答卷(Output)

┌──────────────┐ ┌──────────────┐

│ 考生须知 │ → 读题,预测下一个字 → │ 我的答案是... │

│ 题目条件 │ │ 因为... │

│ 之前几题的草稿 │ └──────────────┘

│ 你现在的问题 │

└──────────────┘

人的输入当然在 Context 里,而且是很重要的一部分。没有你的问题,模型根本不知道要答什么。

简单说:Context = 输入侧(给模型看的),Output = 输出侧(模型吐的)。

Q5:Context 太大被截断后,会不会彻底影响模型判断?

会影响,但不是"彻底崩盘",而是有层次的。

想象你看一本 500 页的书,但桌子只能摊开 100 页。影响多大取决于什么内容被收走了:

  • 被收走的是前言?问题不大。
  • 被收走的是关键人物介绍?后面可能看不懂。
  • 被收走的是案件真相?侦探小说白看了。

最危险的场景是:关键约束/背景信息被挤掉了。 比如你前面说了一句"用户是盲人,必须支持读屏",聊了几十轮之后这句话被挤出去了,模型后面出的方案可能完全偏离方向。

但也不会彻底崩,因为有几道防线:

  1. System Prompt 永远在最前面——核心规则不会丢。
  2. 重要的东西会被反复提到——你每次提问都在强调目标,等于不断刷新。
  3. 应用层有记忆和检索系统——正经产品不会纯靠对话窗口记东西。
  4. 主题连续性——即使细节丢了,对话的大方向通常还在。

实用建议: 关键信息定期重申、重要内容存文件、善用"总结一下刚才的结论"、复杂任务分段做。

Q6:Prompt 有几种?我平时输入的是哪一种?

Prompt 分两种:System Prompt 和 User Prompt。你平时输入的、能看到的是 User Prompt。

打个比方:你去餐厅吃饭。

  • User Prompt = 你点的菜("来份宫保鸡丁,少辣多花生")
  • System Prompt = 后厨的操作规范("食材必须新鲜、出餐不超15分钟、禁止转基因油")

表格

维度 System Prompt User Prompt
谁写的 开发者/平台 用户
你能看到吗 通常看不到 当然能
优先级 更高(规则 > 需求) 次高
每轮变不变 基本不变 每轮都不一样

System Prompt 才是真正定义 AI 行为的那道"护栏"——同样的底层模型,配上不同的 System Prompt,表现可以天差地别。这也是为什么不同 AI 产品的"性格"不一样。

Q7:Tool 是什么?为什么说 Tool 是革命性的?

Tool 给了 LLM "手",让它从"只会说"变成"真能做"。

没有 Tool 的 LLM 就是一个手被绑住的食客——能描述菜的味道,但碰不到菜。你问它"窗外天气怎么样",它只能凭印象猜;你让它"读一下这个文件",它会说"抱歉我不能访问文件系统"。

Tool 就是给食客松绑,递上一副刀叉:

  • 搜索工具 = 能伸到餐厅外的"长筷子"
  • 文件读取工具 = "开罐器"
  • 代码执行工具 = 一套厨房用具,不仅能吃还能自己炒菜
  • 浏览器工具 = 一扇窗,可以看看外面发生了什么

从"凭印象回答"到"动手查了再回答"——这是质的区别。

Q8:MCP 是什么?不就是个协议吗,有那么重要?

MCP(Model Context Protocol)就是 AI 界的 USB 接口标准。

很多人听到"协议"就觉得抽象,其实 MCP 只规定了三件事:

  1. 工具发现——工具怎么介绍自己(我叫什么、能干什么、要什么参数)
  2. 工具调用——Agent 怎么调用工具(统一的请求格式)
  3. 结果返回——工具怎么回话(统一的响应格式)

为什么要搞这个?因为没有标准的时候太乱了:

  • 查天气是 REST API,参数叫 city
  • 查股票是 SDK,参数叫 symbol
  • 发邮件是 SMTP,参数叫 to
  • 每个工具的接入方式、鉴权、格式全不一样

有了 MCP 之后,工具接入就像插 U 盘——做一次标准适配,所有支持 MCP 的 AI 都能用。做工具的人不用给每家 AI 单独适配,做 AI 的人不用自己一个个接工具,双赢。

Q9:LLM 和 Agent 最核心的区别是什么?

LLM 是大脑,Agent 是「大脑 + 手 + 自主规划能力」的完整系统。

表格

概念 餐桌比喻 能做什么
LLM 食客的大脑 只会"想"和"说"
有 Tool 的 LLM 有手有脑子的食客 能夹菜,但你得告诉它夹哪盘
Agent 完整的人 自己决定先吃什么、后吃什么、不够了再叫什么

关键区别是自主性。普通聊天机器人是"你点一下,它动一下";Agent 是"你给它一个目标,它自己想办法达成"。

一个完整的 Agent 执行流程:

plaintext

9

1

2

目标 → 规划 → 调用工具 → 观察结果 → 调整 → 再行动 → ... → 完成

这就是"计划→行动→观察→修正"的闭环。

Q10:Agent Skill 是什么?有必要吗?

Agent Skill 就是 Agent 的 SOP 手册,把一类任务的最佳实践沉淀下来。

用旋转餐桌的比喻:Skill 就是餐桌礼仪。

  • "先喝汤,再吃菜,最后上主食" → "先分析需求,再查资料,再写初稿,最后校对"
  • "吃西餐左手叉右手刀" → "写代码先写测试用例,再写实现"
  • "不同场合不同礼仪" → "不同任务有不同 Skill"

没有 Skill 行不行?行,就像不懂礼仪也能吃饭。但:

  • 容易出糗(犯低级错误)
  • 效率低(每次都想半天)
  • 不稳定(有时候好有时候糟)
  • 不可复制(这次好,下次不一定)

Skill 的意义,就是把"偶尔做好"变成"每次都做好"。

🧩 一张图串起所有概念

plaintext

99

1

2

3

4

5

6

7

8

9

10

11

12

食客本人(Agent)

├── 大脑(LLM):负责思考和生成

├── 面前的旋转餐桌(Context):

│ ├── 永远在对面的主菜(System Prompt)

│ ├── 各种菜品(历史对话、资料、工具返回结果)

│ └── 刚点的菜(User Prompt)

├── 桌面大小(Context Window):决定能同时放多少菜

├── 后厨菜单(RAG/知识库):不用全摆上桌,需要再端

├── 手里的餐具(Tool):刀叉筷勺,各有用途

├── 餐具标准(MCP):统一接口,即插即用

└── 用餐礼仪(Skill):经验沉淀的固定流程

🧠 文末自测:你掌握了吗?

来做 8 道题,检验一下理解程度。答案在最后。

题目

  1. "Context Window" 指的是什么?

    • A. 模型一次能生成的最大字数
    • B. 模型一次能处理的最大 Token 量(能"看到"的信息总量)
    • C. 模型能记住多少天前的对话
    • D. 模型训练时用了多少数据

  2. System Prompt 和 User Prompt 的关系,以下哪个说法最准确?

    • A. 两者是一回事,只是叫法不同
    • B. User Prompt 是用户写的,优先级更高
    • C. System Prompt 是开发者设定的规则,通常优先级更高
    • D. System Prompt 只在第一次对话时生效

  3. 用"旋转餐桌"的比喻,搜索工具最像什么?

    • A. 一双很长的筷子,能伸到餐厅外去"夹"外面的信息
    • B. 一个大碗,能装很多菜
    • C. 一张更大的桌子,能放下更多菜
    • D. 服务员,专门负责端菜上桌

  4. LLM 和 Agent 最核心的区别是什么?

    • A. Agent 用的模型更大更聪明
    • B. LLM 只能生成文本,Agent 能自主规划、调用工具、形成执行闭环
    • C. Agent 比 LLM 更快
    • D. LLM 是免费的,Agent 是付费的

  5. 为什么说"长上下文不一定越好"?以下哪个原因不对

    • A. 信息太多,模型容易抓错重点(Lost in the Middle)
    • B. 上下文越长,成本越高(按 Token 计费)
    • C. 长上下文的模型推理速度慢
    • D. 上下文越长,模型的语言能力越差

  6. MCP(Model Context Protocol)的主要作用是什么?

    • A. 让模型变得更聪明
    • B. 提供一种标准化的工具接入协议,让工具可以即插即用
    • C. 扩大模型的上下文窗口
    • D. 让模型训练更快

  7. 当对话太长导致 Context 被截断时,以下哪种策略对保持对话质量最有效

    • A. 什么都不做,模型自己会想起来
    • B. 把前面的对话压缩成摘要(Summary),腾出空间
    • C. 把重要信息结构化存储,需要时再检索(RAG + 记忆系统)
    • D. 每次都重新说一遍所有背景

  8. 以下是 AI 能力演进的几个阶段,按从底层到上层的顺序排列,正确的是?

    • A. LLM → Tool → Prompt → Agent → MCP → Skill
    • B. LLM → Prompt + Context → Tool → MCP → Agent → Skill
    • C. Agent → LLM → Tool → Skill → MCP → Context
    • D. Tool → LLM → Context → Prompt → Skill → Agent → MCP

答案

  1. B — Context Window 是能处理的总量(输入+输出),不是只指输出。
  2. C — System Prompt 是规则,优先级高于用户需求。
  3. A — 搜索工具就是那双能伸到外面的"长筷子"。
  4. B — 核心区别是自主性和执行闭环。
  5. D — 注意题目问的是"不对"的原因。长上下文不会让模型语言能力变差,语言能力是模型本身的素质。
  6. B — MCP = 工具接入的 USB 标准。
  7. C — RAG + 记忆系统是最优解,把重要信息结构化存储,按需检索。
  8. B — 从"会说话"到"有经验"的完整演进路线。

🌟 最后:我的理解框架

可以把这条路线压缩成一个递进关系:

plaintext

9

1

2

3

LLM → Prompt + Context → Tool → MCP → Agent → Agent Skill

会说话 → 看得懂任务 → 能使用工具 → 工具接入标准化 → 能自己推进任务 → 把经验沉淀成技能

AI 的进化不只是模型参数变大,而是 「模型 + 上下文 + 工具 + 工作流 + 技能沉淀」 一起组成新的软件形态。

以后我们评价一个 AI 产品,可能不能只问"它用的是什么模型",还要问:

  • 它能看到什么上下文?
  • 它能调用哪些工具?
  • 它有没有可靠的执行闭环?
  • 它能不能把经验沉淀成可复用的 Skill?

模型是起点,但不是终点。真正改变工作方式的,往往是模型和工具、流程、经验结合起来之后形成的系统能力。

参考

标签: #LLM #Agent #Prompt #Context #MCP #AgentSkill #AI入门 #学习笔记

Logo

一座年轻的奋斗人之城,一个温馨的开发者之家。在这里,代码改变人生,开发创造未来!

更多推荐