从 LLM 到 Agent Skill:一篇问答式学习笔记
本文基于 CSDN 博主「Bug收容所」的文章《从 LLM 到 Agent Skill:把 AI 的底层概念串起来》进行的学习思考与问答整理。原文链接:从-LLM-到-Agent-Skill-把-AI-底层概念串起来-CSDN博客
前言
最近在读一篇讲 AI 核心概念的文章,把 LLM、Token、Context、Prompt、Tool、MCP、Agent、Agent Skill 这一串概念串了起来。光读还不够,我觉得最好的学习方式是「自问自答」——把每个概念拆成问题,用自己的话讲清楚。
这篇文章就是我的学习笔记。我还琢磨出了一套「旋转餐桌」的比喻体系,用生活场景把所有概念串起来,亲测理解起来快很多。
🎯 一句话总览
先放结论:
LLM 是会生成语言的大脑,Prompt 是任务说明,Context 是它当前能看到的材料,Tool 让它能操作外部世界,MCP 让工具接入标准化,Agent 负责规划和执行,Agent Skill 把一类任务沉淀成可复用的工作方法。
生活化一点说:
LLM 像一个聪明但只坐在房间里的顾问;Tool 给了它手和脚;Agent 让它学会自己拆任务;Skill 则是把它做得好的事情写成标准操作流程(SOP)。
🍽️ 核心比喻:「旋转餐桌」体系
我习惯用比喻来理解抽象概念。这套「旋转餐桌」的类比是我自己想出来的,帮我把整组概念全串通了:
表格
| AI 概念 | 旋转餐桌比喻 | 一句话解释 |
|---|---|---|
| LLM | 食客的大脑 | 会思考、会说话,但手被绑着 |
| Token | 每一口的大小 | 决定吃的速度和成本 |
| Context | 桌上的菜 | 食客当前能看到的全部信息 |
| Context Window | 桌面大小 | 一次能摆多少菜 |
| System Prompt | 永远在对面的主菜 | 核心规则,不会被转走 |
| User Prompt | 食客刚点的菜 | 当前的问题/需求 |
| RAG / 知识库 | 后厨菜单 | 不用全摆上桌,需要再端上来 |
| Tool | 刀叉筷勺 | 让食客能"动手"而不只是"动口" |
| MCP | 通用餐具接口 | 所有工具统一标准,即插即用 |
| Agent | 食客本人 | 自己规划、自己动手、自己调整 |
| Agent Skill | 用餐礼仪 | 把经验沉淀成可复用的规范 |
演进路线:
plaintext
9
1
2
大脑(LLM)→ 有菜吃(Context + Prompt)→ 有餐具(Tool)→ 餐具标准化(MCP)→ 会自己点菜(Agent)→ 懂餐桌礼仪(Skill)
后面的每个问答,你都可以把这个比喻翻出来对照着看。
❓ 问答环节:十个问题搞懂 AI 核心概念
Q1:Context 到底是什么?是模型加工出来的,还是人和模型交流产生的?
先说结论:Context 是系统组装的、喂给模型的全部输入材料,不是模型自己"想"出来的。
模型本身没有主动记忆。它不会"记住"昨天跟你聊了什么,也不会自己去检索知识。每次你发一条消息,系统会把一堆东西打包拼接成一段长文本,然后整段喂给模型——这段长文本就是 Context。
Context 里通常包含:
- System Prompt(角色、规则、风格)
- 历史对话记录
- 检索到的文档/知识库片段(RAG)
- 工具返回的结果
- 用户当前的问题
模型拿到这段文本后,做的事情只有一个——预测下一个 Token 是什么。它不会区分"这是系统提示""这是之前的对话",在它眼里全都是同一段文本。
所以准确说,Context 是「系统组装 + 对话累积 + 外部检索」的混合体,模型只是被动接收和处理。
Q2:Context 能持续多久?会不会"失忆"?
它不按时间算,按 Token 量算。超出窗口就会被"挤掉"。
很多人以为"我三天前聊的它还记得吗"——其实跟时间没关系,跟上下文窗口大小和对话长度有关系。
假设模型窗口是 128K Token,聊到第 130K 的时候就超了,怎么办?常见策略有几种:
表格
| 策略 | 做法 | 影响 |
|---|---|---|
| 截断(Truncation) | 直接丢掉最早的几轮对话 | 最早的信息"失忆" |
| 摘要(Summarization) | 把前面的对话压缩成摘要 | 细节丢失,只剩要点 |
| 滑动窗口 | 只保留最近 N 轮 | 老信息直接没了 |
| RAG + 记忆系统 | 重要信息存到外部,需要时再检索 | 不会真"忘",但得检索得到才行 |
所以"持续多久"的答案是:只要还在窗口里就一直在;窗口满了,早的就没了。
Q3:Context 的语义和准确度靠什么维持?
Context 的质量 = 模型输出质量的天花板。主要靠四层保障:
第一层:输入质量(Garbage In, Garbage Out)
- Context 里的信息本身准不准确?
- 信息相不相关?无关内容会干扰判断。
- 排序和结构有没有逻辑?(开头和结尾效果更好,中间容易丢)
第二层:模型本身的理解能力
- 参数量大的模型对长上下文的理解能力更强。
- 但即使是最好的模型,上下文越长,中间部分的信息召回率也会下降("Lost in the Middle"现象)。
第三层:应用层的工程设计
- RAG 检索质量:找得准不准、全不全。
- Prompt 工程:告诉模型"只根据给定材料回答""不知道就说不知道"。
- 记忆系统:把重要信息结构化存储,而不是全靠对话堆着。
第四层:多轮校验
- 让模型自己检查、交叉验证。
- 工具调用结果的二次确认、事实核查。
Q4:Context 是模型返回的内容吗?人的输入占多少?
正好反过来!Context 里装的是「给模型看的东西」,不是「模型吐出来的东西」。
你可以把模型想象成一个只会"读题→答题"的考生:
plaintext
9
1
2
3
4
5
6
7
8
考卷(Context) 考生(LLM) 答卷(Output)
┌──────────────┐ ┌──────────────┐
│ 考生须知 │ → 读题,预测下一个字 → │ 我的答案是... │
│ 题目条件 │ │ 因为... │
│ 之前几题的草稿 │ └──────────────┘
│ 你现在的问题 │
└──────────────┘
人的输入当然在 Context 里,而且是很重要的一部分。没有你的问题,模型根本不知道要答什么。
简单说:Context = 输入侧(给模型看的),Output = 输出侧(模型吐的)。
Q5:Context 太大被截断后,会不会彻底影响模型判断?
会影响,但不是"彻底崩盘",而是有层次的。
想象你看一本 500 页的书,但桌子只能摊开 100 页。影响多大取决于什么内容被收走了:
- 被收走的是前言?问题不大。
- 被收走的是关键人物介绍?后面可能看不懂。
- 被收走的是案件真相?侦探小说白看了。
最危险的场景是:关键约束/背景信息被挤掉了。 比如你前面说了一句"用户是盲人,必须支持读屏",聊了几十轮之后这句话被挤出去了,模型后面出的方案可能完全偏离方向。
但也不会彻底崩,因为有几道防线:
- System Prompt 永远在最前面——核心规则不会丢。
- 重要的东西会被反复提到——你每次提问都在强调目标,等于不断刷新。
- 应用层有记忆和检索系统——正经产品不会纯靠对话窗口记东西。
- 主题连续性——即使细节丢了,对话的大方向通常还在。
实用建议: 关键信息定期重申、重要内容存文件、善用"总结一下刚才的结论"、复杂任务分段做。
Q6:Prompt 有几种?我平时输入的是哪一种?
Prompt 分两种:System Prompt 和 User Prompt。你平时输入的、能看到的是 User Prompt。
打个比方:你去餐厅吃饭。
- User Prompt = 你点的菜("来份宫保鸡丁,少辣多花生")
- System Prompt = 后厨的操作规范("食材必须新鲜、出餐不超15分钟、禁止转基因油")
表格
| 维度 | System Prompt | User Prompt |
|---|---|---|
| 谁写的 | 开发者/平台 | 用户 |
| 你能看到吗 | 通常看不到 | 当然能 |
| 优先级 | 更高(规则 > 需求) | 次高 |
| 每轮变不变 | 基本不变 | 每轮都不一样 |
System Prompt 才是真正定义 AI 行为的那道"护栏"——同样的底层模型,配上不同的 System Prompt,表现可以天差地别。这也是为什么不同 AI 产品的"性格"不一样。
Q7:Tool 是什么?为什么说 Tool 是革命性的?
Tool 给了 LLM "手",让它从"只会说"变成"真能做"。
没有 Tool 的 LLM 就是一个手被绑住的食客——能描述菜的味道,但碰不到菜。你问它"窗外天气怎么样",它只能凭印象猜;你让它"读一下这个文件",它会说"抱歉我不能访问文件系统"。
Tool 就是给食客松绑,递上一副刀叉:
- 搜索工具 = 能伸到餐厅外的"长筷子"
- 文件读取工具 = "开罐器"
- 代码执行工具 = 一套厨房用具,不仅能吃还能自己炒菜
- 浏览器工具 = 一扇窗,可以看看外面发生了什么
从"凭印象回答"到"动手查了再回答"——这是质的区别。
Q8:MCP 是什么?不就是个协议吗,有那么重要?
MCP(Model Context Protocol)就是 AI 界的 USB 接口标准。
很多人听到"协议"就觉得抽象,其实 MCP 只规定了三件事:
- 工具发现——工具怎么介绍自己(我叫什么、能干什么、要什么参数)
- 工具调用——Agent 怎么调用工具(统一的请求格式)
- 结果返回——工具怎么回话(统一的响应格式)
为什么要搞这个?因为没有标准的时候太乱了:
- 查天气是 REST API,参数叫
city - 查股票是 SDK,参数叫
symbol - 发邮件是 SMTP,参数叫
to - 每个工具的接入方式、鉴权、格式全不一样
有了 MCP 之后,工具接入就像插 U 盘——做一次标准适配,所有支持 MCP 的 AI 都能用。做工具的人不用给每家 AI 单独适配,做 AI 的人不用自己一个个接工具,双赢。
Q9:LLM 和 Agent 最核心的区别是什么?
LLM 是大脑,Agent 是「大脑 + 手 + 自主规划能力」的完整系统。
表格
| 概念 | 餐桌比喻 | 能做什么 |
|---|---|---|
| LLM | 食客的大脑 | 只会"想"和"说" |
| 有 Tool 的 LLM | 有手有脑子的食客 | 能夹菜,但你得告诉它夹哪盘 |
| Agent | 完整的人 | 自己决定先吃什么、后吃什么、不够了再叫什么 |
关键区别是自主性。普通聊天机器人是"你点一下,它动一下";Agent 是"你给它一个目标,它自己想办法达成"。
一个完整的 Agent 执行流程:
plaintext
9
1
2
目标 → 规划 → 调用工具 → 观察结果 → 调整 → 再行动 → ... → 完成
这就是"计划→行动→观察→修正"的闭环。
Q10:Agent Skill 是什么?有必要吗?
Agent Skill 就是 Agent 的 SOP 手册,把一类任务的最佳实践沉淀下来。
用旋转餐桌的比喻:Skill 就是餐桌礼仪。
- "先喝汤,再吃菜,最后上主食" → "先分析需求,再查资料,再写初稿,最后校对"
- "吃西餐左手叉右手刀" → "写代码先写测试用例,再写实现"
- "不同场合不同礼仪" → "不同任务有不同 Skill"
没有 Skill 行不行?行,就像不懂礼仪也能吃饭。但:
- 容易出糗(犯低级错误)
- 效率低(每次都想半天)
- 不稳定(有时候好有时候糟)
- 不可复制(这次好,下次不一定)
Skill 的意义,就是把"偶尔做好"变成"每次都做好"。
🧩 一张图串起所有概念
plaintext
99
1
2
3
4
5
6
7
8
9
10
11
12
食客本人(Agent)
├── 大脑(LLM):负责思考和生成
├── 面前的旋转餐桌(Context):
│ ├── 永远在对面的主菜(System Prompt)
│ ├── 各种菜品(历史对话、资料、工具返回结果)
│ └── 刚点的菜(User Prompt)
├── 桌面大小(Context Window):决定能同时放多少菜
├── 后厨菜单(RAG/知识库):不用全摆上桌,需要再端
├── 手里的餐具(Tool):刀叉筷勺,各有用途
├── 餐具标准(MCP):统一接口,即插即用
└── 用餐礼仪(Skill):经验沉淀的固定流程
🧠 文末自测:你掌握了吗?
来做 8 道题,检验一下理解程度。答案在最后。
题目
-
"Context Window" 指的是什么?
- A. 模型一次能生成的最大字数
- B. 模型一次能处理的最大 Token 量(能"看到"的信息总量)
- C. 模型能记住多少天前的对话
- D. 模型训练时用了多少数据
-
System Prompt 和 User Prompt 的关系,以下哪个说法最准确?
- A. 两者是一回事,只是叫法不同
- B. User Prompt 是用户写的,优先级更高
- C. System Prompt 是开发者设定的规则,通常优先级更高
- D. System Prompt 只在第一次对话时生效
-
用"旋转餐桌"的比喻,搜索工具最像什么?
- A. 一双很长的筷子,能伸到餐厅外去"夹"外面的信息
- B. 一个大碗,能装很多菜
- C. 一张更大的桌子,能放下更多菜
- D. 服务员,专门负责端菜上桌
-
LLM 和 Agent 最核心的区别是什么?
- A. Agent 用的模型更大更聪明
- B. LLM 只能生成文本,Agent 能自主规划、调用工具、形成执行闭环
- C. Agent 比 LLM 更快
- D. LLM 是免费的,Agent 是付费的
-
为什么说"长上下文不一定越好"?以下哪个原因不对?
- A. 信息太多,模型容易抓错重点(Lost in the Middle)
- B. 上下文越长,成本越高(按 Token 计费)
- C. 长上下文的模型推理速度慢
- D. 上下文越长,模型的语言能力越差
-
MCP(Model Context Protocol)的主要作用是什么?
- A. 让模型变得更聪明
- B. 提供一种标准化的工具接入协议,让工具可以即插即用
- C. 扩大模型的上下文窗口
- D. 让模型训练更快
-
当对话太长导致 Context 被截断时,以下哪种策略对保持对话质量最有效?
- A. 什么都不做,模型自己会想起来
- B. 把前面的对话压缩成摘要(Summary),腾出空间
- C. 把重要信息结构化存储,需要时再检索(RAG + 记忆系统)
- D. 每次都重新说一遍所有背景
-
以下是 AI 能力演进的几个阶段,按从底层到上层的顺序排列,正确的是?
- A. LLM → Tool → Prompt → Agent → MCP → Skill
- B. LLM → Prompt + Context → Tool → MCP → Agent → Skill
- C. Agent → LLM → Tool → Skill → MCP → Context
- D. Tool → LLM → Context → Prompt → Skill → Agent → MCP
答案
- B — Context Window 是能处理的总量(输入+输出),不是只指输出。
- C — System Prompt 是规则,优先级高于用户需求。
- A — 搜索工具就是那双能伸到外面的"长筷子"。
- B — 核心区别是自主性和执行闭环。
- D — 注意题目问的是"不对"的原因。长上下文不会让模型语言能力变差,语言能力是模型本身的素质。
- B — MCP = 工具接入的 USB 标准。
- C — RAG + 记忆系统是最优解,把重要信息结构化存储,按需检索。
- B — 从"会说话"到"有经验"的完整演进路线。
🌟 最后:我的理解框架
可以把这条路线压缩成一个递进关系:
plaintext
9
1
2
3
LLM → Prompt + Context → Tool → MCP → Agent → Agent Skill
会说话 → 看得懂任务 → 能使用工具 → 工具接入标准化 → 能自己推进任务 → 把经验沉淀成技能
AI 的进化不只是模型参数变大,而是 「模型 + 上下文 + 工具 + 工作流 + 技能沉淀」 一起组成新的软件形态。
以后我们评价一个 AI 产品,可能不能只问"它用的是什么模型",还要问:
- 它能看到什么上下文?
- 它能调用哪些工具?
- 它有没有可靠的执行闭环?
- 它能不能把经验沉淀成可复用的 Skill?
模型是起点,但不是终点。真正改变工作方式的,往往是模型和工具、流程、经验结合起来之后形成的系统能力。
参考
- 原文:从 LLM 到 Agent Skill:把 AI 的底层概念串起来 — Bug收容所 / CSDN
- 灵感来源:马克的技术工作坊《从 LLM 到 Agent Skill,一期视频带你打通底层逻辑!》
标签: #LLM #Agent #Prompt #Context #MCP #AgentSkill #AI入门 #学习笔记
更多推荐

所有评论(0)