Agent Skills 开发:把经验封装成技能
Agent Skills 开发:把经验封装成技能
副标题:2026 年每个开发者都该会的技能工程化
钩子
你有没有这种经历:同一个部署检查清单,你每开一个新会话就得给 Claude 重新贴一遍;它每次还解读得不太一样。问题不在模型笨,而是你的"经验"散落在无数次口头叮嘱里。Agent Skills 干的事很简单——把这套经验固化成一个文件,让 Agent 从"聪明的新人"变成"踩过坑的老手"。
要点 1|Prompt、Skill、MCP 不是一回事
先正本清源。很多人把 Skill 当"高级 Prompt",其实三者职责完全不同:
| 概念 | 类比 | 作用 | 加载时机 |
|---|---|---|---|
| Prompt | 这次怎么点菜 | 当前上下文里的一次性指令 | 每次对话 |
| Skill | 后厨出餐 SOP | 一类任务的固定流程与标准 | 触发时按需 |
| MCP | 餐厅的供应链 | 连接外部工具与数据源 | 调用时 |
53AI 那篇四层架构 说得更直白:Agent Loop 负责推理,Runtime 负责执行,MCP 负责连接,Skills 负责方法论。推理别塞流程(进 Skill),连接别写进提示词(进 MCP)。一句话经验法则:解释"如何做"用 Skills,需要"访问某物"用 MCP。
要点 2|Skills 的核心魔法:渐进式披露
为什么 Skill 能塞几百个还不撑爆上下文?关键在于 Anthropic 官方的三级渐进式披露:

设计哲学像一本好手册:目录 → 章节 → 附录。平时 Agent 只看一串"名字+一句话描述",真需要时再深挖。这意味着你可以给 Agent 装几百个技能,上下文窗口却不会被压垮——这是传统"把规范全塞 System Prompt"做法做不到的。
要点 3|解剖 SKILL.md:最小可用结构
一个 Skill 最少只要一个文件。参考 Anthropic 官方规范 和 FreeCodeCamp 教程,结构是这样:
my-skill/
├── SKILL.md # 必需: frontmatter + 指令正文
├── references/ # 可选: 长文档, 按需加载
├── scripts/ # 可选: 可执行脚本(当工具用)
└── assets/ # 可选: 模板/图标
SKILL.md 开头是 YAML frontmatter,两个必填字段有硬约束:
| 字段 | 约束 | 示例 |
|---|---|---|
name | ≤64 字符,仅小写字母/数字/连字符,须与文件夹名一致 | pdf-processing |
description | ≤1024 字符,描述"做什么+何时触发" | “Extracts text from PDFs. Use when user mentions PDFs.” |
最关键的认知:模型是否加载你的 Skill,100% 取决于 description 写得好不好。freeCodeCamp 那篇说得狠——frontmatter 永远不进指令上下文,它只是"该不该加载"的判据;正文写得再好,没被加载就是零。所以写 Skill 的第一性原理是:先打磨 description,再写正文。
要点 4|开发流程:从"会用到会教"
掘金那篇万字教程 把构建拆成四阶段,我浓缩成一条主线:

一个被低估的技巧:负面清单比正面指令管用。与其说"要怎么写",不如明确写"严禁出现:首先、其次、综上所述"。AI 对禁止项的记忆往往比执行项更深刻。Anthropic 内部经验也印证:最有价值的内容是"常见陷阱"章节——持续累积 Agent 的失败模式,让后来者直接绕坑。
要点 5|数据打脸:不是写了 Skill 就一定更好
这是最容易被人忽略的真相。Arize 的 SkillsBench 研究 有三个反直觉发现:
| 做法 | 对任务成功率的影响 |
|---|---|
| 精心策划的 curated skills | +16.6 个百分点(平均) |
| 让模型自己生成的 self-generated skills | -8.1 ~ -11.5 个百分点(比不用还差) |
| 给工具定义加 input_examples | 工具选择准确率 72% → 90% |
关键结论:模型不是领域真理的来源,领域专家 + 评测才是。一个写得漂亮但"自信地错"的 SKILL.md,反而会让 Agent 更不可靠。所以 Skill 工程的正确姿势是——用真人的流程经验打底,再用"有/无 Skill 的对比评测"来验收,而不是让模型自己编。另外 Skywork 的指南 也补了一刀:MCP 月下载已到 1.1 亿次(2026-04),生态是真的在涨,但 Skill 质量才是分水岭。
要点 6|Skill 的生命周期:会长大也会过时
一个 Skill 不是写完就完事,它有清晰的生命周期:

TeamDay 的技能工程指南 把 Skill 工程列为 2026 年最重要的新学科之一,并预言会分三层生态:通用技能(Anthropic/OpenAI 出品)→ 市场技能(Skills.mp、Smithy)→ 企业/个人自定义技能。越往下越具体,也越值钱—— domain expertise 第一次变成了可批发、可计价的数字资产。
我认为 2027 年前,"Skill 工程师"会像今天的"前端工程师"一样成为招聘 JD 里的标配岗位。理由:
- 成本结构倒逼:53AI 引用的数据说开发者 60% 工作已用 AI,但能"完全委托"的仅 0~20%——差距全在"流程有没有被标准化"。谁把流程沉淀成 Skill,谁就能把那 20% 往 80% 推。
- 标准化已就位:Agent Skills 在 2025-12-18 成为开放标准,已被 33+ 产品(Claude Code、Copilot、Cursor、Gemini CLI)采纳(UML.org.cn 汇总),跨平台可移植意味着 Skill 能像 npm 包一样流通。
- 经济层浮现:当一个人的报税/审查/部署经验能封装成可分享、可计价的 Skill,domain expertise 第一次变成了"可批发"的数字资产。
可证伪性:如果 2027-Q4 你发现主流招聘平台仍无 “Skill Engineer” 类岗位(只有 Prompt Engineer 存量),这条预测作废。赌注从今天起:把你下周要重复三次以上的流程,先写成一个 SKILL.md,比再背一遍提示词划算。
小结 · 今晚 / 这周 / 长期
- 今晚:挑一个你重复贴过两次以上的指令(部署检查、PR 模板、代码评审标准),新建
.claude/skills/xxx/SKILL.md,只写 frontmatter + 三步走工作流。 - 这周:给它的
description加具体触发词,跑 3 个真实任务验收;输出了就沉淀,不稳定就补"负面清单"。 - 长期:建立你个人的 Skill 库 + 一个 10~30 条的评测集,每次改 Skill 都跑一遍"有/无"对比,别让模型自己编。
按段位看投入产出——
| 段位 | 你已有的 | 下一步 |
|---|---|---|
| 新手 | 会写 Prompt | 把 1 个高频流程抽成 Skill |
| 进阶 | 有 3~5 个 Skill | 加 references/ 分层,跑评测集 |
| 老手 | 团队共享 Skill 库 | 接 MCP,让 Skill 调真实数据源 |
互动段
你第一个想封装成 Skill 的流程是什么?评论区告诉我:部署检查 / 代码评审 / 写周报 / 还是别的?点赞最高的下期我写实操。
来源
- Anthropic 官方 - Equipping agents with Agent Skills — 开放标准、三级渐进式披露、PDF skill 实例
- Arize - 6 data-backed practices — SkillsBench:curated +16.6pp / self-generated -8~11pp
- 53AI - 2026 做 Agent 的正确姿势 — 四层架构、60%用AI仅0-20%委托、渐进式披露 token(中文一手源)
- Skywork - AI Agent Skill Development Best Practices — 生产级四支柱、input_examples 72%→90%、MCP 1.1亿次/月
- TeamDay - Skill Engineering Guide — 技能工程三层级生态、self-improving 回路
- 掘金 - 万字干货 Agent Skills 从入门到精通 — 四阶段构建、负面清单技巧(中文一手源)
- CSDN - Anthropic Skills 解析 — frontmatter 字段硬约束(中文一手源)
更多推荐



所有评论(0)