蚂蚁SkillX知识库:一次构建,跨Agent通吃

当前LLM Agent在处理复杂长程任务时,仍面临每次从零开始的困境。
- 传统经验表示方法如原始轨迹(Trajectories)、高层洞察(Insights)或工作流(Workflows)均存在明显局限——要么难以检索复用,要么无法直接执行。
- Anthropic的Claude Skills虽提供了良好抽象,但其长上下文渐进式披露(Long-context progressively revealed)对推理能力和环境工具有极高要求。

Figure 1
Figure 1清晰展示了这一对比:Claude Skills需要复杂的沙箱环境和多轮交互,而SkillX采用分层、条目化的轻量级表示,支持一次性加载和跨Agent复用。
三级Skill体系与自动化流水线
SkillX的核心创新在于多级技能设计(Multi-Level Skills Design),将原始轨迹蒸馏为三层互补结构:
- 规划技能(Planning Skills):捕获任务组织的高层结构,过滤探索、回溯等非必要步骤,保留关键子任务依赖关系
- 功能技能(Functional Skills):实现可复用的工具组合子程序,包含输入输出规范和具体调用模式
- 原子技能(Atomic Skills):针对单一工具的执行级规范,补充工具模式、参数配置和常见失败模式

Figure 2展示了完整的自动化流水线:基于GLM-4.6等强模型进行轨迹采集后,通过**迭代技能精炼(Iterative Skills Refinement)自动合并相似技能、过滤低质量条目(基于领域特异性、过度封装等5项标准);再通过探索性技能扩展(Exploratory Skills Expansion)**主动探索未充分利用的工具和失败场景,突破种子数据分布限制。
使用时,系统首先检索规划技能生成任务特定的"伪计划"(Pseudo-Plan),再基于计划步骤检索功能/原子技能,实现"检索-重写-再检索"的精准匹配。
经验迁移的新范式
在BFCL-v3、AppWorld和τ²-Bench三大长程交互基准测试中,SkillX展现出显著优势。

Table 1
Table 1 显示,将SkillX构建的技能库直接接入Qwen3-32B等较弱基座模型,可带来约10%的性能提升(Avg@4指标),在AppWorld上Pass@4提升超过11个百分点,显著优于ExpeL、AWM等基线方法。
关键发现包括:
- 经验表示形式决定迁移上限:即便使用GLM-4.6提取经验,AWM和ExpeL的表示方式仍限制了向弱模型的迁移效果
- 多级技能的互补性:规划技能显著减少执行步骤(尤其对弱模型),功能技能贡献主要性能增益,原子技能关键API缺失时导致性能骤降
- 技能扩展的有效性:相比随机探索,基于经验引导的探索策略能多发现112%的新技能

SkillX的局限性在于当前主要针对工具调用场景,跨环境迁移(不同工具生态)和用户纯对话场景仍需进一步探索。该项目将开源构建好的技能库,为社区提供即插即用的经验共享基础设施。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐



所有评论(0)