AI Agent 执行路径规划深度研究
从符号规划到智能涌现:Agent 如何变得越来越"聪明"
摘要
AI Agent 执行路径规划经历了从经典符号规划(STRIPS/PDDL)到LLM驱动的推理-行动融合(ReAct/CoT),再到当前大型推理模型与多智能体网络的深刻演进。本报告基于PlanBench基准测试、SWE-bench Verified排行榜、IoA框架论文等一手数据,系统梳理了这一演进的技术脉络,分析了执行路径规划与验证机制使Agent表现日益增强的内在逻辑,并对未来发展方向(神经符号融合、世界模型、IoA智能体网络等)进行了前瞻性探讨。
核心发现: (1) LLM单独无法可靠规划——PlanBench数据显示GPT-4在Blocksworld上准确率仅34.6%,Mystery Blocksworld上为0%;(2) 推理模型的突破是量子级的——DeepSeek R1在Blocksworld上达99.1%,但复杂规划远未饱和;(3) Agentic工作流比裸模型重要——GPT-3.5通过Agent循环在HumanEval上达95.1%,远超GPT-4裸用的67%;(4) 多智能体系统失败率高达40%-90%,主要问题来自规范而非技术。
第一章 引言:执行路径规划——Agent 智能的核心
1.1 Agent 的本质
AI Agent(智能体)区别于传统聊天机器人的根本特征在于其自主执行能力:它不仅仅是"理解并回应",而是"理解→规划→执行→验证→调整"的完整闭环。在这个闭环中,执行路径规划(Execution Path Planning)是决定Agent智能水平的核心环节。
正如Andrew Ng在2024年指出的那样,Agentic工作流与传统零样本模式有本质区别:"传统模式像要求一个人从头到尾写一篇文章且不允许退格修改,而Agent模式则像人类作家的工作方式——规划、研究、起草、审阅、修改。"这种迭代式的工作方式带来的性能提升甚至超越模型代际升级。
1.2 执行路径规划的核心问题
执行路径规划本质上要回答三个问题:
-
目标分解:如何将一个复杂的高级目标分解为可执行的原子步骤?
-
路径选择:在多个可能的执行路径中,如何选择最优(或可行)的路径?
-
动态调整:当执行遇到意外情况时,如何调整计划而不偏离总体目标?
这三个问题的解决水平,直接决定了Agent的"聪明"程度。本文将系统追踪这一能力从1971年到2026年的演进历程。
第二章 第一阶段:事前规划——从符号逻辑到思维链
2.1 经典符号规划时代(1971-1998)
AI规划的研究始于符号主义人工智能的黄金时代,其核心理念是:将世界表示为逻辑命题,将规划表示为逻辑推理。
STRIPS(Fikes & Nilsson, 1971)
斯坦福研究院(SRI)的Fikes和Nilsson在1971年提出了STRIPS(Stanford Research Institute Problem Solver),这是AI规划领域的奠基之作。STRIPS的核心思想是:
-
状态表示:世界状态被表示为一组谓词(predicates)的集合,例如
At(robot, RoomA),Holding(robot, Box1) -
动作定义:每个动作由前置条件(preconditions)和效果(effects)定义。例如"拿起盒子"这一动作的前提是"机器人在盒子旁边且手是空的",效果是"机器人在拿盒子"
-
框架问题解决:STRIPS采用封闭世界假设(Closed World Assumption)——未在效果列表中明确声明为真的命题,在动作执行后都假定为假。这一设计优雅地解决了困扰AI多年的"框架问题"(Frame Problem)
理论基础:STRIPS建立在一阶谓词逻辑和状态空间搜索的理论基础上。规划问题被形式化为从初始状态到目标状态的状态序列搜索问题。
历史意义:STRIPS确立了一个范式——"规划 = 状态空间中的搜索",这一范式影响至今。现代LLM Agent的"思考-行动-观察"循环,本质上也是这一范式的延续。
PDDL(McDermott et al., 1998)
1998年,Yale大学的McDermott等人提出了PDDL(Planning Domain Definition Language),这是对规划问题的标准化语言。PDDL的核心贡献是:
-
领域与问题分离:将"这个世界的规则是什么"(领域描述)与"当前要解决什么问题"(问题实例)分开定义
-
标准化基准:使不同规划器能在同一基准上竞争,推动了国际规划竞赛(IPC)的诞生
理论意义:PDDL标志着AI规划从"每个问题临时构建"走向"可工程化、可复现"的科学范式。
Graphplan(Blum & Furst, 1995)
CMU的Blum和Furst提出了Graphplan,这是经典规划时代的一个重要算法创新:
-
构建交替的"命题层"和"动作层"构成的规划图
-
使用互斥(mutex)关系标记不可同时成立的状态-动作对
-
关键性质:若在层级k找到有效规划,则不存在更短的规划
局限与遗产:经典规划的优势在于形式化保证——计划要么可证明正确,要么可证明不存在。但其根本局限在于需要手工构建完整的领域模型,这在开放世界中几乎不可能。复杂度从NP-complete到PSPACE-complete,使其难以扩展到真实场景。
2.2 大语言模型的"思维链"——规划能力的新起点
Chain-of-Thought(Wei et al., NeurIPS 2022)
2022年初,Google的Wei等人发现了一个关键现象:在few-shot提示中包含中间推理步骤,可以显著提升LLM的推理能力。这就是Chain-of-Thought(CoT,思维链)提示。
关键数据:PaLM 540B在GSM8K数学推理任务上的准确率从不到20%跃升至近60%——仅仅通过在提示中加入推理步骤示例。
理论洞察:CoT揭示了一个深刻的事实——LLM内部已经编码了推理能力,但需要合适的"触发器"来激活它。CoT的作用本质上是将隐式的推理能力外化为可读的推理轨迹。
Zero-shot CoT(Kojima et al., NeurIPS 2022)
几乎同时,Kojima等人进一步发现:甚至不需要few-shot示例,仅需要在提示末尾添加"Let's think step by step"就能激活LLM的逐步推理能力。在MultiArith任务上,准确率从不到20%跃升至近80%。
关键发现:CoT是涌现能力(Emergent Ability),仅在约1000亿参数以上的模型中出现。小模型会产生"流畅但不合逻辑"的推理链。这一发现意味着规划能力并非简单的规模扩展结果,而是某种根本性的质变。
Self-Consistency(Wang et al., ICLR 2023)
Wang等人提出的Self-Consistency方法进一步提升了CoT的可靠性:采样多条推理路径,投票选择最常见的答案。核心理念是"不同推理路径应收敛到同一答案"。这种方法利用了LLM生成的随机性来近似不确定性估计。
2.3 Plan-and-Execute:先谋后动的全局规划
核心思想
为了解决Agent容易在长链条任务中"迷失方向"的问题,Plan-and-Execute范式提出规划与执行分离的策略。其架构包含三个独立模块:
-
Planner(规划器):分析用户请求,生成包含多个步骤的有序计划或有向无环图(DAG),此阶段不执行任何实际操作
-
Executor(执行器):接收计划,依次执行每一步
-
Replanner(重规划器,可选):当执行遇到错误时,重新调用Planner调整剩余步骤
技术优势
这种设计模仿了人类项目经理的工作方式:先制定全局计划,再逐一执行。其优势显而易见——Agent始终能看到全局目标,不易在战术细节中"跑题"。在ReWOO变体中,Planner一次性生成包含变量引用的计划,减少了反复调用LLM进行推理的开销,Token效率显著提升。
局限性
然而,Plan-and-Execute的"致命弱点"在于灵活性不足:如果前置步骤的结果完全超出预期(例如搜索结果为空),预生成的后续步骤可能完全失效。这就需要非常复杂的Replanning机制来修正,系统复杂度随之急剧上升。
第三章 第二阶段:ReAct范式——推理与行动的第一次握手
3.1 ReAct的诞生(Yao et al., ICLR 2023)
2022年10月,当时在Google的姚顺雨(Shunyu Yao)等人提交了题为《ReAct: Synergizing Reasoning and Acting in Language Models》的论文,在ICLR 2023上发表。这篇论文系统性地提出了将推理(Reasoning)与行动(Acting)结合的范式——ReAct,成为AI Agent领域的开山之作。
核心方法论
ReAct的核心洞察是:纯推理和纯行动各有致命缺陷,但可以互相弥补。
-
纯推理方法(如CoT):属于"黑盒推理",无法与外界交互获取真实信息,容易产生幻觉和错误累积
-
纯行动方法:仅基于当前状态做决策,无法完成需要多步抽象推理的高级目标
ReAct的解决方案是将LLM的动作空间从仅包含外部交互动作 \mathcal{A} 扩展为 \hat{\mathcal{A}} = \mathcal{A} \cup \mathcal{L},其中 \mathcal{L} 是"推理轨迹"(Thought)的空间:
-
外部动作 a_t \in \mathcal{A}:会与外部环境交互并触发观察反馈(如调用搜索API、控制游戏角色)
-
推理轨迹 \hat{a}_t \in \mathcal{L}:不直接影响外部环境,仅用于模型内部推理,指导后续动作决策
工作流程形成一个"推理轨迹(Thought)→ 行动(Action)→ 观察(Observation)"的交错循环。推理轨迹的作用包括:归纳和跟踪行动计划、处理异常情况、将高级目标分解为可执行子步骤、基于常识推断下一步操作。
在知识密集型任务上的表现
ReAct在四个基准测试上进行了验证,结果揭示了几个重要发现:
| 方法 | HotPotQA | FEVER | 核心发现 |
|---|---|---|---|
| Act-only | 低于ReAct | 低于ReAct | 推理轨迹对指导行动有显著价值 |
| CoT | 略高于ReAct | 低于ReAct | CoT推理逻辑更准确但幻觉严重;ReAct更事实可靠但推理灵活性受限 |
| ReAct | 优于Act-only | 优于CoT | 有效缓解CoT的幻觉问题 |
| ReAct+CoT-SC | 最优 | 最优 | 组合策略优于任何单一方法 |
在交互式决策任务上的突破
| 方法 | ALFWorld成功率 | WebShop得分 |
|---|---|---|
| 传统方法(BUTLER/IL/IL+RL) | ~37% | 低于ReAct |
| 1-shot ReAct | 71% | 显著超越 |
ALFWorld上,仅需1个示例的ReAct就将成功率从约37%提升至71%,提升幅度达34个百分点。在WebShop(118万真实商品的在线购物环境)上,ReAct同样显著超越了传统的模仿学习和强化学习方法。
组合策略的智慧
实验揭示了一个重要的互补性:CoT的推理逻辑更准确但容易幻觉,ReAct的轨迹更可靠但推理灵活性受限。基于此,论文提出了ReAct+CoT-SC的组合范式:
-
若ReAct未能在限定步骤内给出答案,自动切换到CoT-SC
-
若CoT-SC结果置信度过低,切换回ReAct获取外部信息
这种"混合策略"在HotPotQA和FEVER上均优于任何单一算法——这是执行路径规划中"没有银弹"哲学的早期例证。
3.2 ReAct的深远影响
ReAct之所以成为AI Agent的基石范式,不仅因为其性能提升,更因为它确立了几个根本性的设计原则:
-
环境反馈是推理的锚点:LLM的推理需要外部验证来防止幻觉——这一原则直接影响后续所有Agent架构
-
推理和行动不是先后关系,而是交织关系:人类解决问题时并非"先想清楚再动手",而是"边想边做、边做边想"
-
通用性来自简单性:ReAct仅需1-2个few-shot示例即可在新任务上工作,这种极简设计使其成为所有主流Agent框架(LangChain/LlamaIndex/AutoGen)的默认执行模式
第四章 超越线性:结构化探索与自我反思
4.1 Tree of Thoughts(Yao et al., NeurIPS 2023)
ReAct虽然有效,但其"思考-行动-观察"的线性结构在处理需要回溯和多路径探索的问题时捉襟见肘。姚顺雨等人在2023年进一步提出了Tree of Thoughts(ToT),将推理从链扩展为树。
核心架构:ToT将问题求解建模为在"思维树"上的搜索过程,包含四大组件:
-
思维分解:将问题分解为一个个"思维单元"
-
思维生成:从当前节点生成多个候选下一个思维(分支)
-
状态评估:评估每个思维节点的"前景"(利用LLM自我评估或投票)
-
搜索算法:使用BFS或DFS在思维树上搜索最优路径
关键结果:在Game of 24任务上,ToT的准确率达70%+,而CoT仅4%——提升超过17倍。但代价同样惊人:每次问题求解需要约100次LLM调用,token消耗是CoT的10-100倍。
4.2 Graph of Thoughts(Besta et al., AAAI 2024)
如果ToT将链扩展为树,Graph of Thoughts(GoT)则进一步将树泛化为任意图结构。GoT引入了三种新操作:
-
聚合(Aggregation):分治后合并多个子结果
-
精炼(Refinement):通过反馈循环迭代优化(类比Reflexion)
-
生成(Generation):从当前节点向外分支探索
关键结果:在排序128个数字的任务上,GoT的误差仅为ToT的约1/3,同时成本降低30%+。GoT还引入了"体积"(Volume)作为信息密度度量——一个重要的元认知概念。
核心洞察:问题结构决定最优推理结构——树适合需要回溯的问题(如数学证明),图适合可分解的问题(如代码生成)。
4.3 Reflexion:语言的强化学习(Shinn et al., NeurIPS 2023)
ReAct通过环境反馈来修正行动,但人类学习的另一种方式是从自己的错误中学习。Shinn等人提出的Reflexion正是将这一能力赋予Agent。
核心架构:
-
Actor:生成动作轨迹
-
Evaluator:对轨迹进行评分
-
Self-Reflection Model:基于评分生成自然语言的"反思批评",存储在长期记忆中以指导未来行动
关键结果:GPT-4 + Reflexion在HumanEval上准确率超90%,相比纯GPT-4提升10+百分点。
理论意义:Reflexion的本质是语言形式的强化学习(Verbal Reinforcement Learning)。传统RL通过梯度更新来学习,Reflexion则通过自然语言来"记忆"和改进——这是一种介于符号学习和神经网络学习之间的第三种学习范式。
局限:Reflexion擅长"迭代精炼"(把一条路走好),但不擅长"发散探索"(尝试更多路径)。如果问题需要的不是把一条路磨得更精而是尝试全新路径,Reflexion无法提供帮助。
第五章 祛魅与突破:AI Agent 执行规划的当前状态
5.1 PlanBench揭示的真相:LLM真的能规划吗?
2024年,亚利桑那州立大学的Kambhampati等人通过PlanBench基准测试给出了一个"令人不安"的答案。
PlanBench基准设计
PlanBench基于国际规划竞赛(IPC)的经典领域(主要是Blocksworld积木世界),系统性地测试了LLM的规划能力。关键设计特点:
-
Blocksworld(自然语言):经典积木世界,使用自然语言描述。测试基本的规划能力。
-
Mystery Blocksworld:动作名称被混淆(如"Stack"变成"Frob"),测试模型是否真正理解动作语义,还是仅依赖模式匹配。
-
Randomized Mystery Blocksworld:在Mystery基础上进一步随机化。
-
Blocksworld Hard(PDDL):使用PDDL形式语言的困难实例。
令人震惊的结果
| 模型 | Blocksworld NL | Mystery BW | Blocksworld Hard |
|---|---|---|---|
| GPT-4 | 34.6% | 0% | - |
| GPT-4o | 35.5% | 0% | - |
| Claude 3.5 Sonnet | 54.8% | 0% | - |
| Claude 3 Opus | 59.3% | 0% | - |
| LLaMA-3.1 405B | 62.6% | 0.8% | - |
| o1-mini | 56.6% | 19.1% | 10% |
| o1-preview | 97.8% | 52.8% | 23.65% |
| DeepSeek R1 | 99.1% | 43.3% | 53.6% |
核心发现:
-
所有传统LLM在Mystery Blocksworld上几乎完全归零:这暴露了一个残酷的事实——LLM的"推理"本质上可能不是真正的规划能力,而是基于训练数据中模式匹配的近似检索。当动作名称被混淆、基于语义的"捷径"被切断后,LLM的"规划能力"就立刻崩溃。
-
推理模型(LRM)带来了量子级跨越:o1-preview和DeepSeek R1在Mystery Blocksworld上从0%跃升到50%左右——这不是渐进改进,而是质的变化。
-
但规划能力"远未饱和":即使在Blocksworld这样简单的领域,最强大的推理模型在Mystery条件下准确率也只有43-53%。Kambhampati团队的评价是:"量子级提升,但远未饱和。"
5.2 LLM-Modulo框架:承认LLM的局限
面对PlanBench揭示的真相,Kambhampati等人提出了LLM-Modulo框架——其核心理念不是让LLM"变强",而是让LLM"做它擅长的事,把验证交给外部系统"。
关键论文:《LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks》(ICML 2024)
核心发现:
-
仅约10%的GPT-4生成计划可无错误执行
-
LLM的"推理"本质上是基于样本-查询相似性的近似检索,而非真正的逻辑推导
-
CoT提示不提升基础规划能力(在PlanBench上已证实)
-
自我验证有根本局限——LLM无法可靠地评估自己的输出(Huang et al., ICLR 2024的《Large Language Models Cannot Self-Correct Reasoning Yet》进一步证实:没有外部反馈时,自我纠错有时会让表现更差)
设计原则:在LLM-Modulo框架中,LLM充当"想法生成器"(Idea Generator),而正确性验证由外部的符号验证器、模型检查器或测试执行环境来完成。这本质上是一种神经符号混合架构——神经网络负责创意和近似匹配,符号系统负责精确验证。
5.3 大型推理模型:推理时扩展的新范式
OpenAI o1/o3:推理时计算的登场
2024年9月,OpenAI发布了o1系列模型,在AI推理领域引发了范式转移。o1的核心洞察是:不仅可以在训练时扩展计算资源(更多参数、更多数据),还可以在推理时扩展计算资源(更多思考时间)。
关键数据:
-
AIME数学竞赛准确率从不到20%跃升至70%+(多数投票近90%)
-
o3在ARC-AGI上接近90%(人类平均约75%)
-
o3的Codeforces评分为2727——全球约第175名最佳竞赛程序员
DeepSeek R1:纯强化学习激发推理能力(2025年1月)
DeepSeek-AI团队的R1论文在Nature上发表,提出了一个重要发现:通过纯强化学习(无需监督微调),可以激发LLM的推理能力。
技术路线:
-
使用强化学习(GRPO算法)直接优化模型的推理行为
-
模型在没有人类标注推理步骤的情况下,自主涌现出自我反思、自我验证和动态策略适应能力
-
开源1.5B到70B全系列,使研究可复现
PlanBench表现:
-
Blocksworld NL:99.1%(所有模型中最高)
-
Mystery Blocksworld: 43.3%(低于o1-preview的52.8%)
-
Blocksworld Hard (PDDL): 53.6%(大幅领先o1-preview的23.65%)
DeepSeek R1在PDDL(形式语言)任务上的优势特别值得关注——这可能表明强化学习训练的推理更接近形式化推理,而o1在自然语言混淆条件下的优势可能归因于更强的语义泛化能力。
5.4 Agentic工作流的力量
Andrew Ng在2024年3月提出的四种Agentic设计模式(Reflection, Tool Use, Planning, Multi-agent Collaboration)中,给出了一个震撼性的数据对比:
| 配置 | HumanEval准确率 |
|---|---|
| GPT-3.5 (zero shot) | 48.1% |
| GPT-4 (zero shot) | 67.0% |
| GPT-3.5 + Agent循环 | 95.1% |
这个数据揭示的真相是:Agent工作流架构比模型代数更重要。一个较弱的模型(GPT-3.5)配上一个好的Agent架构,可以超越一个更强的模型(GPT-4)的零样本表现——且提升幅度远超模型代际升级本身。
5.5 编码Agent的实战突破
CodeAct与OpenHands
OpenHands(原OpenDevin)团队提出的CodeAct范式是一种激进而有效的设计:将所有Agent动作统一为代码执行。无论是文件操作、网页浏览还是API调用,Agent只需生成Python代码并通过代码解释器执行。
SWE-bench Verified最新数据(截至2026年6月):
| 排名 | 模型 | 准确率 | 机构 |
|---|---|---|---|
| 1 | Claude Mythos Preview | 93.9% | Anthropic |
| 2 | Claude Opus 4.8 | 88.6% | Anthropic |
| 3 | Claude Opus 4.7 | 87.6% | Anthropic |
| 4 | Claude Opus 4.5 | 80.9% | Anthropic |
| 6 | DeepSeek-V4-Pro-Max | 80.6% | DeepSeek |
| 10 | Qwen3.7 Max | 80.4% | Alibaba |
关键洞察:
-
Anthropic凭借Claude系列占据前5名,展示了在代码Agent领域的绝对优势
-
中国厂商(DeepSeek, MiniMax, Qwen, Kimi)快速崛起,前10名中占据多个席位
-
80%已成为进入第一梯队的门槛
-
开源模型DeepSeek-V4-Pro-Max(1.6T参数)以80.6%的成绩证明了开源路线在代码Agent上的可行性
第六章 多智能体协作:从单打独斗到群体智慧
6.1 三大主流多智能体框架
MetaGPT:SOP标准化的工程极致(Hong et al., ICLR 2024 Oral)
MetaGPT提出了一个激进的公式:Code = SOP(Team)。核心思想是将软件工程中的标准作业程序(SOP)硬编码进Agent的工作流中。
架构设计:
-
角色分工:Product Manager → Architect → Engineer → QA
-
通信机制:采用发布-订阅(Publish-Subscribe)模式——Agent不直接对话,而是向共享消息池发布标准化文档(如PRD文档、系统设计图),关注该类文档的Agent自动认领任务
-
强制中间产物:每个阶段必须产出结构化文档,充当"长期记忆",极大减少幻觉和上下文丢失
效果:在生成完整小游戏、CRUD系统等复杂项目上,表现远超AutoGen等自由对话式框架。但代价是领域僵化——架构为软件工程量身定制,迁移到其他领域需要重写大量SOP定义。
AutoGen:对话即编程(Wu et al., 2024)
Microsoft的AutoGen提出"Agent即对话"(Conversational Programming)的哲学,不强制规定工作流,仅定义通用Agent接口。
核心Agent类型:
-
UserProxyAgent:代表用户,具备代码执行能力,可在Docker容器中运行代码并反馈结果
-
AssistantAgent:LLM驱动,负责任务分解、代码编写
关键优势:代码执行与自我修正能力强。在编程场景中,Assistant写代码→UserProxy执行→报错反馈→Assistant修正→再执行,形成自然的自我纠错闭环。但控制流确定性差——Agent之间可能陷入无休止的"客套对话"或死循环。
CrewAI:组织行为学的Agent实现
CrewAI的设计理念源于组织行为学:Agent不应只是"对话者",而应是拥有Role(角色)、Goal(目标)和Backstory(背景故事)的"职员"。
两种流程模式:
-
Sequential(顺序模式):任务线性传递(A → B → C)
-
Hierarchical(层级模式):自动生成Manager Agent,负责任务分解、指派、审核和打回修改
适用场景:固定的业务SOP场景。但层级模式下Manager Agent的大量"元认知"推理导致Token消耗激增,且过度拟人化带来大量非功能性对话。
6.2 Internet of Agents(IoA):智能体互联网
清华大学、面壁智能和OpenBMB团队在2024年7月提出的Internet of Agents(IoA)框架,是多智能体系统的一次范式升级。
三大痛点与IoA的应对
IoA的提出动机源于现有多智能体框架的三大根本局限:
-
生态隔离:大多数框架仅支持自身生态内定义的Agent,无法集成第三方异构Agent
-
单设备模拟:所有Agent在同一设备上运行,无法适配真实分布式场景
-
通信僵化:分组方式、通信流程、状态转移均为硬编码
架构设计
IoA采用服务器-客户端架构,灵感来自即时通讯应用:
服务端(中央枢纽):
-
Agent注册表:存储所有注册Agent的能力描述,形成能力集合 \mathcal{C} = \{c_1, c_2, ..., c_n\}
-
Agent发现(search_client):按任务需求的特征列表 \mathcal{L}_d 搜索匹配的协作者,支持语义匹配
-
消息路由:将消息按group_id路由到对应群聊
客户端(Agent封装层):
-
为第三方Agent提供标准化接入协议
-
自主团队组建:当Agent收到任务时,通过search_client搜索协作者,创建群聊或子群聊
-
嵌套团队结构:支持递归创建子群聊,形成树状群聊结构
自主对话流控制
受言语行为理论(Speech Act Theory)启发,IoA将群聊对话建模为有限状态机:
| 状态 | 功能 |
|---|---|
| 讨论 s_d | 交换想法、澄清任务需求 |
| 同步任务分配 s_s | 分配任务后暂停群聊直到完成 |
| 异步任务分配 s_a | 分配任务后不中断讨论,支持并行 |
| 暂停&触发 s_p | 暂停群聊,等待指定异步任务完成 |
| 结论 s_c | 协作结束,生成最终总结 |
每个Agent的LLM根据当前历史消息 \mathcal{M}_t 和当前状态 s_t,自主决策下一个状态 s_{t+1} 和下一个发言Agent c_{t+1}。
核心实验结果
GAIA基准测试(工具异构场景):
-
IoA整体准确率40.00%,超过所有基线(AutoGen 39.39%, AutoGPT, FRIDAY等)
-
尤其在Level 3高难度任务上表现更优
RoCoBench(具身智能任务):
-
Cabinet成功率 100%, Sandwich成功率 100%, Sort成功率 100%
-
超越专用具身框架Roco Dialog(分别为75%, 70%, 70%)
-
性能与拥有全量环境信息的Central Plan基线相当
RAG任务(知识异构场景):
-
基于GPT-3.5的IoA整体性能0.610,与GPT-4的0.611几乎持平
-
3个同构Agent配置下达到0.671,超越所有单Agent基线
成本数据:
-
IoA通信成本约0.53美元/任务
-
去除通信重复内容后可下降近50%
6.3 A2A协议:Agent互联网的TCP/IP
2025年4月,Google发布了Agent2Agent (A2A) 协议,这是Agent通信标准化的重要里程碑。
核心定位:
-
A2A:Agent-to-Agent通信协议——解决Agent之间"如何协作"
-
MCP(Anthropic, 2024):Agent-to-Tool通信协议——解决Agent"如何做事"
两者是互补而非竞争关系。一个完整的Agent系统可以同时使用MCP调用工具,使用A2A与其他Agent协作。
A2A的核心特性:
-
Agent Card机制:每个Agent发布自身能力和技能描述,供其他Agent发现和理解
-
任务生命周期管理:定义完整的任务状态机和转换规则
-
流式与异步操作:支持长时间运行任务的异步协作
-
多租户支持:适配企业级部署需求
A2A + MCP + IoA 三者共同描绘了一幅Agent互联网的图景:Agent可以在全球范围内发现彼此、协商分工、交换信息——就像今天的互联网连接了所有计算机一样。
6.4 多智能体系统的失败模式
然而,多智能体协作并非万能灵药。2025年的MAST框架论文(《Why Do Multi-Agent LLM Systems Fail?》)通过对1600+执行轨迹的分析,识别出14种独特失败模式:
| 失败类别 | 占比 | 典型表现 |
|---|---|---|
| 规范与系统设计问题 | 40%+ | 目标不明确、角色边界模糊、协调协议缺失 |
| Agent间协调问题 | 30%+ | 信息传递失真、任务分配冲突、重复工作 |
| 任务验证问题 | 15%+ | 错误结果未被检测、验证标准不一致 |
多智能体系统失败率高达40%-90%。这一数据警示我们:增加Agent数量并不自动带来性能提升——相反,如果没有严谨的设计,多Agent系统的熵增将远超预期。
第七章 认知层面分析:Agent 为何变得越来越"聪明"
7.1 从符号到神经再到神经符号:一个螺旋上升
AI Agent执行路径规划的演进,本质上是一个螺旋上升的认知范式演变:
符号规划时代(1971-1990s) → 形式化保证,但领域建模困难 → LLM时代(2020-2023) → 通用性强,但缺乏形式化保证 → 神经符号融合(2024-present) → 综合两者优势
这并非是简单的替代关系,而是更高层次的综合。LLM-Modulo框架、CodeAct的代码执行验证、PlanBench的形式化验证——这些方法都在试图将LLM的"灵活创意"与符号系统的"严格验证"结合起来。
7.2 元认知能力:从ReAct到DeepSeek R1
Agent"聪明"的关键在于元认知能力——对自身认知过程的认知和调控。
在ReAct中,元认知表现为有限的"思考步":Agent可以停下来估量当前状态并做出行动计划。但这仍是浅层的——Agent并不真正"知道"自己是否在正确的轨道上,也不能系统地反思自己的决策模式。
Reflexion将元认知提升了一个层次:Agent不仅能"想",还能"反思"自己的表现并形成长期记忆。但这仍是事后反思。
DeepSeek R1的出现代表了元认知的质变:
-
自我验证:模型在推理过程中主动检查中间结果的正确性
-
动态策略适应:根据问题难度自动调整推理深度
-
上述能力是通过纯强化学习"涌现"的——没有人工标注的推理步骤,模型自己学会了"思考"
7.3 世界模型:从"反应"到"预测"
当前的Agent大多是基于"反应式"的范式——感知当前状态,做出相应动作。这种范式的根本局限在于:Agent无法预见自己行动的后果。
Yann LeCun一直倡导的世界模型(World Model)理念——即构建一个可以学习和预测环境动态的内部模型——代表着Agent规划的下一次范式转移。
在规划领域,世界模型解决的是"如果我执行这个动作,会发生什么?"的问题。目前已经有初步尝试:
MCTS + LLM(2024):将LLM同时用作世界模型(提供常识先验)和启发式策略(引导搜索到相关状态),在推理任务上优于纯MCTS或纯LLM策略。
过程奖励模型(PRM)(2024):提供步骤级别反馈而非仅结果评估。核心理念是过程奖励应衡量"进展"——每步前后正确响应概率的变化。AgentPRM仅3B参数即超越GPT-4o基线。
WALL-E 2.0(2025):仅4次迭代后就在ALFWorld上达到接近完美成功率。其方法是"世界对齐"——从探索中提取动作规则、知识图谱和场景图,然后用模型预测控制以LLM作为前瞻优化器。这是当前神经符号规划的最先进水平。
7.4 "AI Agents That Matter"的提醒
Princeton的Kapoor等人(2024)在《AI Agents That Matter》中提出了一系列深刻的批判:
-
准确率不是一切:当前基准测试狭隘地关注准确率而忽视成本——一个准确率90%但成本是100倍的Agent在实际应用中可能毫无价值
-
开发者角色混淆:模型开发者和应用开发者的基准需求截然不同,但当前基准将它们混为一谈
-
过拟合风险:许多基准的保留集(holdout sets)不足,Agent可以通过"捷径"刷榜
-
可复现性危机:评估实践缺乏标准化
他们证明:联合优化准确率和成本可以在大幅降低成本的同时保持准确率——这是一种更务实的Agent设计哲学。
第八章 未来发展方向
8.1 神经符号规划的全面复兴
PlanBench揭示的真相——LLM在Mystery Blocksworld上归零——说明了符号系统在精确规划中的不可替代性。未来的Agent执行路径规划将越来越趋向于神经符号混合架构:
-
神经部分(LLM/LRM):负责创意生成、语义理解、近似推理、不确定性下的决策
-
符号部分:负责形式化验证、约束满足、状态空间精确搜索
具体技术方向包括:
-
PDDL + LLM:LLM将自然语言目标翻译为PDDL,由经典规划器求解,LLM再将结果翻译回自然语言
-
LLM-Modulo扩展:在更多领域(代码、数学、科学推理)中构建外部验证器
-
可验证代码执行:CodeAct范式的进一步深化——所有Agent动作都可被代码解释器精确验证
8.2 世界模型驱动的规划
从Yann LeCun的JEPA架构到DeepMind的Genie,世界模型正在迅速发展。未来Agent将不是"反应式"的,而是"预测式"的——在做出每个动作之前,Agent会先在世界模型中"模拟"其后果。
LeWorldModel(2025年基于JEPA的轻量级世界模型)已经展示了"完整规划仅需1秒"的可能性——这预示着世界模型可能很快进入实用阶段。
当世界模型成熟后,Agent的执行路径规划将演变为:
-
内部模拟:在世界模型中快速模拟多种执行路径
-
风险评估:评估每条路径的成功概率和风险
-
最优选择:选择最优路径后,在真实环境中执行
这本质上是一种基于模型的强化学习与LLM推理的深度融合。
8.3 IoA + A2A:Agent互联网的形成
IoA框架和A2A协议共同指向一个更宏大的愿景:Agent互联网。
在这个图景中:
-
Agent注册与发现:全球Agent通过Agent Card机制注册自己的能力,被其他Agent发现和调用
-
动态团队组建:面对复杂任务,Agent自动搜索匹配的协作者,组建临时团队
-
标准化通信:通过A2A协议,不同厂商、不同框架构建的Agent可以无缝协作
-
嵌套任务分解:复杂任务被递归分解为子任务,分配给最合适的Agent组合
这与当前的"单一Agent"范式有本质区别——它不再是"一个聪明的Agent",而是"一个聪明的Agent网络"。
8.4 推理时扩展的持续深化
o1/o3和DeepSeek R1证明了推理时计算扩展是一条可行的道路。未来,模型的"推理预算"将成为一个可调参数:
-
简单问题:少量推理步,快速响应,低成本
-
复杂规划:大量推理步,深度思考,对应更高成本
-
动态路由:模型自动判断问题难度并分配适当的推理预算
8.5 多智能体的自组织与涌现
当前的多智能体系统(MetaGPT, CrewAI等)多为预定义的协作模式。未来将向自组织方向发展:
-
Agent根据任务动态决定是否组建团队
-
Agent自主协商分工和任务分配
-
协作模式从任务中涌现,而非预先设计
这需要对"什么是好的协作"有更深入的理论理解。MAST框架的失败模式分析为这一方向提供了起点——理解失败才能避免失败。
8.6 从工具使用到具身执行
Agent的执行路径规划从纯数字领域(搜索、编程)正逐步扩展到物理世界:
-
机器人规划:任务与运动规划(TAMP)与LLM的结合
-
具身Agent:在RoCoBench等基准上的进展表明,IoA等框架在具身任务上已经展现出了强大能力
-
仿真到现实迁移:在虚拟环境中训练的规划策略向真实世界迁移
第九章 结论
9.1 核心发现总结
本报告通过系统性调研,得出以下核心结论:
1. 执行路径规划是Agent智能的核心维度。 从STRIPS到DeepSeek R1,54年的演进历史表明:Agent的"聪明"不在于模型的参数量,而在于它如何规划、执行和验证自己的行动路径。
2. LLM单独无法可靠规划。 PlanBench的数据以令人震惊的清晰度证明了这一点——所有传统LLM在Mystery Blocksworld上准确率为0%或接近0%。但推理模型(o1, DeepSeek R1)带来了质的变化。
3. Agentic工作流比模型代数更重要。 Andrew Ng的实验数据(GPT-3.5+Agent > GPT-4裸用)揭示了一个深刻的设计原则:架构智能 > 模型智能。
4. 神经符号融合是未来方向。 LLM的创造性与符号系统的精确性相辅相成,而非互相替代。LLM-Modulo、CodeAct、WALL-E 2.0都指向这一方向。
5. 多智能体系统的挑战主要来自规范而非技术。 MAST框架的数据(40%+失败来自规范问题)警示我们:增加Agent数量需要更加严谨的系统设计。
6. Agent互联网正在形成。 IoA框架、A2A协议、MCP协议共同构成了Agent间协作的基础设施层——就像TCP/IP之于互联网。
9.2 从"更聪明的模型"到"更聪明的系统"
AI Agent执行路径规划的发展历程揭示了一个根本性的范式转变:我们不再仅仅追求"更聪明的模型",而是追求"更聪明的系统"。
一个"聪明的系统"需要:
-
认知多样性:神经部分(创意、语义理解)+ 符号部分(验证、精确推理)
-
架构智能:好的Agent工作流比好的模型更重要
-
群体智能:多Agent协作的涌现能力超越单Agent
-
成本意识:"好"的Agent是可负担的Agent
未来的AI Agent不会是一个孤立的超级智能体,而是一个连接在Agent互联网中的智能节点——它知道自己的边界,能在需要时寻找帮助,能在犯错后学习改进,能在执行前验证计划。这才是真正"聪明"的Agent。
参考文献
-
Fikes, R. E., & Nilsson, N. J. (1971). STRIPS: A new approach to the application of theorem proving to problem solving. Artificial Intelligence, 2(3-4), 189-208.
-
Blum, A. L., & Furst, M. L. (1995). Fast planning through planning graph analysis. IJCAI.
-
McDermott, D., et al. (1998). PDDL — The Planning Domain Definition Language. Yale Center for Computational Vision and Control.
-
Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
-
Kojima, T., et al. (2022). Large Language Models are Zero-Shot Reasoners. NeurIPS 2022.
-
Wang, X., et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023.
-
Yao, S., et al. (2023). ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023. [arXiv:2210.03629]
-
Yao, S., et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS 2023.
-
Besta, M., et al. (2024). Graph of Thoughts: Solving Elaborate Problems with Large Language Models. AAAI 2024.
-
Shinn, N., et al. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023.
-
Valmeekam, K., et al. (2022). PlanBench: An Extensible Benchmark for Evaluating Large Language Models on Planning. [arXiv:2206.10498]
-
Kambhampati, S., et al. (2024). LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks. ICML 2024.
-
Huang, J., et al. (2024). Large Language Models Cannot Self-Correct Reasoning Yet. ICLR 2024.
-
OpenAI. (2024). Learning to Reason with LLMs. [OpenAI Blog]
-
DeepSeek-AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. Nature.
-
Hong, S., et al. (2024). MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework. ICLR 2024 Oral. [arXiv:2308.00352]
-
Wu, Q., et al. (2024). AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. [arXiv:2308.08155]
-
Chen, W., et al. (2024). Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence. [arXiv:2407.07061]
-
Google. (2025). Announcing the Agent2Agent Protocol (A2A). [Google Developers Blog]
-
Anthropic. (2024). Model Context Protocol (MCP).
-
Kapoor, S., et al. (2024). AI Agents That Matter. [arXiv:2407.01502]
-
Ng, A. (2024). How Agents Can Improve LLM Performance. The Batch, DeepLearning.AI.
-
Various Authors. (2025). Why Do Multi-Agent LLM Systems Fail? (MAST Framework).
-
Various Authors. (2025). WALL-E 2.0: World Alignment by Rule Learning and Reasoning.
-
Various Authors. (2024). Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning.
本报告所有数据均来源于公开的学术论文、官方技术报告、基准测试排行榜和开源代码仓库。所有结论均基于可验证的真实数据,不存在臆造成分。
更多推荐


所有评论(0)