02. AI Agent的四大核心认知框架
Agent之所以能像人一样解决复杂问题,背后离不开一套成熟的认知模式。目前主流的认知框架主要有四种:ReAct模式、Plan-and-Execute模式、Self-Ask模式以及Thinking and Self-Reflection模式。它们各有侧重,适用于不同的任务场景。
下面,我们就来逐一拆解。
一、ReAct模式:思考-行动-观察的循环
ReAct模式是目前最经典、最广为人知的Agent框架。它的核心思想可以概括为一个“思考-行动-观察”的三元组循环。
- Thought (思考): 模型基于当前状态,用自然语言推理出下一步该做什么。这一步是透明的,我们可以清晰地看到模型的“内心独白”。
- Action (行动): 模型执行具体操作,比如调用一个搜索工具,或者直接给出最终答案。
- Observation (观察): 模型接收行动产生的结果。如果是调用了工具,观察结果就是工具返回的数据。
随后,模型会将“观察”到的结果作为新一轮“思考”的输入,不断循环,直到问题解决。

优点: 过程透明,结果可靠,易于调试。
适用场景: 适合不确定性高、需要探索和试错的任务。
不适用场景: 不适合流程固定、可预见的任务。
二、Plan-and-Execute模式:先规划,后执行
与ReAct的“走一步看一步”不同,Plan-and-Execute模式更像一位严谨的项目经理,它强调先制定完整计划,再按部就班地执行。
这个模式分为两个阶段:
- 规划阶段 (Plan): 模型一次性接收完整任务,并输出一个标准化的步骤清单。这个过程通常只调用一次模型。
- 执行阶段 (Execute): 系统严格按照清单顺序逐条执行。在执行过程中,模型不再进行复杂推理,只负责执行工具调用。只有出现异常时,才可能重新调用模型进行规划。

优点:
- 高效低成本: 模型调用次数极少,速度快,API成本低。
- 流程可控: 步骤固定,便于监控和日志审计。
- 可并行: 无依赖关系的步骤可以并行执行,提升效率。
缺点: 灵活性较差。一旦执行中出现计划外的意外,无法动态调整,可能需要重新规划。
三、Self-Ask模式:自问自答,化繁为简
Self-Ask模式的核心在于问题拆解。当面对一个复杂问题时,模型不会直接尝试回答,而是先将其分解为一系列更简单的子问题。
其工作流程如下:
- 拆解: 将原始复杂问题分解成多个子问题。
- 检索: 针对每个子问题,调用外部工具(如搜索引擎、向量数据库)来获取准确的事实信息。
- 综合: 模型根据所有子问题的答案,进行推理和整合,最终给出原始问题的答案。

这种模式通常与检索工具配合使用,让模型专注于推理和拆解,让工具专注于提供事实,有效避免了模型“胡编乱造”(幻觉)的问题。
四、Thinking and Self-Reflection模式:自我反思与修正
为什么需要自我反思?因为Agent在初次尝试时可能会犯错,例如:调用错误的工具、参数提取错误、逻辑错误或遗漏关键信息。
自我反思机制就是为了解决这些问题而生的,它引入了一个**“评价-修正”的迭代循环**:
- 执行: Agent完成任务,得到一个初步结果。
- 评价: 调用一个“反思模型”来评估结果。评估维度包括:完整性、准确性、逻辑一致性、格式要求等。这个反思模型可以是同一个模型(通过不同的提示词实现),也可以是另一个更强大的模型。
- 修正: 如果评估发现不足,模型会生成修正意见,并重新执行或直接修改结果。这个过程可以迭代进行,直到结果满足要求。

这里有两个概念值得注意:
- 反思 (Self-Reflection): Agent对自己的输出进行评价和修正。
- 审计 (Audit): 通常由一个独立的Agent来检查其他Agent的输出。
缺点: 虽然提升了可靠性,但代价是增加了额外的模型调用次数和响应时间。
五、模式对比与组合应用
为了让大家更直观地理解,我将这几种模式的特点整理成了下表:
| 模式 | 核心思想 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|---|
| ReAct | 思考-行动-观察循环 | 过程透明,可调试 | 步骤多,成本较高 | 探索性、不确定性高的任务 |
| Plan-and-Execute | 先规划,后执行 | 效率高,成本低,流程可控 | 灵活性差,难应对意外 | 流程固定、步骤明确的任务 |
| Self-Ask | 拆解问题,自问自答 | 避免幻觉,答案准确 | 依赖外部工具 | 需要事实依据的复杂问答 |
| Self-Reflection | 评价并修正自身输出 | 结果更可靠,质量更高 | 增加延迟和成本 | 对结果质量要求极高的场景 |
在实际开发中,这些模式并非孤立存在,而是可以灵活组合,发挥各自的优势。例如:
- ReAct + Self-Ask: 在ReAct的“思考”环节,使用Self-Ask模式来确保事实的准确性。
- Plan-and-Execute + Reflection: 在Plan-and-Execute的每个步骤执行后,加入反思环节,确保每一步都正确无误。
- ReAct + Plan-and-Execute: 对于大任务使用Plan-and-Execute进行宏观规划,对于规划中的某个复杂子任务,则使用ReAct模式进行微观探索。
结语
理解这些核心认知框架,是构建强大、可靠AI Agent的第一步。每种模式都有其独特的设计哲学和适用边界。作为开发者,我们需要根据具体的业务场景,选择最合适的模式,或将它们巧妙地组合起来,才能打造出真正智能的Agent应用。
希望这篇笔记能对大家理解Agent有所帮助!欢迎在评论区一起交流讨论。
更多推荐



所有评论(0)