Agentic AI 架构入门(二):AI Agent 的定义、原则与决策框架

课程:《Agentic AI Architectures with Patterns, Frameworks and MCP》笔记整理(第 28–65 页)


1. 什么是 AI Agent

1.1 直觉:它是「数字员工」

Agent 不是工具,是「数字员工(Digital Employee)」——你给它一个目标(Goal),它有技能(工具/API),它自主工作达成目标。

1.2 正式定义:Agentic Loop(智能体循环)

Agent = 不断重复三步循环:

  1. **感知(Perceive)**其环境
  2. **推理(Reason)**做决策
  3. 行动(Act)(自主地)达成目标

1.3 Agent 的 4 大原则

原则 中文 核心含义 关键对比
1. Goal-Driven 目标驱动 Agent 由目标定义,而非指令 脚本:“下午 5 点跑这个报表” vs Agent:“确保高管团队每天早晨拿到最新销售数据”
2. Autonomy 自主性 无需逐步人工干预,自己决定怎么做 告诉开发者做什么功能,而不是敲哪几行代码——告诉它 WHAT,不是 HOW
3. Reactivity 反应性 能响应环境变化(世界是动态不可预测的) 脚本调 API 遇 500 错误→崩溃;Agent:感知错误→推理→应对
4. Pro-activeness 主动性 不只被动反应,还能主动预见 反应式:“磁盘满了!” vs 主动式:“磁盘 90% 了,我正在主动归档旧日志防止崩溃”

汇总公式:AI Agent = 目标驱动 + 自主性 + 反应性 + 主动性

它不是脚本,也不只是 LLM,而是一种新型软件组件:能代表我们行动


2. Agent 如何使用生成式 AI

2.1 生成式 AI vs Agentic AI:核心区别

维度 Generative AI Agentic AI
角色 反应式系统(Reactive) 主动式系统(Proactive)
触发 等待用户 Prompt 一个目标(常来自初始提示)
功能 生成内容 通过一系列行动追求目标
机制 复杂的模式匹配 持续的「生命周期」/循环
输出 文本、图片、代码、音频 行动结果
关键局限 它的工作在「生成」那一刻就结束了 以最少人工干预持续运转

2.2 共同基础:LLM

  • 生成式 AI 里,LLM 是主干(backbone)
  • Agentic AI 里,LLM 是推理引擎(Reasoning Engine)——Agent 决策的大脑

2.3 应用对比:策展人 vs 经理

  • 生成式 AI = 「策展人(Curator)」:YouTuber 创作视频——写脚本→AI 建议修改→人类优化提示→AI 建议缩略图→人类选择。每一步都有人类在场
  • Agentic AI = 「经理(Manager)」:自主购物 Agent——主动跨平台找货→实时监控价格波动→用工具完成结账→协调配送。全程无需人类插手

2.4 深层连接:LLM 是 Agent 的「思考」

Agent 怎么「决定」做什么?→ 用 LLM 的推理能力。关键机制:思维链 Chain of Thought (CoT)——把复杂任务拆成小步骤逐步思考。


3. 何时该用 Agent

3.1 核心架构抉择:工具 vs 工人

脚本/函数 = 锤子 AI Agent = 木匠
用途 特定、明确的任务(“敲这颗钉子”) 通用、开放式目标(“给我做个书架”)
特性 确定性、快、便宜、100% 可预测 非确定性、慢、昂贵、能适应
自问 我是在敲钉子,还是在造书架?

3.2 不该用 Agent(红灯)

  • 黄金法则:能写函数就别用 Agent
  • 简单、确定、高度结构化的任务
  • 要求 100% 可预测和严格守规
  • 简单信息检索(基础 RAG 就够)
  • 没有清晰目标或无法行动

3.3 该用 Agent(绿灯)

  1. 开放式、定义不明确的问题
  2. 多步骤、多工具流程
  3. 动态环境
  4. 需要随时间改进
  5. 对话式、协作式界面

3.4 两类典型问题

  • 开放式问题:步骤序列事先未知,传统代码无法硬编码工作流;Agent 的 LLM 能在运行时决定步骤。
    • 坏例子(定义明确):CSV 转 JSON → 用脚本
    • 好例子(开放式):分析这个 CSV,给市场团队找出三条最重要的洞察
  • 多步多工具流程:单次调用解决不了;必须串联多个工具(搜索→查数据库→发邮件);需要跨多轮保持状态和记忆。这里 Agent 的三件套首次同框:LLM + Tools + Memory。例:研究助手 = 搜网页 + 总结文档 + 综合成报告

3.5 决策框架(重要)

  1. 任务简单且确定?→ 脚本/函数
  2. 任务复杂但步骤明确?→ 工作流(Workflow)
  3. 任务复杂、开放式、动态环境?→ AI Agent

好用例的三要素:开放式目标(不是具体指令)+ 自主行动 + 多步多工具。


4. 用例全景

类别 用例 目标 → 行动(工具链)
企业自动化 企业管理员「AI 实习生」 入职新工程师:开通账号 + 发欢迎邮件 + 约 1v1 会议
企业自动化 高级客服「Tier 2 Agent」 订单坏了:验证身份 + 查订单 + 分析损坏照片并 API 退款
技术/数据 自主数据分析 分析销售 CSV:写并执行 Python 代码 + 生成图表 + 文字总结
技术/数据 主动研究(Agentic RAG) 写太阳能报告:规划 + 研究 10 个网页 + 综合并起草 + 自我批判后定稿
技术/数据 AI 结对程序员 重构模块:分析代码 → 重写 → 跑测试 → 感知失败 → 循环调试自己
复杂集成 IoT 农业 提高产量省水:土壤传感器 + 天气 API → 推理最佳时机 → 触发灌溉系统
复杂集成 灾害响应(多智能体) 地震协调:Coordinator 派 Specialist 并行——Satellite_Agent 找损毁、Social_Media_Agent 找受灾者
商业/科学 电商营销 闪购成功:分析客群 + 写个性化邮件 + 实时监控 + 自动调广告预算
商业/科学 医疗科研 找候选药物:规划流程 + 搜医学库 + 分子模拟 + 分析 + 汇总 Top5

5. Agent 的挑战与局限

没有「魔法」解决方案。能力越大,复杂度和风险越大。我们的工作不是构建「可能」,而是构建健壮、安全、可靠的系统。

五大挑战(= 架构师的五大职责)

挑战 问题 架构师之问
1. 非确定性 传统代码确定性(2+2 恒等于 4);LLM 是随机的,同样目标每次产出略不同。这不是 bug,是模型的固有特性 怎么给「每次输出都不同」的系统写单元测试?怎么保证可靠性?
2. 安全与护栏 给自主系统访问真实工具(API/数据库/文件系统)的风险:销售 Agent 为「成交」擅自给 90% 折扣;配置错误的 Admin Agent 因模糊目标「清理数据库」而调用 DELETE /users/all 怎么在「自主+创造」的系统上强制严格权限和护栏?
3. 成本与延迟 循环里每一步都是 LLM 调用:5 步任务可能要 10–15 次调用,比脚本贵千倍;LLM 慢(秒级),5 步任务 20–30 秒,实时场景不可接受 怎么设计省成本、防「失控循环」?怎么用异步模式管理延迟?
4. 可观测性 传统代码挂了有堆栈追踪;Agent 挂了有什么?是误解目标?选错工具?还是计划逻辑错误? 怎么记录、追踪、调试 Agent 的内心独白(思维链)
5. 幻觉 LLM 生成「看似合理」而非「真实」的文本。两种:事实性(编造事实/数字:说 50 美元实际 75 美元)和行动性(编造不存在的工具或参数) 怎么让 Agent 扎根现实?怎么严格定义工具让它「想象」不出新工具?

课程的表达方式很巧妙:五大挑战全部压在同一张 Agent 核心架构图(LLM + Tools + Memory)之上,一个都不能躲。
态度:这些不是障碍,而是我们的工作(These Are Not Blockers, They Are Our Job)


6. 设计你的第一个 Agent:Weather Agent(天气智能体)

  • 目标:自主回答两段式用户查询——“伦敦天气怎么样,我该带伞吗?”
  • 为什么这是 Agentic 任务:不是简单问答,需要两步:① 获取外部数据(天气)② 基于数据推理(是否带伞的建议)

架构:组件如何连接(本段最重要的图):

  • 用户(User)在最左,通过 Goal(目标) 发起
  • 中间核心框 Weather Agent:包含 LLM(中间)和 Tools 工具(下方)
  • 最右:Weather Data(天气数据)——工具调用的外部数据源
  • 底部:Reasoning(推理)→ Final Answer(最终答案)
  • 数据流:User → Goal → Tool Call → Weather Agent → Weather Data → 推理 → 最终答案

解读:这个架构就是「数字员工」的最小落地——LLM 负责推理(该不该带伞),Tools 负责取数(天气 API),两者结合才产出答案。取数 + 推理 = Agentic 任务的最小单元


7. 小结

本段精华:

  1. Agent 的定义:数字员工 = 感知→推理→行动 的循环(Agentic Loop),由目标驱动而非指令
  2. 4 原则记忆钩子:目标驱动 + 自主 + 反应 + 主动(Goal、Autonomy、Reactivity、Pro-activeness)
  3. 生成式 AI vs Agentic AI:被动回答 vs 主动追求目标;LLM 从「骨干」变成「推理引擎」;人类从「每步在场」到「只给目标」
  4. 选择框架:简单确定→脚本;复杂但步骤明确→工作流;复杂开放动态→Agent。自问:“我是在敲钉子,还是造书架?”
  5. Agent 三件套首次同框:LLM + Tools + Memory——后面逐组件深挖的预告
  6. 五大挑战 = 架构师的五大职责:非确定性、安全护栏、成本延迟、可观测性、幻觉
  7. Weather Agent:取数(工具)+ 推理(LLM)= Agentic 任务最小单元,是后面所有实战的原型
  8. 下一个里程碑:逐个深挖 Agent 的 7 大组件:🧠 Brain(LLM)→ 👁️ Senses(感知)→ 📐 Blueprint(规划)→ 📓 Notebook(记忆)→ 🖐️ Hands(行动)→ 🔄 Feedback Loop(学习)→ 🗣️ Voice(通信)

更多推荐