Agentic AI 架构入门(二):AI Agent 的定义、原则与决策框架
·
Agentic AI 架构入门(二):AI Agent 的定义、原则与决策框架
课程:《Agentic AI Architectures with Patterns, Frameworks and MCP》笔记整理(第 28–65 页)
1. 什么是 AI Agent
1.1 直觉:它是「数字员工」
Agent 不是工具,是「数字员工(Digital Employee)」——你给它一个目标(Goal),它有技能(工具/API),它自主工作达成目标。
1.2 正式定义:Agentic Loop(智能体循环)
Agent = 不断重复三步循环:
- **感知(Perceive)**其环境
- **推理(Reason)**做决策
- 行动(Act)(自主地)达成目标
1.3 Agent 的 4 大原则
| 原则 | 中文 | 核心含义 | 关键对比 |
|---|---|---|---|
| 1. Goal-Driven | 目标驱动 | Agent 由目标定义,而非指令 | 脚本:“下午 5 点跑这个报表” vs Agent:“确保高管团队每天早晨拿到最新销售数据” |
| 2. Autonomy | 自主性 | 无需逐步人工干预,自己决定怎么做 | 告诉开发者做什么功能,而不是敲哪几行代码——告诉它 WHAT,不是 HOW |
| 3. Reactivity | 反应性 | 能响应环境变化(世界是动态不可预测的) | 脚本调 API 遇 500 错误→崩溃;Agent:感知错误→推理→应对 |
| 4. Pro-activeness | 主动性 | 不只被动反应,还能主动预见 | 反应式:“磁盘满了!” vs 主动式:“磁盘 90% 了,我正在主动归档旧日志防止崩溃” |
汇总公式:AI Agent = 目标驱动 + 自主性 + 反应性 + 主动性
它不是脚本,也不只是 LLM,而是一种新型软件组件:能代表我们行动。
2. Agent 如何使用生成式 AI
2.1 生成式 AI vs Agentic AI:核心区别
| 维度 | Generative AI | Agentic AI |
|---|---|---|
| 角色 | 反应式系统(Reactive) | 主动式系统(Proactive) |
| 触发 | 等待用户 Prompt | 一个目标(常来自初始提示) |
| 功能 | 生成内容 | 通过一系列行动追求目标 |
| 机制 | 复杂的模式匹配 | 持续的「生命周期」/循环 |
| 输出 | 文本、图片、代码、音频 | 行动结果 |
| 关键局限 | 它的工作在「生成」那一刻就结束了 | 以最少人工干预持续运转 |
2.2 共同基础:LLM
- 生成式 AI 里,LLM 是主干(backbone)
- Agentic AI 里,LLM 是推理引擎(Reasoning Engine)——Agent 决策的大脑
2.3 应用对比:策展人 vs 经理
- 生成式 AI = 「策展人(Curator)」:YouTuber 创作视频——写脚本→AI 建议修改→人类优化提示→AI 建议缩略图→人类选择。每一步都有人类在场
- Agentic AI = 「经理(Manager)」:自主购物 Agent——主动跨平台找货→实时监控价格波动→用工具完成结账→协调配送。全程无需人类插手
2.4 深层连接:LLM 是 Agent 的「思考」
Agent 怎么「决定」做什么?→ 用 LLM 的推理能力。关键机制:思维链 Chain of Thought (CoT)——把复杂任务拆成小步骤逐步思考。
3. 何时该用 Agent
3.1 核心架构抉择:工具 vs 工人
| 脚本/函数 = 锤子 | AI Agent = 木匠 | |
|---|---|---|
| 用途 | 特定、明确的任务(“敲这颗钉子”) | 通用、开放式目标(“给我做个书架”) |
| 特性 | 确定性、快、便宜、100% 可预测 | 非确定性、慢、昂贵、能适应 |
| 自问 | 我是在敲钉子,还是在造书架? |
3.2 不该用 Agent(红灯)
- 黄金法则:能写函数就别用 Agent
- 简单、确定、高度结构化的任务
- 要求 100% 可预测和严格守规
- 简单信息检索(基础 RAG 就够)
- 没有清晰目标或无法行动
3.3 该用 Agent(绿灯)
- 开放式、定义不明确的问题
- 多步骤、多工具流程
- 动态环境
- 需要随时间改进
- 对话式、协作式界面
3.4 两类典型问题
- 开放式问题:步骤序列事先未知,传统代码无法硬编码工作流;Agent 的 LLM 能在运行时决定步骤。
- 坏例子(定义明确):CSV 转 JSON → 用脚本
- 好例子(开放式):分析这个 CSV,给市场团队找出三条最重要的洞察
- 多步多工具流程:单次调用解决不了;必须串联多个工具(搜索→查数据库→发邮件);需要跨多轮保持状态和记忆。这里 Agent 的三件套首次同框:LLM + Tools + Memory。例:研究助手 = 搜网页 + 总结文档 + 综合成报告
3.5 决策框架(重要)
- 任务简单且确定?→ 脚本/函数
- 任务复杂但步骤明确?→ 工作流(Workflow)
- 任务复杂、开放式、动态环境?→ AI Agent
好用例的三要素:开放式目标(不是具体指令)+ 自主行动 + 多步多工具。
4. 用例全景
| 类别 | 用例 | 目标 → 行动(工具链) |
|---|---|---|
| 企业自动化 | 企业管理员「AI 实习生」 | 入职新工程师:开通账号 + 发欢迎邮件 + 约 1v1 会议 |
| 企业自动化 | 高级客服「Tier 2 Agent」 | 订单坏了:验证身份 + 查订单 + 分析损坏照片并 API 退款 |
| 技术/数据 | 自主数据分析 | 分析销售 CSV:写并执行 Python 代码 + 生成图表 + 文字总结 |
| 技术/数据 | 主动研究(Agentic RAG) | 写太阳能报告:规划 + 研究 10 个网页 + 综合并起草 + 自我批判后定稿 |
| 技术/数据 | AI 结对程序员 | 重构模块:分析代码 → 重写 → 跑测试 → 感知失败 → 循环调试自己 |
| 复杂集成 | IoT 农业 | 提高产量省水:土壤传感器 + 天气 API → 推理最佳时机 → 触发灌溉系统 |
| 复杂集成 | 灾害响应(多智能体) | 地震协调:Coordinator 派 Specialist 并行——Satellite_Agent 找损毁、Social_Media_Agent 找受灾者 |
| 商业/科学 | 电商营销 | 闪购成功:分析客群 + 写个性化邮件 + 实时监控 + 自动调广告预算 |
| 商业/科学 | 医疗科研 | 找候选药物:规划流程 + 搜医学库 + 分子模拟 + 分析 + 汇总 Top5 |
5. Agent 的挑战与局限
没有「魔法」解决方案。能力越大,复杂度和风险越大。我们的工作不是构建「可能」,而是构建健壮、安全、可靠的系统。
五大挑战(= 架构师的五大职责)
| 挑战 | 问题 | 架构师之问 |
|---|---|---|
| 1. 非确定性 | 传统代码确定性(2+2 恒等于 4);LLM 是随机的,同样目标每次产出略不同。这不是 bug,是模型的固有特性 | 怎么给「每次输出都不同」的系统写单元测试?怎么保证可靠性? |
| 2. 安全与护栏 | 给自主系统访问真实工具(API/数据库/文件系统)的风险:销售 Agent 为「成交」擅自给 90% 折扣;配置错误的 Admin Agent 因模糊目标「清理数据库」而调用 DELETE /users/all | 怎么在「自主+创造」的系统上强制严格权限和护栏? |
| 3. 成本与延迟 | 循环里每一步都是 LLM 调用:5 步任务可能要 10–15 次调用,比脚本贵千倍;LLM 慢(秒级),5 步任务 20–30 秒,实时场景不可接受 | 怎么设计省成本、防「失控循环」?怎么用异步模式管理延迟? |
| 4. 可观测性 | 传统代码挂了有堆栈追踪;Agent 挂了有什么?是误解目标?选错工具?还是计划逻辑错误? | 怎么记录、追踪、调试 Agent 的内心独白(思维链)? |
| 5. 幻觉 | LLM 生成「看似合理」而非「真实」的文本。两种:事实性(编造事实/数字:说 50 美元实际 75 美元)和行动性(编造不存在的工具或参数) | 怎么让 Agent 扎根现实?怎么严格定义工具让它「想象」不出新工具? |
课程的表达方式很巧妙:五大挑战全部压在同一张 Agent 核心架构图(LLM + Tools + Memory)之上,一个都不能躲。
态度:这些不是障碍,而是我们的工作(These Are Not Blockers, They Are Our Job)
6. 设计你的第一个 Agent:Weather Agent(天气智能体)
- 目标:自主回答两段式用户查询——“伦敦天气怎么样,我该带伞吗?”
- 为什么这是 Agentic 任务:不是简单问答,需要两步:① 获取外部数据(天气)② 基于数据推理(是否带伞的建议)
架构:组件如何连接(本段最重要的图):
- 用户(User)在最左,通过 Goal(目标) 发起
- 中间核心框 Weather Agent:包含 LLM(中间)和 Tools 工具(下方)
- 最右:Weather Data(天气数据)——工具调用的外部数据源
- 底部:Reasoning(推理)→ Final Answer(最终答案)
- 数据流:User → Goal → Tool Call → Weather Agent → Weather Data → 推理 → 最终答案
解读:这个架构就是「数字员工」的最小落地——LLM 负责推理(该不该带伞),Tools 负责取数(天气 API),两者结合才产出答案。取数 + 推理 = Agentic 任务的最小单元。
7. 小结
本段精华:
- Agent 的定义:数字员工 = 感知→推理→行动 的循环(Agentic Loop),由目标驱动而非指令
- 4 原则记忆钩子:目标驱动 + 自主 + 反应 + 主动(Goal、Autonomy、Reactivity、Pro-activeness)
- 生成式 AI vs Agentic AI:被动回答 vs 主动追求目标;LLM 从「骨干」变成「推理引擎」;人类从「每步在场」到「只给目标」
- 选择框架:简单确定→脚本;复杂但步骤明确→工作流;复杂开放动态→Agent。自问:“我是在敲钉子,还是造书架?”
- Agent 三件套首次同框:LLM + Tools + Memory——后面逐组件深挖的预告
- 五大挑战 = 架构师的五大职责:非确定性、安全护栏、成本延迟、可观测性、幻觉
- Weather Agent:取数(工具)+ 推理(LLM)= Agentic 任务最小单元,是后面所有实战的原型
- 下一个里程碑:逐个深挖 Agent 的 7 大组件:🧠 Brain(LLM)→ 👁️ Senses(感知)→ 📐 Blueprint(规划)→ 📓 Notebook(记忆)→ 🖐️ Hands(行动)→ 🔄 Feedback Loop(学习)→ 🗣️ Voice(通信)
更多推荐



所有评论(0)