这是一篇面向产品、工程与运营同学的 Agent 入门文。目标是用尽可能通俗的方式,回答三个问题:

  • Agent 是什么、和“聊天机器人”有什么不同?
  • 搭一个通用型 Agent 需要哪些模块、如何协同?
  • 怎样以最低风险把它跑起来并可持续演进?

一句话公式:Agent = 感知(理解任务与获取证据) + 规划(拆解步骤与决策) + 执行(工具/代码) + 记忆(上下文与长期) + 反馈/评估(可复现与可回归)。

核心观点(先读这一段就够了)

  • Agent 不是“更聪明的聊天机器人”,而是一套可闭环运行的任务系统:能理解目标、查证据、做决策、调用外部能力并自我纠偏。
  • Agent 的关键不在于“写得像”,而在于“做得对”:证据优先、工具可控、结果可验证。
  • Agent 要从“能演示”走到“可运营”,必须有反馈/评估闭环:可观测、可复现、可回归,才能在变更中稳定迭代。

工作方式(通用闭环)

一个通用型 Agent 往往按下面的闭环运行。注意它不是一次性输出,而是“做一步、拿结果、再决定下一步”:

  1. 感知:把自然语言意图变成“任务卡片”,并检索需要的证据
  2. 规划:决定要不要调用工具、如何分步、失败怎么降级
  3. 执行:按 schema 调用工具或在沙箱里跑代码,拿到确定性结果
  4. 记忆:保留关键上下文,必要时写入长期偏好或状态
  5. 反馈/评估:自检与裁判评分,记录依赖,更新回归集与指标看板

五个核心模块

1. 感知(Perception):理解 + 找资料

  • 任务理解:提炼目标、约束、成功标准、输出格式,形成“任务卡片”。把日期、权限、可用工具等依赖显式写明,便于复现。
  • 检索增强(RAG):对企业文档/FAQ/数据库/网页做索引,按需检索相关片段拼入上下文。关键在“检索质量>模型臆想”。
  • 可信生成:只在证据范围内回答、不确定就拒答;答案与引用绑定,便于审计。
    经验法则:感知阶段越扎实,后续幻觉与返工越少。

2. 规划(Planning):把目标变成步骤

  • 分步推理(CoT):显式列出中间步骤,减少跳步与漏条件。
  • 搜索式规划(ToT):为开放式问题生成多个候选、评分剪枝,避免局部最优。
  • 状态机表达:用 JSON/DSL 表示每步的输入/输出/失败分支/停止条件,确保“计划可执行、可观测、可回滚”。
    经验法则:计划不是一次写死的,每步执行后都要基于结果更新。

3. 执行(Action):真正“把事做了”

  • 工具调用:给每个工具定义名称、参数 schema、返回结构与错误语义;参数必须校验,失败要有重试/降级/追问。
  • 代码执行:在受限沙箱里运行模型生成的代码,适合计算/转换/校验等确定性任务;记录输入/代码/输出三件套。
  • 输出装配:抽取结构化数据后由程序渲染成最终格式(MD/HTML/JSON),避免“模型直接排版”带来的不稳定。
    经验法则:执行层是风险集中地,务必做到权限最小化、可审计、可超时退出。

4. 记忆(Memory):跨轮与跨会话的连续性

  • 短期记忆:管理会话窗口,把关键事实做摘要化,减少上下文挤爆。
  • 长期记忆:保存用户偏好与任务状态,按需检索注入上下文;注意权限、加密、生命周期与“可删除”。
    经验法则:记忆写入要谨慎,先评估再固化,避免把错误“长期保存”。

5. 反馈/评估(Evaluation):从“能用”到“可运营”

  • 自动化评测:裁判模型 + 评分标准(标准谁来定?),评正确性/完整性/引用质量/格式/拒答策略,并用于候选重排与离线对比。
  • 自我修正:生成后按清单自检再改写;设置最大轮数与停止条件,平衡成本与质量。
  • 可复现:记录日期/配置/证据/工具返回等依赖,保证问题可重放与定位。
  • 退化测试:维护回归集,任何变更(模型/提示/索引/工具)都要过门槛;把延迟与成本纳入质量标准。
    经验法则:没有评估闭环的 Agent,很难稳定上线,更难长期迭代。

三种常见架构

把“五个模块”装配成系统时,通常会落在三种架构形态。它们的差别不在于能力强弱,而在于复杂度、成本与可控性:

  • 单体闭环:感知→规划→执行→评估,适合简单流程与 MVP。
  • Planner–Executor:由 Planner 负责分解与决策,Executor 专注工具/代码与汇总;清晰可控。
  • 多 Agent 协作:Planner/Researcher/Writer/Reviewer/Executor 分工,适合长流程;需防“回音室效应”和成本爆炸。

这里的“回音室效应”指的是:多个 Agent 看似在互相复核,但实际上都在重复同一套假设或错误结论,彼此引用对方的话当证据,导致错误被放大而不是被纠正。常见表现是 Reviewer 只做语言润色不做事实核验,或者 Researcher 在检索不到证据时仍然给出“看起来合理”的材料。规避方式是强制引入外部证据与确定性校验:要求关键结论必须绑定引用/数据来源,必要时用工具计算、规则校验或独立裁判模型做判定。

快速上手清单(可直接落地)

如果你是第一次做 Agent,不必追求一步到位。更稳妥的方式是从“最小可用闭环”开始,把核心链路跑通后再逐步加能力:

  • 提示与输入:定义“任务卡片”JSON Schema,系统提示明确边界与拒答条件
  • 检索:先做小规模索引(高命中数据),RAG 模板 + Top-K 控制在窗口内
  • 规划:CoT 模板 + 简易状态机(含失败分支与停止条件)
  • 执行:1–2 个高价值工具(schema 严格、参数校验、超时重试降级),代码执行沙箱化
  • 记忆:只做短期摘要;长期记忆先观望,等明确收益再引入
  • 评估:5–10 条离线回归样本 + LLM 裁判 + 关键指标(正确率、引用质量、拒答率、延迟、成本)

关键指标(运营视角)

Agent 一旦进入真实用户流量,就需要同时看质量、效率、成本与安全稳定性,避免“看起来不错但不可运营”:

  • 质量:正确率、引用覆盖率/一致性、用户满意度、拒答得当率
  • 效率:平均延迟、P95 延迟、步骤数、工具调用次数
  • 成本:每请求 token、工具成本、检索成本
  • 稳定性与安全:错误率、超时率、越权拦截率、可复现率

常见陷阱与规避

  • 幻觉:缺少证据与引用绑定 → 加强检索质量与可信生成
  • 不可复现:隐式依赖太多 → 全量记录依赖与证据包
  • 格式不稳:自由文本输出 → 语法/Schema 约束 + 程序拼装
  • 工具不稳:无校验无降级 → 参数校验 + 超时/重试/追问
  • 成本飙升:一味上大模型、多轮循环 → 小模型分层 + 停止条件

何时用 Agent,何时不用

  • 适合:需要多步决策、查多源资料、调用外部系统、持续优化的任务
  • 不适合:规则明确、流程固定、确定性强的任务(直接写程序更稳更便宜)

更多推荐