Day 1:理解 Agent 核心公式

目标

弄懂一个公式:Agent = LLM + 上下文 + 工具,并且理解为什么这三个缺一不可。


核心知识点

1. Agent 到底是什么?

很多人以为 Agent 就是"调一下大模型 API",但作者李博杰在引言里说得很清楚——这个公式是全书的基石:

Agent = LLM + 上下文 + 工具 = 大脑 + 眼睛 + 手脚

直觉比喻 实现组件 做什么
大脑 LLM 决策:下一步做什么、调哪个工具、传什么参数
眼睛 上下文 感知:Agent 能看到的所有信息
手脚 工具 行动:Agent 能执行的所有操作

一个光有大脑的人不能办事(看不到信息、动不了手),同样,光有 LLM 也不是 Agent。

2. 上下文的五个组成部分

这是今天最重要的知识点。每次调用 LLM 时,上下文就是一个消息列表,由五部分构成:

  1. 系统提示词(静态)— Agent 的"岗位说明书":你是谁、能做什么、不能做什么
  2. 工具定义(静态)— 有哪些工具可用、每个工具怎么调
  3. 用户消息(动态)— 用户说的话 + RAG 检索来的外部知识
  4. 模型回复(动态)— Agent 之前的思考过程 + 文本回复 + 工具调用请求
  5. 工具执行结果(动态)— 工具跑完返回的结果

核心公式:上下文 = 静态前缀(1+2)+ 轨迹(3+4+5 的动态历史)

3. 工具分五类
  • 感知工具:获取信息(搜索、读文件、查数据库)
  • 执行工具:改变世界(写文件、运行代码、调 API)
  • 协作工具:分工合作(委托子 Agent、请人类确认)
  • 事件触发工具:外部驱动 Agent(邮件到达、定时触发)— 注意:这个是外部驱动,不是 Agent 主动调的
  • 用户沟通工具:与用户建立连接(发消息、打电话、发邮件)
4. 为什么 Harness 才是竞争力

Demo 公式:Agent = LLM + 上下文 + 工具

生产公式:Agent = LLM + [上下文 + 工具 + 约束 + 验证 + 纠正] = Model + Harness

当各家模型能力越来越接近时,竞争优势就转移到了模型之外的工程实践。例如作者的老东家Pine AI 在 Skill、Harness、Loop Engineering 这些概念流行之前,就已经在实践中摸索出了同样的方法——实践在前,命名在后。

更多推荐