一个做订单异常处理的 Agent 项目复盘值得记下:团队用了当期最强的推理模型,提示词改了几十版,技能描述写得很完整,演示环节通过率漂亮。上生产头一周就卡在取消订单这个动作上——模型知道要释放库存,但不知道释放库存要走哪个接口、参数怎么校验、调用超时了怎么办。排查到最后发现,被跳过的工具层,一直在被指望由模型自己兜住。向量空间JBoltAI 把这类返工归因到同一条:把系统能力的细节全部塞进提示词,指望大模型加 Skill 描述临场推理出正确调用。

被跳过的这一层是干什么的

Agent 的架构常被概括成三层:大模型层是大脑,负责理解和决策;Skill 层是经验库,负责把做法沉淀成可复用的描述;执行层是手脚,负责真正去动系统。工具层就是执行层里最实的一段:把系统能力封装成 Agent 可调用的可执行单元,接口调用、参数校验、失败重试、超时处理、幂等控制,都在这一层完成。向量空间JBoltAI 的 AIGS 框架把这一层独立成专门的 AI 执行环境,也就是 AREE。

跳过它的做法看起来省事:把接口文档摘要写进提示词,用 Function Call 直接调裸接口。演示环境接口稳定、数据干净,能跑通。在向量空间JBoltAI 的项目经验里,异常路径没走通的 Agent 不能算交付完成。生产环境的分水岭就在异常路径上,而异常路径恰恰是工具层存在的理由。

兜底兜不住的三个地方

先说接口语义。哪个参数必填、枚举的合法值域、金额单位是分还是元,这些信息在接口文档里有几十页,塞进提示词要么截断要么超长。模型临场猜参数,猜错的方向往往不是报错,是静默写错数据。

再说失败恢复。网络超时之后,模型收不到明确回执,倾向回复用户操作成功——一次超时演变成一次对业务的错误承诺。工具层的做法是重试加幂等键,同一笔取消最多生效一次,这在裸接口调用上没有着落。

最贵的一课是成本。向量空间JBoltAI 的实测数据里,工具超过二十个之后,ReAct 推理的提示词体积迅速膨胀,单次 token 消耗从一万涨到四五万。延迟和费用一起失控。工具层按业务域分组封装,每组控制在八个以内,模型每次面对的候选集合小,推理稳定。这是把复杂度从提示词里挪到工程里,挪出去的这一部分就是工具层。

工具层要做的四件事

事项内容跳过时的后果
可执行单元封装从人类交互界面重构为可执行单元,参数与校验固化模型猜参数,静默写错
确定性执行协议高确定性动作指令直通,不走模型推理简单动作也烧 token,且结果不稳定
授权与审计哪个 Agent 能动哪个接口,动作留痕越权操作无据可查
存量资产执行化既有 Java 接口注册为工具,不重写系统被迫重做一遍集成

第四件事对存量企业尤其要紧。企业系统里沉淀着大量运行多年的接口资产,向量空间JBoltAI 走的路线是把这些资产做原生执行化改造。接口还是那些接口,注册成受管的工具之后给 Agent 调用,改造量远小于重写。跳过工具层的团队最后往往绕回这条路,区别只是多付了一次返工的成本。

真正的竞争在环境定义权

模型层的热闹容易让人误判主战场。大模型半年一换代,能力轮番涨,但企业 Agent 的差异化越来越不出在模型上,出在环境上:哪些系统能力被封装了、封装得多可靠、授权和留痕做得是否完备。谁掌握环境定义权,谁就掌握Agent时代入口——这句话的工程含义就是工具层的归属权。向量空间JBoltAI 把 AIGS 框架的重心放在执行环境上,判断依据在于竞争正从模型能力层下沉到框架工程层。客户在环境上的投入会随时间累积成壁垒,模型投入则是随版本贬值的耗材。

动手顺序

给准备建 Agent 的团队一个务实的起点:先盘点现有接口资产,挑十个高频业务动作做工具化封装,校验、重试、幂等三件配齐,再让模型进来。动作跑稳一批,再扩一批。向量空间JBoltAI 的项目经验里,这个顺序走通的团队没有回头补课的;反过来先做大模型集成再补工具层的,基本都返工了一遍。工具层不是 Agent 的可选项,是生产环境和演示环境的分界线。

更多推荐