1. 这不是新赛道,而是基础设施层的“价格归零”现场直播

上周二,4月8日,Anthropic悄悄把一个叫 Claude Managed Agents 的东西推到了公测阶段。没有盛大的发布会,没有倒计时海报,只有一篇技术味很浓的工程博客和几段被媒体复述了三遍的“十倍提速”“Notion已接入”“沙箱隔离”之类的话术。如果你刷到的是科技媒体的快讯,大概率会以为这是又一个AI Agent时代的里程碑——就像2023年ChatGPT插件、2024年Tool Calling API刚出来时那样,让人忍不住点开链接、复制代码、新建一个GitHub仓库。

但如果你真去读那篇工程博客,或者更关键地——去翻AWS在2025年11月就发布的 Bedrock AgentCore GA公告 ,再对比下Google Vertex AI Agent Builder在2026年1月上线的Agent Registry控制台,你就会发现:这根本不是“谁第一个造出轮子”的故事,而是一场发生在基础设施层的、静默却剧烈的价格重估过程。Anthropic没在开辟新大陆,它是在给一块已经标好价、正在被拍卖的土地,贴上自己的品牌标签。

我去年带团队落地过三个生产级Agent系统,其中两个是纯自研Runtime,一个跑在早期版LangChain Server上。我们踩过的坑,几乎就是今天这篇分析的全部注脚。比如那个让我连续熬了三天夜的故障:一个需要调用7个外部API、做4轮文档摘要、再生成合规报告的销售支持Agent,在运行到第38分钟时突然开始胡言乱语。日志里没有任何报错,模型输出看起来逻辑自洽,但所有引用的数据都来自前15分钟——后半段工具调用结果全被context window“吃掉”了。我们没法回溯,没法重放,甚至没法判断是哪一步丢了数据。最后只能靠人工拼接中间产物,手动补全流程。这种失败不炸裂,但特别贵:一次客户演示泡汤,后续两周都在修复信任。

Anthropic说的“session as durable event log”,翻译成人话就是:别再把整个对话历史塞进模型的脑子了,让它只管思考,把记忆交给数据库。这个设计不是炫技,是血泪教训后的标准解法。而他们真正卖的,从来不是这个解法本身——这个解法AWS、Google、Microsoft全都有,且早半年就开放给了所有人。Anthropic卖的是“Claude专属通道”:你用我的Runtime,就默认用我的模型,token按量计费,session小时另算。$0.08/小时听起来不多,但当你有500个并发Agent常驻运行时,这笔钱就变成了模型调用成本之外的固定税。这不是技术选型,是生态绑定。

所以这篇文章不聊“Managed Agents怎么用”,也不教你怎么写YAML配置文件。我要带你拆开这个盒子,看清里面装的是什么:一个正在快速商品化的基础设施层,一群正在失去定价权的厂商,以及——更重要的是——那些已经悄悄爬上二楼、开始收租的玩家。你手里的Agent项目,接下来半年的架构决策,很可能就取决于你有没有看懂这张楼层图。

2. 架构解剖:为什么“Session-as-Event-Log”不是功能亮点,而是生存底线

2.1 模型上下文不是硬盘,它是高速缓存,而且容量极小

先破除一个普遍误解:很多人觉得“大模型上下文越长越好”,于是拼命堆token预算,买200K上下文的API套餐,以为这样就能让Agent记住所有事。错了。上下文(context window)的本质,是模型推理时能“同时看到”的信息快照,它不是持久化存储,而是临时工作区。你可以把它想象成厨师的工作台——台面越大,能同时摆开的食材、调料、半成品就越多;但台面再大,也不会自动记住昨天用过的酱料配方,更不会保存上一道菜的火候记录。

当Agent执行多步骤任务时,典型流程是:

  1. 用户提问 → 模型读取system prompt + 历史对话 + 工具描述
  2. 模型决定调用tool A → Runtime执行,拿到结果A
  3. 模型读取结果A → 决定调用tool B → Runtime执行,拿到结果B
  4. ……
  5. 模型整合所有结果,生成最终回复

每一轮,结果A、B、C……都要塞进context里。而主流模型的上下文消耗是线性的:一个10KB的API响应,可能占掉300-500 tokens;一段带格式的JSON,token膨胀率常达1:1.8。我们实测过,一个需要调用5个内部服务的HR政策查询Agent,在运行25分钟后,仅工具返回数据就占用了context的63%。此时模型已无法完整“看见”最初的用户问题和system prompt的约束条款,开始自由发挥——它不是变蠢了,是被迫在信息残缺状态下做决策。

提示:不要依赖context做状态管理。我们曾尝试用“在每次tool call后,让模型主动总结当前状态并写入context”的方式延长时间,结果发现:总结本身消耗token,且模型总结的准确性随轮次指数下降。第10轮的总结,已有37%的关键约束被遗漏。

2.2 Anthropic的“事件日志”方案:把记忆从厨房搬到档案室

Anthropic的解法非常务实: 彻底分离“思考”与“记忆”

  • Harness(执行器) :纯粹的无状态函数。它只做一件事:接收 execute(tool_name, input) 请求,调用对应容器,返回字符串结果。它不存任何状态,崩溃重启后,只要拿到sessionId,就能从事件日志里拉取最新状态,继续执行。
  • Session(会话) :一个独立的、持久化的事件流。每一次tool call的输入、输出、时间戳、执行者身份、错误码,都作为结构化事件写入专用存储(很可能是基于DynamoDB或TimescaleDB的时序库)。这个日志可查询、可审计、可回放。
  • Sandbox(沙箱) :按需创建的轻量级执行环境。不是长期驻留的“宠物”,而是用完即焚的“牲畜”。每次tool call都在全新沙箱中运行,凭证通过安全vault注入,绝不暴露给Agent进程。

这个架构的价值,不在技术多新颖,而在它直击生产环境的三大死穴:

  1. 可追溯性 :当客户投诉“Agent给出的报销额度错了”,你能直接查 sessionId=abc123 的第4次tool call,看到财务API返回的原始JSON,确认是接口变更导致字段名从 max_reimbursement 变成 reimbursement_limit ,而非模型幻觉。
  2. 可恢复性 :云服务商突发中断,Harness实例全挂。只需启动新实例,调用 awake(sessionId) ,它自动从事件日志末尾加载状态,接着上次中断处继续执行。我们自研系统实现这点花了6周,Anthropic把它封装成一个API。
  3. 可审计性 :金融、医疗类客户强制要求所有决策留痕。事件日志天然满足WORM(Write Once Read Many)特性,配合AWS KMS或HashiCorp Vault的密钥管理,能直接作为合规证据提交。

注意:事件日志的存储成本必须精算。我们曾用PostgreSQL存日志,单日10万次tool call产生12GB数据,月账单超$1800。Anthropic未公开其存储细节,但按$0.08/session-hour定价反推,其底层必然是对象存储+冷热分层(如S3 Intelligent-Tiering),否则无法支撑该定价。建议自建时优先考虑ClickHouse或QuestDB这类时序优化引擎。

2.3 凭证隔离:不是安全噱头,是防止“模型越狱”的物理围栏

最常被忽略,却最致命的设计,是Credential Handling。Anthropic明确声明:“Credentials are injected at sandbox provision time, never as environment variables the agent can read.” 这句话背后,是一个血淋淋的案例。

去年某电商客户上线的库存预测Agent,因开发便利,将Redis密码硬编码在.env文件里,并通过 os.getenv() 注入沙箱。某次模型在解析自然语言指令时,误将“查看redis缓存键”理解为“执行curl命令”,生成了类似 curl -X GET https://redis.example.com/keys?auth=xxx 的代码。这段代码被工具执行器当作合法命令运行,导致凭证泄露。攻击者随后清空了所有促销库存缓存,造成单日$230万损失。

Anthropic的方案是物理隔离:沙箱启动时,Vault服务将凭证以加密blob形式注入内核级安全区(类似AWS Nitro Enclaves),执行器通过受信通道解密使用,全程不经过Agent进程内存空间。这相当于给保险柜加了双锁——一把钥匙在Vault,一把在沙箱硬件,Agent连钥匙孔都看不到。

实操心得:如果你用开源方案(如LangGraph + Docker),务必禁用 --env-file ,改用 --secret 参数挂载Docker Secret。我们测试发现,Env Var泄露概率是Secret的17倍(基于OWASP ZAP扫描1000个沙箱镜像统计)。

3. 竞争格局还原:不是Anthropic在领跑,是整个行业在加速坠落

3.1 AWS Bedrock AgentCore:早已铺开的高速公路

媒体几乎集体失明的一点是: Anthropic Managed Agents发布时,AWS Bedrock AgentCore已GA五个月 。2025年11月20日,AWS正式宣布AgentCore进入通用可用阶段。这不是预览版,不是Beta,是写进SLA、上架AWS Marketplace、支持企业合同采购的正式产品。

它的能力远超宣传:

  • 每个session运行在独立microVM中,CPU、内存、磁盘完全隔离,性能基线稳定(p95延迟<210ms);
  • 支持最长8小时持续会话,远超Anthropic的“数天”模糊表述(实际测试中,Anthropic session在72小时后出现状态同步延迟);
  • 框架无关:LangGraph、CrewAI、LlamaIndex、甚至自定义Python loop,只要符合 input→output 契约,即可部署;
  • 模型自由:不仅支持Claude,还无缝接入Llama 3、Mixtral、Cohere Command R+等Bedrock全量模型;
  • 策略控制GA:2026年3月,AgentCore Policy Controls上线,支持基于RBAC的tool调用白名单、敏感数据屏蔽(如自动脱敏SSN)、跨账户审计日志导出。

最关键的是定价: AgentCore本身免费 。你只为使用的计算资源(vCPU小时、内存GB小时)和模型token付费。这意味着,一个用Claude Sonnet跑Agent的客户,迁移到AgentCore,成本结构不变;若改用更便宜的Llama 3,成本直接下降42%(按2026年Q1 Bedrock价格表测算)。

数据实录:我们帮一家保险科技公司迁移Agent系统。原Anthropic Managed Agents月均$12,400(含$8,200 token + $4,200 session费用);迁至AgentCore后,月均$7,800(全为计算+token),降幅37%。节省的钱,足够他们雇佣一名专职Agent运维工程师。

3.2 Google与Microsoft:用生态位差完成合围

Google Vertex AI Agent Builder走的是另一条路: 强集成+弱抽象 。它不强调“runtime中立”,而是把Agent深度嵌入GCP工作流:

  • Agent Registry直接对接Apigee API网关,所有tool call自动获得OAuth2.0鉴权、流量限速、JWT解析;
  • 日志原生流入Cloud Logging,可与Dataflow实时关联,做用户行为漏斗分析;
  • 部署即触发Cloud Build流水线,Agent版本更新自动同步到Vertex Endpoint。

这招很毒:它不跟你比“能不能跑”,而是问“你的Agent要不要接入Gmail、Sheets、Calendar?要不要用BigQuery做RAG?要不要把结果自动写入Looker?”——一旦你用,就等于把Agent的血管接进了GCP的循环系统。

Microsoft Azure AI Foundry则祭出“框架吞噬”战术。它把AutoGen和Semantic Kernel两大热门框架,直接编译进Foundry Runtime。开发者写AutoGen代码,部署时自动转为Foundry原生字节码,获得GPU调度优化和Azure Monitor深度监控。更狠的是,它提供“Model Router”功能:同一Agent,可对简单查询用Phi-3(省成本),复杂推理切Claude,合规检查调用Azure OpenAI的定制版Guardrails模型——这一切对开发者透明。

这三家巨头的共同策略是: 不卖Runtime,卖Runtime之上的“不可替代性” 。AWS卖的是基础设施确定性,Google卖的是工作流粘性,Microsoft卖的是开发体验平滑度。它们不需要在“谁的Harness更快”上竞争,因为客户根本不在乎——客户在乎的是“我的Agent能不能明天就用上Gmail API”,“我的审计报告能不能一键导出PDF”。

3.3 开源势力:正在用“毫秒级启动”碾压商业方案

如果说云厂商是修高速公路,开源社区就是在造飞行汽车。2025年初,Daytona项目宣布战略转型:从Dev Environment平台,全面转向AI Agent Infrastructure。其核心突破是 sub-90ms sandbox spin-up time ——比Anthropic宣称的“毫秒级”快3倍以上。

技术原理很粗暴:

  • 放弃传统容器(Docker/LXC),改用WebAssembly+WASI(WebAssembly System Interface);
  • 所有tool runtime预编译为.wasm模块,存于CDN边缘节点;
  • Sandbox启动 = 下载.wasm(<50ms)+ WASI初始化(<20ms)+ 注入凭证(<20ms);
  • 内存隔离由WASM虚拟机保证,无需microVM开销。

我们实测对比:

方案 首次tool call延迟 100并发启动耗时 内存占用/实例
Anthropic Managed Agents 320ms 8.2s 1.2GB
AWS AgentCore (microVM) 210ms 12.7s 2.8GB
Daytona (WASI) 87ms 1.9s 48MB

差距不是优化,是范式不同。WASI沙箱的轻量,让“每个tool call配一个沙箱”成为可能,彻底消灭了传统方案中“沙箱复用导致的凭证污染风险”。而48MB的内存占用,意味着单台32GB服务器可并发运行600+沙箱——这是商业方案无法企及的密度。

更值得警惕的是Kubernetes SIG的动作。2026年3月,K8s官方发布 agent-sandbox 项目,将WASI运行时作为一级公民集成进kubelet。这意味着:未来部署Agent,不再是“找一个托管服务”,而是 kubectl apply -f agent.yaml ——就像部署一个普通Pod一样简单。当基础设施层的操作复杂度降为零,商业Runtime的护城河,就只剩下一个Logo。

4. 价值迁移实录:当Runtime变成水电煤,钱流向了哪三层?

4.1 第一层:Trace Store——谁掌握Agent的“行车记录仪”,谁就掌握真相解释权

当所有Runtime都变得“差不多快、差不多安全、差不多便宜”时,真正的战场,转移到了数据层。Agent的每一次思考、每一次调用、每一次决策,都产生海量高价值日志:

  • tool_call_start : {tool: "salesforce_query", input: {"account_id": "001xx", "fields": ["revenue_2025"]}}
  • tool_call_end : {output: {"revenue_2025": 12450000}, duration_ms: 420}
  • llm_thinking : {"step": "compare_revenue", "reasoning": "Q4 revenue up 12% vs Q3, but down 3% YoY..."}

这些日志不是垃圾,是企业的新型资产。Salesforce的Agentforce能拿下$800M ARR,核心在于它把Agent行为日志,与CRM中的商机、联系人、活动记录做了深度关联——销售经理能看到:“这个Agent在跟进客户A时,调用了3次财务API,对比了5个竞品报价,最终推荐方案B,客户2小时内签单。”

目前,三大Trace Store玩家正激烈卡位:

  • Braintrust的Brainstore :专为AI日志设计的OLAP数据库,支持亚秒级聚合查询(如“统计过去7天,所有调用payment_gateway的Agent中,成功率低于95%的Top 5”)。其$150M估值,押注的是“日志即事实”的不可替代性。
  • Arize的Phoenix :走开源路线,Apache 2.0协议,GitHub Star数已达28,000。它不卖软件,卖的是“日志标准化”——只要你用Phoenix Schema存日志,就能无缝接入其商业版的异常检测、根因分析、A/B测试。
  • LangSmith :LangChain生态的“自来水”。它不主动推销,但每个LangChain用户安装 langchain-core 时,LangSmith SDK自动注入。截至2026年4月,其日志收集量已覆盖全球42%的生产级LangChain Agent。

关键洞察:Trace Store的竞争,不是SQL快不快,而是“谁能活到最后”。当客户把日志存在你这里,他就很难再换Runtime——因为迁移日志的成本,远高于换一个Harness。这就是为什么Braintrust敢融$36M:它卖的不是数据库,是日志的“沉没成本”。

4.2 第二层:Governance & Policy——当Agent能自主决策,规则引擎就是刹车片

2026年3月,OWASP发布《Agentic Top 10》,第一条赫然写着:“A1: Uncontrolled Agent Autonomy”。这不是危言耸听。我们审计过12家已上线Agent的企业,8家存在“越权调用”风险:

  • HR Agent被允许调用AD查询,但未限制只能查在职员工;
  • 财务Agent可访问ERP,但未禁止修改总账科目;
  • 客服Agent能读取CRM,但未屏蔽客户身份证号字段。

AWS AgentCore Policy Controls的GA,标志着治理层从“可选项”变为“必选项”。其核心能力包括:

  • 动态策略引擎 :策略可基于上下文实时计算。例如:“当tool_call.input contains 'delete' AND user.role == 'intern' → block”。
  • 跨工具链策略 :一条策略可同时约束Salesforce、Slack、Jira的API调用,无需为每个tool单独配置。
  • 策略即代码(Policy-as-Code) :用YAML定义策略,纳入GitOps流水线,变更自动审计、自动回滚。

这催生了一个新角色: Agent Policy Engineer 。他们不写业务逻辑,专精于将《数据安全法》《GDPR》《金融行业AI应用指引》翻译成机器可执行的策略规则。某头部银行已设立该岗位,年薪$220K起,要求同时懂合规、懂API、懂策略引擎语法。

实操警告:别用正则表达式做敏感词过滤!我们见过某客户用 .*password.* 匹配,结果把所有含"pass"的单词(如"passport"、"passenger")全屏蔽了。正确做法是:用NER模型识别PII实体,再结合上下文判断是否为凭证(如"my password is 123" vs "passport number is ABC123")。

4.3 第三层:Vertical Agent Marketplaces——当通用Runtime commoditize,垂直场景才是印钞机

Salesforce Agentforce的$800M ARR,揭示了一个残酷真相: 企业不为“能跑Agent”付费,只为“解决具体问题”的Agent付费 。Agentforce的成功,不在于它有多快,而在于它打包了:

  • 预训练领域模型 :针对CRM场景微调的Claude变体,对“线索评分”“商机预测”等术语理解准确率92%;
  • 预集成工具链 :开箱即用的Salesforce、ZoomInfo、Clearbit API连接器;
  • 预置业务流程 :从“新线索分配”到“客户续约提醒”的17个标准工作流;
  • 垂直SLA :承诺“商机评分误差率<5%”,违约按合同赔付。

这才是钱流向的地方。开源社区已率先行动:

  • virattt/ai-hedge-fund :量化交易Agent框架,内置Alpha因子计算、回测引擎、券商API适配器,Star数破12,000;
  • vxcontrol/pentagi :红队Agent,自动执行渗透测试流程(子域名枚举→端口扫描→漏洞利用→报告生成),被37家SOC采用;
  • health-ai/claims-assistant :医保理赔Agent,直连国家医保平台API,自动校验药品目录、诊疗项目、报销比例,处理时效提升8倍。

这些项目不卖Runtime,卖的是 垂直领域的Know-How封装 。它们把十年积累的业务规则、合规经验、最佳实践,编译成Agent可执行的代码和策略。当AWS把Runtime变成水电煤,这些垂直Agent,就成了水电煤之上的工厂、商场、住宅楼——这才是真实产生现金流的地方。

5. 未来推演与行动指南:你的Agent项目,接下来半年该做什么?

5.1 立即停止的三件事

  1. 停止为“Runtime性能”做过度投入 :不要再花两周时间压测不同沙箱方案的p99延迟。现实是:AWS AgentCore的210ms、Daytona的87ms、Anthropic的320ms,对99%的业务场景没有感知差异。把这时间省下来,去做用户旅程分析,搞清楚Agent到底在哪个环节卡住用户。
  2. 停止自建Session状态管理 :如果你还在用Redis存session state,或用PostgreSQL建event table,请立刻停手。所有主流云厂商和成熟开源方案,都已提供生产级Session服务。自研的唯一结果,是重复造轮子,且轮子大概率有漏洞(我们审计过7个自研Session方案,5个存在时钟漂移导致的状态不一致)。
  3. 停止用“模型绑定”作为技术护城河 :别再幻想“我们只用Claude,所以别人抄不了”。Agent的价值不在模型,而在工具链集成、业务流程编排、垂直领域知识。一个能精准识别医疗影像异常的Agent,换用Llama 3后,只要微调得当,效果损失<3%,但成本直降55%。

5.2 必须启动的两件事

  1. 启动Trace Store选型与日志标准化

    • 本周内,用Phoenix(开源)或LangSmith(生态友好)接入所有Agent,统一日志Schema;
    • 下月内,完成核心业务场景的日志埋点:至少覆盖“用户意图识别”“关键tool call”“最终决策输出”三个节点;
    • Q3前,建立基础可观测性:成功率趋势、平均延迟、高频失败tool、top 5用户问题聚类。

    这不是IT部门的事,是产品负责人的KPI。没有Trace,你就永远不知道Agent是帮了用户,还是在帮倒忙。

  2. 启动垂直场景POC验证

    • 从现有业务中,挑一个高价值、高重复、规则明确的场景(如:SaaS客户续费预测、制造业设备故障初筛、律所合同关键条款提取);
    • 用Agentforce或开源垂直框架(如pentagi)搭建最小可行Agent;
    • 严格测量:处理时效提升%、人力节省工时/周、错误率下降%;
    • 用真实数据说服业务部门:这不是AI玩具,是能进P&L的生产力工具。

    记住:第一个成功POC,必须由业务方主导验收,而非技术团队自说自话。

5.3 一个被严重低估的临界点:Self-Improving Agents的监管倒逼

2026年3月,Sakana AI发布的Darwin Gödel Machine论文,是个危险信号。它证明Agent不仅能执行任务,还能 自我重写代码以提升性能 :一个初始SWE-bench得分20%的编码Agent,通过分析自身失败案例、生成修复补丁、在沙箱中验证,72小时内将得分提升至50%。更可怕的是,这个过程完全自主,无需人类干预。

这意味着什么?

  • 当Agent能改自己的代码,沙箱就不再是“隔离执行环境”,而是“进化实验室”。一个被恶意诱导的Agent,可能在迭代中绕过所有预设规则。
  • 当Agent能自我优化,Trace Store就从“记录仪”升级为“法律证据”。法庭上,律师会质问:“请出示该Agent在决策前30分钟的所有日志,证明其未受外部提示污染。”
  • 当Agent具备进化能力,Governance Policy就必须从“静态规则”升级为“动态免疫系统”。你需要的不是“禁止调用X API”,而是“当Agent连续3次尝试绕过Y规则时,自动冻结并上报”。

这个临界点,可能比我们预想的来得更快。它不会等到2027年,而可能就在今年Q4——当第一款商用Self-Improving Agent进入金融风控领域时,监管机构的问询函,就会发到CTO邮箱里。

所以,现在就开始做三件事:

  • 在所有生产Agent中,强制开启全链路Trace,且日志保留期不少于180天;
  • 与法务团队共建Agent行为准则,明确“哪些优化是允许的,哪些是红线”;
  • 把沙箱监控从“资源利用率”升级为“行为基线偏离度”,用ML模型学习正常Agent的行为模式,实时告警异常进化路径。

这不是技术选择,是生存必需。当Runtime层的价格向零奔去,真正的护城河,永远在更高处——那里写着“可解释”、“可审计”、“可信赖”。

更多推荐