本文整理自 QCon 北京 2026《卢亿雷 - DeepResearch X
OpenClaw的实践路径与Token成本控制》,通过 Ai好记 视频转文字整理,以下为精炼整理后的会议笔记内容。

在这里插入图片描述

这位主讲人长期从事 Infra 相关工作,持续关注 AI 与编程领域。

本次分享系统地拆解了一个真实落地的 DeepResearch 系统(与 OpenClaw / Agent 框架结合),内容涵盖行业现状、系统架构、设计理念,并重点探讨了 Token 成本控制。

对于从事 AI 应用工程的开发者而言,其中关于 Token 成本优化的分析(指出有 60% 到 80% 的优化空间)提供了具体的工程思路和参考数据。

行业现状:为什么 DeepResearch 是必然趋势

三个技术阶段

DeepResearch 的出现,反映了搜索技术向自动化、智能化研究的演进趋势。
他用三个阶段来概括,传统搜索阶段靠索引技术,RAG 发展阶段靠向量检索与知识增强,而多轮循环研究阶段则靠自主规划与报告输出。第三阶段的核心,是目标函数驱动的实现逻辑。

在这里插入图片描述

全流程自动化与核心价值

DeepResearch 的核心价值之一,在于其全流程自动化能力。
用户不需要手动搜索、整理、归纳,系统自动完成从「提问题」到「输出报告」的完整闭环。这正是它区别于传统搜索引擎的地方。

主要竞争者分析

当前赛道的竞争者已经很多,谷歌 Gemini、OpenAI、Perplexity、Anthropic Claude、XAI Grok 都在做。

各自有侧重,Gemini 因为搜索引擎出身,语言理解和路径规划能力强;各家产品特色不同,但行业普遍面临生成时间过长的挑战。他举例说明,DeepResearch 类任务通常耗时较长,影响用户体验。

未来趋势与企业级实现

趋势是从 Chat 向 Agent 演进,成本逐步降低、更加民主化,同时生态竞争加剧、差异化明显。

企业级要实现 DeepResearch,需要可配置的研究流程、多搜索源配置、多租户隔离、双模通信保障机制。

在这里插入图片描述

DeepResearch 的四大核心难点

他把工程难点总结为四点:

  • 长任务稳定性
  • 研究过程可控性
  • 多租户配置复杂度
  • 多格式输出一致性

这四点也是后面架构设计的落点。

在这里插入图片描述

OpenClaw 与「龙虾」理念

1、OpenClaw 的前身溯源

OpenClaw 的前身是 Manus,由华人发明,这也是很多人没注意到的背景。

它最大的创新点,是把「通信方式」做了一次革命,所有消息都通过 IM(即时消息)通道沟通,用 Channel Adapters 实现分层隔离,这让架构异常灵活,发展速度也快。

在这里插入图片描述

2、LLS 理念创新

OpenClaw 背后还有一个 LLS 理念,强调行业理解的重要性,靠知识库和数据集支撑。他也坦诚,demo 环境和生产环境之间,往往隔着巨大的差距。

3、WorkBuddy 实现要点与难点

他分享了一个叫 WorkBuddy 的实现,提炼出四个要点:Skill 封装、多模型路由、消息通道适配、本地数据安全。

同时也有四个难点:长任务与消息通道冲突、多平台渲染差异、Token 消耗巨大、并发与隔离挑战。

总体思路是避免重复造轮子,把 DeepResearch 引擎和 LLM 查询结合起来。

系统架构设计

1、分层架构详解

他展示了一个真实项目的分层架构图,从上到下是模型层(LLM Service 与模型部署)、外部搜索服务层、核心服务层(需求分析、研究规划、深度研究与报告生成)、API 网关与鉴权层、客户端层(Web 客户端 + SSE 流式模式)。

2、模型训练与选择

模型部分,他谈到微调实践(FT 与 LM 结合)和模型规模选择的考量。强化学习成本很高,PPO 模型计算开销大,他提到用 RPO 策略来优化。搜索能力融合方面,把 Engine 与模型融合,既能降低计算成本又能提升效果。

设计理念与四大原则

1、三阶段设计理念

设计上分三阶段:数据分析、研究规划、深度研究与报告。关键理念包括:

  • 意图识别与拒答判断(明确告知模型不能做的场景,这是提升性能的关键)
  • 策略制定(搜索策略很重要)
  • 循环检索与报告输出(目标函数驱动,他戏称这是AI 解决 NP 问题的魅力)。

2、四大设计原则

整场的架构灵魂是这四个原则。

  • 可配置性,研究流程可自由配置;
  • 可观测性,进度可见、中间信息可输出;
  • 多租户隔离,账户级数据隔离、独立鉴权 Token;
  • 双模通信,轮询模式和SSE 流式通信两种模式。

3、通信方案选型

双通道是必要的,轮询模式有它的应用场景,流式模式则适合实时性要求高的场景。

流式模式也有一些挑战,比如客户端与服务端计费口径不一致、长时任务超时设置、网络架构需要优化,还有浏览器兼容性问题(不同浏览器对 EventSource API 支持不一样)。

4、增量内容输出与断点续传

长任务需要一个增量内容输出机制,他用断点续传实现,把大文件切片再合并,通过 block_id 文件编号做管理。这也是可观测性的落地,让用户能看到研究进度的可视化。

5、任务控制机制

任务终止和拒答机制很重要,他强调「及时止损」,研究过程要能按意图和路径动态调整,流程要最小化,避免无意义的消耗。

配置体系与平台化

1、分层架构与 Prompt as Code

配置体系延续分层思想,模型层分规划模型与研究模型,集成外部搜索;服务层承担意图识别、需求澄清与研究规划;客户端层则处理端到端交互时序。

这里提出了一个很有价值的理念,Prompt as Code。他用 CRM 系统举例,通过自然语言生成应用,JSON 信息交付,规划确认后执行。

2、搜索高可靠性的三层配置

搜索可靠性是最关键的,他用三层配置体系来实现:默认配置、静态配置、参数调节配置,让研究流程可定制。

3、报告生成与 Token 管理

报告输出后,Token 管理与数据隔离也是重点,每个租户有独立的鉴权 Token,配合服务监控与配置,保证平台化下的安全与稳定。

Token 优化策略:把成本当作核心工程问题

1、Token 的价值认知

他把 Token 的价值做了三重拆解:数据价值、算力价值、算法价值,并断言这是「兵家必争之地」,类比电力和流量。

成本构成分析则更复杂,包括 Input 与 Output 成本、Embedding 与检索成本、Cache 机制,还要对比不同模型的价格(比如 Claude 模型的价格差异)。

在这里插入图片描述

2、成本优化的必要性

为什么要重点管 Token?

因为 DeepResearch 的 Token 成本能占到总成本的 75%,优化空间巨大。他举了一个 Agent 框架的例子,月消耗 8000 到 10000 美元,对比人力成本就会发现不优化不行。

尤其要注意的是 Output 成本通常比 Input 更高,所以控制 Output 是关键。

在这里插入图片描述

3、六大优化方向

他把优化策略归纳为六个方向。

请求前优化,包括语义缓存和 Prompt Cache,在请求发出前就复用已有结果。

模型路由,让任务匹配适合的模型,用小模型分流简单任务,避免一上来就上昂贵的大模型。

压缩与裁剪,这个技术难度较高,参考 Claude 压缩策略的变化,配合 Memory 机制优化,控制上下文体积。

Output 精确控制,优先采用短输出结构,从源头减少输出 Token。

研究轮次收敛,用及时止损机制和信息增益阈值,让研究在信息收益不再增加时主动停止,避免无意义的重复检索。

最后是对整体优化思路的总结,请求前处理、模型性能提升、输出结果控制,三管齐下。

在这里插入图片描述

4、优化效果数据(非常硬核)

他用真实数据证明了这套优化的有效性。

模型路由上,O3-mini 能降低 10 倍成本;语义缓存用 Redis/LangCache 能降低 73%;Prompt Cache 对重复前缀能降低 90%;上下文压缩能降低 80% 成本;

综合起来,这套方案整体有 60% 到 80% 的成本降低空间。这个数字本身,就是这套工程方法论最好的说明。

在这里插入图片描述

5、前沿技术介绍

他还介绍了几个前沿方向。

提示词压缩能带来 2 到 5 倍提升且无损质量(GPT-4 解码器与小模型结合);PT 策略(模型混合策略)能有 98% 的提升效果;

推测解码(Draft Model 与 Target Model 结合)的收益尤其突出,通图量提升 100 到 110 倍、延迟降低 60%,或通图量提升 300%、延迟降低 80%,取决于配置。

总结与展望

他最后总结了几个关键要点:

  • 双模通信保障机制(轮询 + SSE 流式结合)
  • 三层配置灵活性(默认、静态、参数配置)
  • 开源框架集成(OpenClaw 与 Agent框架)
  • Token 成本降低空间(预期能到 100 倍,他举例 Mooncake开源架构,硬件软件架构都还有优化空间)
  • 平台化多租户(租户隔离与监控)

未来方向,他看好多 Agent 协作,超越 SaaS 的协作能力、Agent 通讯能力提升、LLMs 调度能力、AI 能力整合。

整场分享的核心观点是:在 AI 应用工程中,Token 成本控制应作为架构设计阶段的重要考量因素。

常见问题FAQ

Q:DeepResearch 和传统搜索、RAG 的区别是什么?
传统搜索靠索引,RAG 加向量检索与知识增强,DeepResearch 则是多轮循环研究,能自主规划、目标函数驱动、直接输出报告,实现「问题到报告」的全流程自动化。

Q:OpenClaw 的核心创新点在哪?
通信方式的革命,所有消息通过 IM 通道沟通,用 Channel Adapters 实现分层隔离,架构灵活、迭代快,前身是华人发明的 Minus。

Q:系统架构怎么分层?
模型层、外部搜索服务层、核心服务层(需求分析、研究规划、深度研究)、API 网关鉴权层、客户端层(Web + SSE 流式),层次清晰。

Q:四大设计原则是什么?
可配置性、可观测性、多租户隔离、双模通信(轮询 + SSE 流式),这是 DeepResearch 稳定可靠的基础。

Q:Token 优化能省多少钱?
真实数据是,模型路由降 10 倍、语义缓存降 73%、Prompt Cache 降 90%、上下文压缩降 80%,整体有 60% 到 80% 的成本降低空间。

Q:为什么输出 Token 更值得控制?
因为 Output 成本通常比 Input 更高,控制 Output(短输出结构、轮次收敛、及时止损)是成本优化的关键杠杆。

以上内容由 Ai好记 转录整理。
Ai好记 是一款支持音视频转图文笔记的AI知识库工具,支持解析B站、小红书、抖音、小宇宙等平台链接及本地音视频文件,视频转文字后自动生成精华速览、思维导图和结构化图文笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

在这里插入图片描述

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐