DeepResearch落地实战:如何砍掉80%Token成本
本文整理自 QCon 北京 2026《卢亿雷 - DeepResearch X
OpenClaw的实践路径与Token成本控制》,通过 Ai好记 视频转文字整理,以下为精炼整理后的会议笔记内容。

这位主讲人长期从事 Infra 相关工作,持续关注 AI 与编程领域。
本次分享系统地拆解了一个真实落地的 DeepResearch 系统(与 OpenClaw / Agent 框架结合),内容涵盖行业现状、系统架构、设计理念,并重点探讨了 Token 成本控制。
对于从事 AI 应用工程的开发者而言,其中关于 Token 成本优化的分析(指出有 60% 到 80% 的优化空间)提供了具体的工程思路和参考数据。
行业现状:为什么 DeepResearch 是必然趋势
三个技术阶段
DeepResearch 的出现,反映了搜索技术向自动化、智能化研究的演进趋势。
他用三个阶段来概括,传统搜索阶段靠索引技术,RAG 发展阶段靠向量检索与知识增强,而多轮循环研究阶段则靠自主规划与报告输出。第三阶段的核心,是目标函数驱动的实现逻辑。

全流程自动化与核心价值
DeepResearch 的核心价值之一,在于其全流程自动化能力。
用户不需要手动搜索、整理、归纳,系统自动完成从「提问题」到「输出报告」的完整闭环。这正是它区别于传统搜索引擎的地方。
主要竞争者分析
当前赛道的竞争者已经很多,谷歌 Gemini、OpenAI、Perplexity、Anthropic Claude、XAI Grok 都在做。
各自有侧重,Gemini 因为搜索引擎出身,语言理解和路径规划能力强;各家产品特色不同,但行业普遍面临生成时间过长的挑战。他举例说明,DeepResearch 类任务通常耗时较长,影响用户体验。
未来趋势与企业级实现
趋势是从 Chat 向 Agent 演进,成本逐步降低、更加民主化,同时生态竞争加剧、差异化明显。
企业级要实现 DeepResearch,需要可配置的研究流程、多搜索源配置、多租户隔离、双模通信保障机制。

DeepResearch 的四大核心难点
他把工程难点总结为四点:
- 长任务稳定性
- 研究过程可控性
- 多租户配置复杂度
- 多格式输出一致性
这四点也是后面架构设计的落点。

OpenClaw 与「龙虾」理念
1、OpenClaw 的前身溯源
OpenClaw 的前身是 Manus,由华人发明,这也是很多人没注意到的背景。
它最大的创新点,是把「通信方式」做了一次革命,所有消息都通过 IM(即时消息)通道沟通,用 Channel Adapters 实现分层隔离,这让架构异常灵活,发展速度也快。

2、LLS 理念创新
OpenClaw 背后还有一个 LLS 理念,强调行业理解的重要性,靠知识库和数据集支撑。他也坦诚,demo 环境和生产环境之间,往往隔着巨大的差距。
3、WorkBuddy 实现要点与难点
他分享了一个叫 WorkBuddy 的实现,提炼出四个要点:Skill 封装、多模型路由、消息通道适配、本地数据安全。
同时也有四个难点:长任务与消息通道冲突、多平台渲染差异、Token 消耗巨大、并发与隔离挑战。
总体思路是避免重复造轮子,把 DeepResearch 引擎和 LLM 查询结合起来。
系统架构设计
1、分层架构详解
他展示了一个真实项目的分层架构图,从上到下是模型层(LLM Service 与模型部署)、外部搜索服务层、核心服务层(需求分析、研究规划、深度研究与报告生成)、API 网关与鉴权层、客户端层(Web 客户端 + SSE 流式模式)。
2、模型训练与选择
模型部分,他谈到微调实践(FT 与 LM 结合)和模型规模选择的考量。强化学习成本很高,PPO 模型计算开销大,他提到用 RPO 策略来优化。搜索能力融合方面,把 Engine 与模型融合,既能降低计算成本又能提升效果。
设计理念与四大原则
1、三阶段设计理念
设计上分三阶段:数据分析、研究规划、深度研究与报告。关键理念包括:
- 意图识别与拒答判断(明确告知模型不能做的场景,这是提升性能的关键)
- 策略制定(搜索策略很重要)
- 循环检索与报告输出(目标函数驱动,他戏称这是AI 解决 NP 问题的魅力)。
2、四大设计原则
整场的架构灵魂是这四个原则。
- 可配置性,研究流程可自由配置;
- 可观测性,进度可见、中间信息可输出;
- 多租户隔离,账户级数据隔离、独立鉴权 Token;
- 双模通信,轮询模式和SSE 流式通信两种模式。
3、通信方案选型
双通道是必要的,轮询模式有它的应用场景,流式模式则适合实时性要求高的场景。
流式模式也有一些挑战,比如客户端与服务端计费口径不一致、长时任务超时设置、网络架构需要优化,还有浏览器兼容性问题(不同浏览器对 EventSource API 支持不一样)。
4、增量内容输出与断点续传
长任务需要一个增量内容输出机制,他用断点续传实现,把大文件切片再合并,通过 block_id 文件编号做管理。这也是可观测性的落地,让用户能看到研究进度的可视化。
5、任务控制机制
任务终止和拒答机制很重要,他强调「及时止损」,研究过程要能按意图和路径动态调整,流程要最小化,避免无意义的消耗。
配置体系与平台化
1、分层架构与 Prompt as Code
配置体系延续分层思想,模型层分规划模型与研究模型,集成外部搜索;服务层承担意图识别、需求澄清与研究规划;客户端层则处理端到端交互时序。
这里提出了一个很有价值的理念,Prompt as Code。他用 CRM 系统举例,通过自然语言生成应用,JSON 信息交付,规划确认后执行。
2、搜索高可靠性的三层配置
搜索可靠性是最关键的,他用三层配置体系来实现:默认配置、静态配置、参数调节配置,让研究流程可定制。
3、报告生成与 Token 管理
报告输出后,Token 管理与数据隔离也是重点,每个租户有独立的鉴权 Token,配合服务监控与配置,保证平台化下的安全与稳定。
Token 优化策略:把成本当作核心工程问题
1、Token 的价值认知
他把 Token 的价值做了三重拆解:数据价值、算力价值、算法价值,并断言这是「兵家必争之地」,类比电力和流量。
成本构成分析则更复杂,包括 Input 与 Output 成本、Embedding 与检索成本、Cache 机制,还要对比不同模型的价格(比如 Claude 模型的价格差异)。

2、成本优化的必要性
为什么要重点管 Token?
因为 DeepResearch 的 Token 成本能占到总成本的 75%,优化空间巨大。他举了一个 Agent 框架的例子,月消耗 8000 到 10000 美元,对比人力成本就会发现不优化不行。
尤其要注意的是 Output 成本通常比 Input 更高,所以控制 Output 是关键。

3、六大优化方向
他把优化策略归纳为六个方向。
请求前优化,包括语义缓存和 Prompt Cache,在请求发出前就复用已有结果。
模型路由,让任务匹配适合的模型,用小模型分流简单任务,避免一上来就上昂贵的大模型。
压缩与裁剪,这个技术难度较高,参考 Claude 压缩策略的变化,配合 Memory 机制优化,控制上下文体积。
Output 精确控制,优先采用短输出结构,从源头减少输出 Token。
研究轮次收敛,用及时止损机制和信息增益阈值,让研究在信息收益不再增加时主动停止,避免无意义的重复检索。
最后是对整体优化思路的总结,请求前处理、模型性能提升、输出结果控制,三管齐下。

4、优化效果数据(非常硬核)
他用真实数据证明了这套优化的有效性。
模型路由上,O3-mini 能降低 10 倍成本;语义缓存用 Redis/LangCache 能降低 73%;Prompt Cache 对重复前缀能降低 90%;上下文压缩能降低 80% 成本;
综合起来,这套方案整体有 60% 到 80% 的成本降低空间。这个数字本身,就是这套工程方法论最好的说明。

5、前沿技术介绍
他还介绍了几个前沿方向。
提示词压缩能带来 2 到 5 倍提升且无损质量(GPT-4 解码器与小模型结合);PT 策略(模型混合策略)能有 98% 的提升效果;
推测解码(Draft Model 与 Target Model 结合)的收益尤其突出,通图量提升 100 到 110 倍、延迟降低 60%,或通图量提升 300%、延迟降低 80%,取决于配置。
总结与展望
他最后总结了几个关键要点:
- 双模通信保障机制(轮询 + SSE 流式结合)
- 三层配置灵活性(默认、静态、参数配置)
- 开源框架集成(OpenClaw 与 Agent框架)
- Token 成本降低空间(预期能到 100 倍,他举例 Mooncake开源架构,硬件软件架构都还有优化空间)
- 平台化多租户(租户隔离与监控)
未来方向,他看好多 Agent 协作,超越 SaaS 的协作能力、Agent 通讯能力提升、LLMs 调度能力、AI 能力整合。
整场分享的核心观点是:在 AI 应用工程中,Token 成本控制应作为架构设计阶段的重要考量因素。
常见问题FAQ
Q:DeepResearch 和传统搜索、RAG 的区别是什么?
传统搜索靠索引,RAG 加向量检索与知识增强,DeepResearch 则是多轮循环研究,能自主规划、目标函数驱动、直接输出报告,实现「问题到报告」的全流程自动化。
Q:OpenClaw 的核心创新点在哪?
通信方式的革命,所有消息通过 IM 通道沟通,用 Channel Adapters 实现分层隔离,架构灵活、迭代快,前身是华人发明的 Minus。
Q:系统架构怎么分层?
模型层、外部搜索服务层、核心服务层(需求分析、研究规划、深度研究)、API 网关鉴权层、客户端层(Web + SSE 流式),层次清晰。
Q:四大设计原则是什么?
可配置性、可观测性、多租户隔离、双模通信(轮询 + SSE 流式),这是 DeepResearch 稳定可靠的基础。
Q:Token 优化能省多少钱?
真实数据是,模型路由降 10 倍、语义缓存降 73%、Prompt Cache 降 90%、上下文压缩降 80%,整体有 60% 到 80% 的成本降低空间。
Q:为什么输出 Token 更值得控制?
因为 Output 成本通常比 Input 更高,控制 Output(短输出结构、轮次收敛、及时止损)是成本优化的关键杠杆。
以上内容由 Ai好记 转录整理。
Ai好记 是一款支持音视频转图文笔记的AI知识库工具,支持解析B站、小红书、抖音、小宇宙等平台链接及本地音视频文件,视频转文字后自动生成精华速览、思维导图和结构化图文笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

更多推荐



所有评论(0)