RL训练Agentic模型实现并行多轮上下文检索:匹配前沿模型且快10倍
RL训练Agentic模型实现并行多轮上下文检索:匹配前沿模型且快10倍
当Agentic搜索的串行轮次从10-20轮压缩到4轮,当单轮工具调用从1个扩展到8个并行执行,强化学习正在重新定义AI检索的效率边界。本文深入解析Cognition SWE-grep、Chroma Context-1及最新学术研究,揭示RL如何训练Agentic模型实现"又快又准"的上下文检索。
引言:检索效率的瓶颈
2026年,AI Agent正从"回答问题"走向"执行任务",但对复杂代码库或知识库进行检索时,一个核心矛盾始终存在:传统Agentic搜索通常需要10-20个串行轮次,每轮调用一次工具,累积的延迟让用户体验难以接受。
Cognition团队给出的答案直接而有力:将串行轮次压缩至4轮,同时在每轮中执行8次并行工具调用。SWE-grep-mini实现了2858 tokens/s的推理速度——是Claude Haiku 4.5的20倍。Chroma Context-1在匹配前沿模型性能的同时,推理速度提升了10倍,推理成本则大幅降低。
一、RL为何成为Agentic检索的关键训练范式?
1.1 传统检索训练的两大瓶颈
瓶颈一:单轮次、单查询的限制。传统RAG检索器基于局部query-passage相关性训练,在单轮检索中表现良好,但Agentic搜索是多轮、多查询的交互过程,局部相关性强的passage对最终答案生成不一定有用。
瓶颈二:固定策略无法适应动态环境。传统检索器仅训练一次,无法根据Agent的迭代反馈持续优化,难以适应多轮检索中动态变化的查询需求。
1.2 RL的核心优势
ACL 2026收录的Agentic-R论文提出了针对性的解决方案:在RL训练中,同时使用局部query-passage相关性和全局答案正确性来评估passage效用,配合迭代训练策略让搜索Agent和检索器双向优化。
Reflective RAG框架则通过两阶段训练解决评估与策略耦合问题:先通过SFT阶段学习生成准确的自省信号,再通过RL阶段基于这些自省信号优化策略。
二、Cognition SWE-grep:RL训练的多轮并行检索突破
2.1 并行化设计的底层逻辑
SWE-grep的核心洞察是:每个串行轮次都带来巨大的延迟成本(工具调用开销、网络往返、Prefill和解码开销)。传统Agent花10-20轮搜索,是因为每轮只做少量工具调用。
Cognition通过RL训练,让模型在4轮内完成深度搜索,每轮8个并行工具调用(grep、glob搜索、read等)。训练后的模型能够自然地学会"一次性探索代码库的不同部分"——这是传统模型即使支持并行工具调用也难以做到的。
2.2 RL训练机制
Cognition采用多轮强化学习直接训练SWE-grep,然后蒸馏出SWE-grep-mini并继续执行RL训练。奖励函数是文件检索和行检索任务上的加权F1分数,相对于Ground Truth数据集。
训练中面临的挑战是:标准策略梯度方法在LLM训练中,训练与推理库的数值差异会导致采样数据偏离当前策略。解决方案是逐轨迹重要性采样,结合留一法基线降低方差,并通过动态KL正则化稳定训练。
2.3 推理速度的工程突破
SWE-grep-mini在Cerebras上实现2858 tokens/s,SWE-grep实现682 tokens/s。
关键工程措施:索引优化、多线程处理、与推理服务商深度协同设计模型架构与部署方案,工具集与模型架构的协同设计确保了跨平台兼容性与操作安全。
三、Chroma Context-1:20B参数的自编辑搜索Agent
3.1 模型架构与训练
Chroma Context-1基于20B参数的MoE架构,通过SFT + RL(CISPO)两阶段训练。其核心行为模式:给定查询后自动将复杂查询分解为子查询,迭代搜索语料库,选择性编辑自己的上下文,为探索腾出空间。
3.2 RL带来的核心行为变化
Context-1的并行工具调用从基线的1.52次/轮提升至2.56次/轮,完成任务的轮次从6.7轮降至5.2轮;Prune准确率从0.824提升至0.941;在复杂检索任务中从0.541提升至0.798,输出召回率几乎翻倍。
四、前沿研究扫描:2026年最新进展
4.1 MultiSearch:多查询检索+显式合并
MultiSearch提出多查询检索+显式信息合并框架,Agent在每轮生成三类查询:改写(Rephrasing)、概念扩展、问题分解。设计三项奖励:答案奖励、多查询奖励、合并奖励。
4.2 Agentic-R:双向迭代训练
Agentic-R框架提出的迭代训练策略支持搜索Agent和检索器双向迭代优化:检索器为Agent提供更高质量文档,Agent将信息融入下一次查询;Agent在检索过程中生成的高置信度查询反过来微调检索器。
4.3 Reflective RAG:自省驱动策略优化
Reflective RAG通过反射标签(Reflection Tagging)机制让Agent在每轮检索后对检索内容相关性做自我评价,引导后续策略,配合SFT+RL两阶段训练实现稳定学习。
五、核心实现:基于RL的并行检索Agent代码框架
class ParallelRetrievalAgent:
def __init__(self, model, max_turns=4, max_parallel_calls=8):
self.model = model # 经过RL训练的Agentic模型
self.max_turns = max_turns
self.max_parallel_calls = max_parallel_calls
self.tools = ['grep', 'glob', 'read_file']
self.history = []
def generate_parallel_tool_calls(self, query: str) -> list:
# RL训练后的模型每轮生成多个并行工具调用
prompt = f"""Query: {query}
Generate up to {self.max_parallel_calls} parallel tool calls to search the codebase.
Return format: [{{"tool": "grep", "pattern": "..."}}, ...]
"""
response = self.model.generate(prompt)
return self._parse_tool_calls(response)
def execute_parallel_calls(self, tool_calls: list) -> list:
# 并行执行所有工具调用
with ThreadPoolExecutor(max_workers=len(tool_calls)) as executor:
results = list(executor.map(self._execute_single_call, tool_calls))
return results
def self_edit_context(self, results: list) -> list:
# RL训练出的自编辑能力:判断哪些文档应保留、哪些应裁剪
prompt = f"""Retrieved documents: {results}
Select only the most relevant documents for the search goal.
Return indices to keep."""
keep_indices = self.model.generate(prompt)
return [results[i] for i in keep_indices]
def run(self, query: str) -> str:
for turn in range(self.max_turns):
tool_calls = self.generate_parallel_tool_calls(query)
results = self.execute_parallel_calls(tool_calls)
results = self.self_edit_context(results)
self.history.append(results)
query = self._update_query(query, results)
return self._generate_final_answer(query)
六、总结与展望
基于RL的Agentic检索模型正在成为AI Agent效率革命的关键驱动力。三个核心趋势值得关注:
- 并行化:从串行单次调用转向多轮高并行调用
- 自编辑:模型在检索过程中主动裁剪不相关信息
- 迭代优化:检索器与Agent在RL训练中双向迭代
当Agentic检索的速度提升10倍以上、成本大幅下降,AI系统将能在数秒内完成以往需要数分钟的复杂信息收集——这是Agent从“对话助手”走向“行动执行者”的关键一步。
参考文献:
- Chroma Context-1: Training a Self-Editing Search Agent, Chroma, 2026
- SWE-grep: RL for Multi-Turn, Fast Context Retrieval, Cognition AI, 2025
- Agentic-R: Learning to Retrieve for Agentic Search, ACL 2026
- Reflective RAG: Self-Evaluation Driven Strategy Optimization, ACL 2026
- Agentic Conversational Search with Contextualized Reasoning via RL, ACL 2026
- MultiSearch: Scaling Retrieval-Augmented Reasoning with Parallel Search, arXiv, 2026
- Fast Context技术深度解析, CSDN, 2025
更多推荐


所有评论(0)