AgentRL思路:ARPO、AEPO
ARPO(Agentic Reinforced Policy Optimization)
来自https://arxiv.org/pdf/2507.19849和https://mp.weixin.qq.com/s/mFNRs-bHCAAe3x4QZHF8aA,感觉文章的表述比较墨迹,但基本是合理的
作者基于几个观察:
- 在每次工具调用后的前 10–50 个 token 内,熵显著上升。
- 在推理的初始阶段,熵往往会增加,但仍低于大模型接收到工具调用反馈后的水平。
- 搜索引擎的反馈引入的熵波动比代码编译器的执行反馈更大。
基于熵的自适应 rollout 机制
针对第1点观察,作者设计了基于熵的自适应 rollout 机制。作者设定全局 rollout 规模 M,但是初始的时候只rollout N个轨迹。每次调用工具后,由于熵显著上升,所以模型会在拼接工具返回结果后继续生成 k 个 token,用k个token来计算熵的变化。当熵的变化超过阈值时,就从剩下的M-N个预算中占用Z个;如果熵的变化没超过阈值,就继续生产。简单来说这种方法把原本要生产的M个rollout改成了熵大的时候就多rollout几个轨迹,熵小的时候就少rollout几个轨迹。但是文章这段的表述有点啰嗦,这部分代码写的也有点啰嗦: https://github.com/RUC-NLPIR/ARPO/blob/main/ARPO/verl_arpo_entropy/verl/workers/rollout/vllm_rollout/vllm_rollout_with_tools.py

针对共享片段和分支路径设计Advantages估计
ARPO 的熵驱动自适应 rollout 会产生包含共享推理片段和分支路径的轨迹,这启发我们优化策略更新方式,更好地利用步骤级工具调用信息。
- 硬优势估计:明确区分共享和分支 token,对共享部分计算平均优势,对分支部分单独计算
- 软优势估计:当两个轨迹在 t 步之前共享相同 token 前缀时,它们的共享 token 具有相同的重要性权重,因此这一更新过程近似等价于硬优势估计,并且更优雅。
分层rewards设计
ARPO 的奖励函数综合考虑答案正确性、工具调用格式及多工具协作。 如果模型在推理中使用了搜索(< search >)和代码(< python >)等多种工具,并保证答案正确且格式合规,会获得额外奖励
AEPO(Agentic Entropy-Balanced Policy Optimization)
来自于https://arxiv.org/pdf/2510.14545,简单来说就是ARPO的升级版,总结了High-Entropy Rollout Collapse和High-Entropy Token Gradient Clipping这两个问题:
High-Entropy Rollout Collapse(ARPO算法对于高熵轮次过度调用工具)


解决方案是对高熵的分支进行熵剪裁:

High-Entropy Token Gradient Clipping
类似CISPO算法一样插入了一个stop gradient的操作
更多推荐
所有评论(0)