在这里插入图片描述

📖标题:AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
🌐来源:arXiv, 2602.11348v1

🌟摘要

大型语言模型的最新进展使基于LLM的代理能够在各种基准测试上实现强大的性能。然而,它们在现实世界部署中的性能通常是在基准测试设置上观察到的,尤其是在复杂和不完美的环境中。这种差异很大程度上是因为流行的训练和评估范式通常建立在理想化的假设之上,忽略了现实世界交互中存在的固有随机性和噪声。为了弥合这一差距,我们引入了AgentNoiseBench,这是一个框架,用于系统地评估代理模型在嘈杂环境下的稳健性。我们首先对现实世界场景中的偏差和不确定性进行深入分析,并将环境噪声分为两种主要类型:用户噪声和工具噪声。基于这一分析,我们开发了一个自动化管道,将可控噪声注入现有的以代理为中心的基准测试,同时保持任务的可解性。利用这一管道,我们对具有不同架构和参数尺度的各种模型进行了广泛的评估。我们的结果揭示了不同噪声条件下一致的性能变化,突出了当前代理模型对现实环境扰动的敏感性。代码可在https://github.com/keven-cyber/agentnoisebench获得

🛎️文章简介

🔸研究问题:如何系统评估工具调用型大语言模型代理在真实嘈杂环境下的鲁棒性?
🔸主要贡献:论文提出首个面向用户噪声与工具噪声的双维度、可复现、任务可解的代理鲁棒性评测框架AgentNoiseBench。

📝重点思路

🔸基于真实人机交互日志,首次将环境噪声系统归类为两类:用户噪声(含指令歧义、冲突、冗余、话题漂移、边界试探)和工具噪声(含执行失败、输出不全、事实错误、误导信号、冗余信息)。
🔸设计约束式对抗噪声注入流水线:以强参考模型(如o3)为锚点,通过优化固定系统提示词θ∗,生成能最大程度降低其性能但严格保持任务可解性的噪声样本。
🔸提出轨迹感知评估协议(Trajectory-Aware Evaluation),不仅检查最终答案正确性,还逐步验证推理路径有效性,定义稳定性门控准确率(SGA)作为核心指标。
🔸在τ2-Bench、VitaBench和HotPotQA三大基准上注入可控噪声,覆盖24个开源与闭源模型(含思考/非思考模式),实现跨架构、跨规模的公平鲁棒性对比。

🔎分析总结

🔸所有模型在噪声下均显著退化,平均准确率下降达20.8%,证实噪声鲁棒性仍是当前代理落地的核心瓶颈。
🔸强推理能力不等于高鲁棒性:多数“思考型”模型在噪声下表现反而劣于同系列非思考版本,因其易将噪声误读为关键信号并构建虚假推理链。
🔸工具噪声危害远超用户噪声(性能降幅20–30% vs. ~10%),因工具输出是代理唯一外部事实来源,其失真直接导致推理根基崩塌;而用户噪声多属语义层面,模型可通过先验知识修复。
🔸不同噪声细粒度破坏力差异巨大:工具侧“执行失败”最致命(性能跌至0.31),用户侧“指令冲突”最严重;而“冗余信息”等类型影响相对温和。
🔸噪声注入时机影响显著:中间阶段注入噪声导致最大性能下降,表明代理在规划执行中期最脆弱,该现象跨模型架构具有一致性。

💡个人观点

论文建立首个真实驱动的噪声分类学,又通过约束对抗生成确保评测信度,更以轨迹一致性要求规避结果偶然性。

🧩附录

在这里插入图片描述

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐