
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
一个8B参数的小模型,在模拟环境里"打怪升级"之后,搬到真实世界居然还能稳定输出——这背后的工程设计和学术思路,比结果本身更值得细品。
AgentSwing:长时Web Agent上下文管理的自适应路由方法 本文针对长时Web Agent在复杂搜索任务中面临的"上下文腐烂"问题,提出了一种创新的自适应路由方案。传统方法如保留最近N轮、摘要压缩或全部丢弃等静态策略,在效率和精度之间存在固有矛盾。AgentSwing通过并行执行多种上下文管理策略,并前瞻性地评估各分支的未来表现,实现了动态最优策略选择。实验表明,该

AggAgent:智能体聚合新范式 Princeton团队提出AggAgent,解决智能体并行任务中的聚合难题。传统方法如投票或轨迹压缩存在信息丢失或成本过高问题。AggAgent创新地将并行轨迹视为"环境",配备4个轻量工具让聚合Agent按需检索和交叉验证信息。实验显示,在6个基准任务上,AggAgent平均提升2.4-5.3个点,深度研究任务提升达10.3点,且仅增加5.

GAIR-NLP团队投入147万美元构建了OpenSWE——目前最大的开源软件工程智能体训练框架。该框架包含45,320个可执行的Docker环境,覆盖12,800个代码仓库,所有基础设施完全开源。OpenSWE解决了构建SWE训练环境的四大挑战:依赖管理、测试验证、任务对齐和难度控制,通过多智能体协作流水线实现高质量环境构建。基于该框架训练的OpenSWE-72B模型在权威基准SWE-bench

腾讯团队发布AD-Bench基准测试,评估LLM Agent在真实广告投放分析场景中的表现。该基准包含823条真实广告优化师查询,按复杂度分为三级(L1简单检索至L3综合分析)。创新性地采用"轨迹感知评估",不仅看结果准确性,还考察工具调用路径合理性。测试10个主流模型发现:GPT-5.1以69%得分最高,国产模型混元2.0和DeepSeek-V3达62%与Gemini-3-P

摘要:这篇综述论文系统分析了LLM智能体的记忆系统,将其分为四大流派(语义记忆、个性化记忆、情景记忆和结构化记忆),并通过实验揭示了当前记忆系统的四大痛点:基准测试存在"上下文饱和陷阱",传统评估指标(如F1)与语义理解脱节,开源骨干模型存在高格式错误率(达30.38%),复杂架构在实际部署中面临延迟问题。研究指出,在长上下文窗口时代(如128k+),许多记忆系统的优势可能被夸
摘要:这篇综述论文系统分析了LLM智能体的记忆系统,将其分为四大流派(语义记忆、个性化记忆、情景记忆和结构化记忆),并通过实验揭示了当前记忆系统的四大痛点:基准测试存在"上下文饱和陷阱",传统评估指标(如F1)与语义理解脱节,开源骨干模型存在高格式错误率(达30.38%),复杂架构在实际部署中面临延迟问题。研究指出,在长上下文窗口时代(如128k+),许多记忆系统的优势可能被夸
摘要: 华为诺亚方舟实验室提出的CoVe框架通过约束验证解决工具调用Agent的数据合成难题。其核心创新在于用数据库约束生成任务(保证可解性),并通过同一套约束验证轨迹质量(避免依赖LLM打分)。CoVe的流水线包含约束采样、模糊化、交互生成和规则验证四步,仅用12K条高质量数据训练的4B模型在τ²-bench上媲美70B模型性能。该方法数据效率提升18倍,验证机制完全确定且可解释,为多轮交互式工

MiroThinker-1.7 换了一条路:在预训练和 SFT 之间插入 Agentic Mid-Training 阶段,强化每一步的"原子决策"质量(规划、推理、工具使用、答案汇总)。MiroThinker-H1 再叠加一套 Local + Global 双重验证机制,让模型"做一步查一步、交卷前全局复审"。结果是 BrowseComp 88.2%、GAIA 88.5%——前者 OpenAI D

这篇论文揭示了Agent技能库在现实应用中的局限性:研究发现,随着场景从理想化(手工匹配技能)转向真实(自主检索技能),技能带来的性能增益会大幅衰减。例如Claude Opus 4.6的通过率从55.4%降至38.4%,仅比不用技能的baseline高3个百分点。论文提出了渐进式评估框架和技能精炼方法,发现查询级精炼可使Claude性能提升8%,但对较弱模型可能适得其反。核心结论是:技能库的有效性








