logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

用模拟器“养“出一个能打的搜索Agent:8B小模型如何在无限上下文下学会推理、追问与规划

一个8B参数的小模型,在模拟环境里"打怪升级"之后,搬到真实世界居然还能稳定输出——这背后的工程设计和学术思路,比结果本身更值得细品。

#前端#人工智能#自然语言处理
AgentSwing:长时Web Agent的上下文管理,为什么“一条路走到黑“行不通

AgentSwing:长时Web Agent上下文管理的自适应路由方法 本文针对长时Web Agent在复杂搜索任务中面临的"上下文腐烂"问题,提出了一种创新的自适应路由方案。传统方法如保留最近N轮、摘要压缩或全部丢弃等静态策略,在效率和精度之间存在固有矛盾。AgentSwing通过并行执行多种上下文管理策略,并前瞻性地评估各分支的未来表现,实现了动态最优策略选择。实验表明,该

文章图片
#前端#microsoft#机器学习 +1
AggAgent:把并行轨迹当环境来交互,智能体聚合的新范式

AggAgent:智能体聚合新范式 Princeton团队提出AggAgent,解决智能体并行任务中的聚合难题。传统方法如投票或轨迹压缩存在信息丢失或成本过高问题。AggAgent创新地将并行轨迹视为"环境",配备4个轻量工具让聚合Agent按需检索和交叉验证信息。实验显示,在6个基准任务上,AggAgent平均提升2.4-5.3个点,深度研究任务提升达10.3点,且仅增加5.

文章图片
#交互#人工智能#深度学习 +1
OpenSWE:147 万美元打造最大开源 SWE 训练环境,45k Docker 环境助力代码 Agent 登顶 SWE-bench

GAIR-NLP团队投入147万美元构建了OpenSWE——目前最大的开源软件工程智能体训练框架。该框架包含45,320个可执行的Docker环境,覆盖12,800个代码仓库,所有基础设施完全开源。OpenSWE解决了构建SWE训练环境的四大挑战:依赖管理、测试验证、任务对齐和难度控制,通过多智能体协作流水线实现高质量环境构建。基于该框架训练的OpenSWE-72B模型在权威基准SWE-bench

文章图片
#开源#docker#容器 +1
AD-Bench:当LLM Agent遇上真实广告投放,最强模型也只能拿69分

腾讯团队发布AD-Bench基准测试,评估LLM Agent在真实广告投放分析场景中的表现。该基准包含823条真实广告优化师查询,按复杂度分为三级(L1简单检索至L3综合分析)。创新性地采用"轨迹感知评估",不仅看结果准确性,还考察工具调用路径合理性。测试10个主流模型发现:GPT-5.1以69%得分最高,国产模型混元2.0和DeepSeek-V3达62%与Gemini-3-P

文章图片
#人工智能#深度学习#机器学习
给Agent装上“大脑“有多难?一篇Survey揭示了智能体记忆系统的残酷现实

摘要:这篇综述论文系统分析了LLM智能体的记忆系统,将其分为四大流派(语义记忆、个性化记忆、情景记忆和结构化记忆),并通过实验揭示了当前记忆系统的四大痛点:基准测试存在"上下文饱和陷阱",传统评估指标(如F1)与语义理解脱节,开源骨干模型存在高格式错误率(达30.38%),复杂架构在实际部署中面临延迟问题。研究指出,在长上下文窗口时代(如128k+),许多记忆系统的优势可能被夸

#深度学习#自然语言处理#语言模型
给Agent装上“大脑“有多难?一篇Survey揭示了智能体记忆系统的残酷现实

摘要:这篇综述论文系统分析了LLM智能体的记忆系统,将其分为四大流派(语义记忆、个性化记忆、情景记忆和结构化记忆),并通过实验揭示了当前记忆系统的四大痛点:基准测试存在"上下文饱和陷阱",传统评估指标(如F1)与语义理解脱节,开源骨干模型存在高格式错误率(达30.38%),复杂架构在实际部署中面临延迟问题。研究指出,在长上下文窗口时代(如128k+),许多记忆系统的优势可能被夸

#深度学习#自然语言处理#语言模型
4B小模型干翻70B?CoVe用约束验证让工具调用Agent数据效率提升18倍

摘要: 华为诺亚方舟实验室提出的CoVe框架通过约束验证解决工具调用Agent的数据合成难题。其核心创新在于用数据库约束生成任务(保证可解性),并通过同一套约束验证轨迹质量(避免依赖LLM打分)。CoVe的流水线包含约束采样、模糊化、交互生成和规则验证四步,仅用12K条高质量数据训练的4B模型在τ²-bench上媲美70B模型性能。该方法数据效率提升18倍,验证机制完全确定且可解释,为多轮交互式工

文章图片
#人工智能#语言模型
MiroThinker-1.7 & H1:搜索 Agent 的天花板不在“搜得多“,而在“每步都靠谱“

MiroThinker-1.7 换了一条路:在预训练和 SFT 之间插入 Agentic Mid-Training 阶段,强化每一步的"原子决策"质量(规划、推理、工具使用、答案汇总)。MiroThinker-H1 再叠加一套 Local + Global 双重验证机制,让模型"做一步查一步、交卷前全局复审"。结果是 BrowseComp 88.2%、GAIA 88.5%——前者 OpenAI D

文章图片
#microsoft#深度学习#开源
Agent的技能库看起来很美好,但真用起来呢?这篇论文给出了残酷的答案

这篇论文揭示了Agent技能库在现实应用中的局限性:研究发现,随着场景从理想化(手工匹配技能)转向真实(自主检索技能),技能带来的性能增益会大幅衰减。例如Claude Opus 4.6的通过率从55.4%降至38.4%,仅比不用技能的baseline高3个百分点。论文提出了渐进式评估框架和技能精炼方法,发现查询级精炼可使Claude性能提升8%,但对较弱模型可能适得其反。核心结论是:技能库的有效性

文章图片
#人工智能#深度学习#自然语言处理
    共 252 条
  • 1
  • 2
  • 3
  • 26
  • 请选择