logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

每日论文解读(8.4)1——SESA:面向自我进化搜索Agent的出题-解题-记忆闭环框架

文章摘要: 论文《Self-Play Meets Skill Evolution》提出SESA框架,通过非对称自博弈(Asymmetric Self-Play)结合技能记忆(Skill Memory)机制,实现搜索Agent的自我进化。SESA的核心创新是让出题者(Proposer)和解题者(Solver)在信息不对称环境下对抗学习,解题者将失败经验蒸馏为结构化技能存入记忆库,而出题者基于解题成功

文章图片
每日论文解读 (8.3) 1——DeepResearch Agent System:稀疏激活架构驱动的自主深度研究Agent

DeepResearch Agent System:稀疏激活架构驱动的自主深度研究系统 本文提出了一种基于稀疏激活架构(MoE)的深度研究智能体系统,通过多维度技术创新解决传统LLM在复杂研究任务中的局限性。系统核心包括:1)300亿总参数/30亿激活参数的稀疏架构,实现推理成本与模型能力的解耦;2)分层注意力机制支持128K长上下文的高效处理;3)双模推理引擎(ReAct+IterResearc

文章图片
#架构
每日论文解读(8.7)——OneDayAgent:面向长时程自主智能体的通用框架

本文摘要: OneDayAgent是一种面向长时程日常任务的智能体框架,通过分解、验证与记忆三位一体的管理机制解决复杂任务执行问题。其核心创新在于:1)将开放式请求分解为有序子任务;2)通过全局验证与针对性修复确保交付物质量;3)采用三层执行记忆机制防止状态丢失。实验表明,该框架在AgentIF-OneDay基准上达到0.821分(104个任务),并能在不同后端模型间稳定迁移。研究揭示了长时程智能

文章图片
每日论文解读(8.6)——Argus:面向长程推理的通用Agent运行时

长程推理不是沿着固定路线尽可能跑得更远,而是在证据支持当前路线时坚持,在验证暴露失败时转向;通过持久化项目状态、四角色权威分离和验证门控更新,使固定模型在运行时层面实现自进化,同时保持可审计性和可恢复性。持久化状态优于对话记录:项目状态(记忆、技能、工具、验证器、路由)是长寿命对象,对话记录是消耗品。跨会话连续性必须建立在可重启的持久状态上。验证门控优于自动保留:候选更新(包括失败路径)只有在经过

文章图片
#架构
每日论文解读(8.5)——BCER Agent:面向可靠长程MRI工作流的编译-绑定-有界恢复架构

BCER Agent:编译与绑定驱动的可靠长程MRI工作流执行 本研究提出BCER Agent框架,旨在解决现有AI系统在执行复杂医学影像分析工作流时的可靠性问题。传统反应式Agent在MRI多阶段流水线中面临数据维度跃迁(3D/4D体数据)、链式依赖、中间工件复杂性和临床可审计性等核心挑战。 BCER创新性地采用四层神经启发架构:1) Brain层负责高层规划生成部分指定的工作流草图;2) Ce

文章图片
#架构
情感交互仿生人从技术到落地构想5——技术交流贴(2026.8)

摘要:情感陪伴仿生人混合训练全链路方案 针对情感陪伴机器人面临的数据采集难题(隐私、伦理、成本三重困境),本文提出"仿真为主(80%)、真机为辅(20%)"的混合训练方案。通过Isaac Sim+Omniverse构建高保真仿真环境,生成带情绪标签的多模态数据;辅以小规模真机脱敏数据修正虚实差异;最终形成"仿真生成-真机验证-数据回流"的闭环迭代体系。该方案突破隐私红线,以1/10成本实现工业级数

文章图片
#交互#人机交互#人工智能
情感交互仿生人从技术到落地构想5——技术交流贴(2026.8)

摘要:情感陪伴仿生人混合训练全链路方案 针对情感陪伴机器人面临的数据采集难题(隐私、伦理、成本三重困境),本文提出"仿真为主(80%)、真机为辅(20%)"的混合训练方案。通过Isaac Sim+Omniverse构建高保真仿真环境,生成带情绪标签的多模态数据;辅以小规模真机脱敏数据修正虚实差异;最终形成"仿真生成-真机验证-数据回流"的闭环迭代体系。该方案突破隐私红线,以1/10成本实现工业级数

文章图片
#交互#人机交互#人工智能
每日论文解读(7.29)——MAPD论文解读:从专有模型到开源模型的多智能体协议蒸馏

论文摘要: 中国科学院大学等机构提出的MAPD框架解决了专有模型(如GPT、Claude)向开源模型(如Qwen)蒸馏Agentic Search能力时的核心挑战。传统方法因专有模型tokenizer不透明和语言风格差异导致性能下降,而MAPD创新性地引入结构化JSON协议作为中间表示,通过多智能体系统(MAS)离线生成标准化推理轨迹。训练阶段结合在线策略自蒸馏(OPSD)和GRPO强化学习,在H

文章图片
#开源
情感交互仿生人从技术到落地构想1——技术交流贴(2026.7)

具身智能技术现状与未来展望(2026年视角) 2026年被认为是具身智能元年,其核心在于AI通过物理或虚拟实体与环境实时交互,形成感知-认知-行动的闭环学习系统。与传统AI不同,具身智能强调“行万里路”的实践学习,而非仅依赖静态数据训练。目前,具身智能已应用于家庭服务机器人、工业柔性产线、医疗手术及康复设备、自动驾驶等领域。 然而,情感交互型仿生人仍面临诸多挑战:硬件上,高自由度灵巧手、长续航动力

文章图片
#交互#人工智能#机器人 +1
每日论文解读(7.27)——OpenForge RL 论文解读:让 AI 智能体在真实部署环境中端到端学习

推理工具链日益复杂,但开源训练框架却无法跟上。这种“部署端日新月异、训练端原地踏步”的错位,使得绝大多数开源研究只能通过简化版工具链进行训练,然后在部署时面对完全不同的行为模式。OpenForge RL首次提出了一个通用解决方案——用轻量级代理解耦训练与推理,用Kubernetes编排实现弹性扩展。这不是渐进式改进,而是一种范式级的突破:让训练环境真正等于部署环境。2026年,AI智能体已经从实验

#人工智能#学习
    共 18 条
  • 1
  • 2
  • 请选择