都2026了,该做多模态Agent了!
小伙伴们好,我是小嬛。专注于人工智能、计算机视觉、AI大模型领域相关分享研究。【目标检测、图像分类、图像分割、目标跟踪等项目都可做,相关领域论文辅导也可以找我;需要的可联系(备注来意)】
-------正文开始--------
前段时间,字节跳动把自己内部搞多模态Agent的那套东西开源了,GitHub Star直冲33.1k,直接引爆了这个方向的发文热度。
不过虽说这方向确实很有搞头,但肯定是不能再单纯堆模块、刷指标的。从近期的很多工作来看,现在顶会更青睐落地性强的研究,比如AAAI26上那篇TongUI,都能直接拿去做GUI自动化产品或项目了。因此我的建议是从场景驱动切入,重点关注模态对齐、工具协同、长时序推理这些痛点,更容易做出差异化贡献。
当然,光 有个方向肯定是不行的,建议多关注顶会最新论文和工业界挑战,从中找到自己感兴趣也有优势的切入点。这里我为了帮大家节省查找的时间,我给大家提供更多的发文思路和方向,大家扫码获取!!!

【AAAI26】TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
研究方法:论文提出TongUI框架,通过爬取并处理网络多模态图文与视频教程,构建百万级跨系统GUI轨迹数据集GUI-Net-1M,在此基础上微调Qwen2.5-VL多模态agent,以低成本实现跨平台、强泛化的通用GUI交互能力。

创新点:
-
构建GUI-Net-1M百万级GUI轨迹数据集,覆盖5大操作系统、280+应用,为当前最大开源GUI轨迹数据集。
-
提出TongUI框架,将互联网多模态图文、视频教程自动转化为高质量GUI交互轨迹,大幅降低数据标注成本。
-
基于Qwen2.5-VL微调TongUI多模态agent,在多个主流GUI基准上性能显著提升,泛化能力优于基线模型。

研究价值:研究提出自动化的多模态教程转轨迹框架并构建百万级跨平台GUI数据集,解决了GUI智能体训练数据稀缺、标注成本高的痛点,为通用多模态GUI智能体的低成本训练与跨系统泛化提供了重要数据资源与技术路径。
XSKILL: Continual Learning from Experience and Skills in Multimodal Agents
研究方法:XSKILL提出面向多模态智能体的双流持续学习框架,从多路径执行轨迹中提炼任务级技能与动作级经验,依托视觉锚定的知识提取、分层整合、上下文检索与适配机制,实现无参数更新下的推理能力持续增强。

创新点:
-
提出面向多模态智能体的双流知识框架,将可复用知识划分为任务级技能与动作级经验,实现互补式知识建模。
-
设计视觉锚定的知识提取与整合机制,从多路径执行轨迹中提炼结构化技能与精简经验,减少语义冗余。
-
构建上下文感知的知识检索与适配流程,将知识动态适配到当前视觉场景,无需参数更新即可持续提升多模态智能体的推理与工具编排能力。

研究价值:研究提出的 XSKILL 双流持续学习框架,为多模态智能体提供无需参数更新的知识积累与复用方案,有效解决工具使用低效、编排僵化的核心痛点,显著提升其跨任务泛化与复杂视觉推理能力,为通用智能体的迭代优化提供了高效可行的技术路径。
感谢各位观众的观看和支持,祝大家的论文早日accept!!
希望论文一路绿灯的朋友可以找我,我有团队,有资源,有背景,一条龙服务~~~~


更多推荐



所有评论(0)