最近,海外AI技术社区正在热议一个新的视觉AI方向。它来自360人工智能研究院的一项ECCV 2026收录论文——MoSA(Motion-Grounded Segment Anything)。

计算机视觉三大顶会之一,能中一篇本身就足以成为新闻钩子。

但如果只把这次入选当成"又一篇论文"来看,反而错过了更值得关注的部分。

把时间轴拉长到整个2026上半年——360人工智能研究院在ICLR、CVPR、ICML、ECCV四大顶会上累计有6篇论文被收录,覆盖多模态理解多模态生成两条主线。把6篇论文摆在一起看,会发现它们并非散点,而是一条清晰的、围绕"让AI更精准、更可控"展开的研究路线。

本文从技术脉络的角度,对这6篇论文做一次系统拆解。

一、先看全局:6篇论文构成的两条研究路线

360人工智能研究院2026上半年被顶会收录的6篇论文,可以归入下面这张技术路线图:

研究方向 论文 顶会 解决的问题
多模态理解 FG-CLIP 2 ICML 2026 细粒度图文对齐与检索
多模态理解 AML(AMLRIS) ICLR 2026 Agent的视觉Grounding能力
多模态理解 MoSA ECCV 2026 无监督视觉基础模型路径
多模态生成 RevealLayer ICML 2026 图像图层可控分解与编辑
多模态生成 RefTON CVPR 2026 虚拟试衣的可控生成
多模态生成 NAMI CVPR 2026 高效高分辨率图像生成

两条路线并不是各自孤立——多模态理解解决"AI看得准不准",多模态生成解决"AI改得准不准",共同指向同一个目标:让AI能力在真实生产场景中更精准、更可控、更可靠。

这次ECCV上的MoSA,是这条路线的最新信号,但绝不是孤点。

二、多模态理解路线:从看懂细节,到找准目标,再到自主学习物体概念

在这里插入图片描述

理解路线上的三篇论文,恰好对应着AI"理解世界"能力的三个台阶。

第一阶:FG-CLIP 2 —— 让AI"看得更细"

以CLIP为代表的第一代视觉-语言模型,能完成基础的图文匹配,但有一个长期被诟病的短板——只理解"整体语义",难以区分细节差异。这成了互联网搜索、推荐、广告匹配精度提升的"天花板"。

FG-CLIP 2是360人工智能研究院细粒度图文对齐模型FG-CLIP的第二代,从训练范式、目标函数到数据生态做了全面革新,补齐了业界亟需的中文能力支持,在8大类共29项benchmark上,超越SigLIP 2、MetaCLIP 2等最新强力基线,双语性能达到全球第一

直接价值:从"只看懂大概",变成"对细节精确对齐和区分"——不仅知道图里有什么,还能准确理解"哪一个对象、什么属性、处在什么位置"。这一能力已经落地到360云盘、亿方云等产品中的AI检索场景。
在这里插入图片描述

第二阶:AML —— 让Agent"找准目标"

当AI从"被动问答"走向"主动执行",一个新的问题浮现:Agent能不能准确定位用户想操作的目标?

AML(被ICLR 2026收录)就是冲着这个问题来的。它解决的是Agent的视觉Grounding能力——让Agent面对一个软件界面、一个文档、一个网页时,能够准确找到用户口中的"那个按钮"“那个文件”“那个输入框”,并理解其语义。

这是从"AI看懂图"到"AI能动手"之间的关键一跃。没有精准的Grounding能力,Agent就如同一个看得见但手抖的操作员,无法真正落地到产业工作流。

第三阶:MoSA —— 让AI"自主学习物体概念"

ECCV 2026上的这篇MoSA,则是这条理解路线走得最深的一步。
在这里插入图片描述
SAM已经证明了通用分割模型的强大能力,但它依赖大规模人工标注数据——这意味着扩展性受限于标注成本。

MoSA提出的是另一条路径:

  • 核心问题:AI能否通过观察无标注视频中的运动,自主学习"什么是物体"?
  • 方法:利用大规模无标注视频自动生成伪标签。
  • 规模:研究中使用了约1万小时无标注视频,自动构建超过2100万个高质量伪标签
  • 训练过程不依赖人工标注

注意,这里不是说MoSA"取代SAM"或"击败SAM"——更准确的表述是:MoSA探索了一条更可扩展、更低人工标注依赖的视觉基础模型训练路径。它尝试让AI从"依赖人类标注教会识别物体",走向"通过观察世界自主学习物体概念"。

理解路线小结

把三篇论文串起来,360的多模态理解路线图景清晰可见:

从看懂图文细节(FG-CLIP 2),到找准用户目标(AML),再到自主学习物体概念(MoSA)——360在做的是让AI理解得更精准。

三、多模态生成路线:不只是"生成更多",而是"生成得更准、更可控"

当前图像/视频生成赛道有一个公认的痛点——产品同质化。通用化生成能力已经很难匹配产业场景对精细化、定制化、可控化的需求。360的生成路线,正是对这一痛点的正面回应。

RevealLayer:从"一张图"到"可编辑的图层结构"

主流图像生成模型已经能生成好看的图,但实际业务中真正被反复追问的问题是:能否精确控制生成/编辑结果?

RevealLayer(ICML 2026)做的不是"生成一张图",而是把一张图拆解成多个可编辑的图层(类似PS中的图层结构),并且每一层都带有透明信息(RGBA)。

它的三个核心突破:

  • 图层级别的可控分解:通过区域感知注意力(Region-Aware Attention),把"前景/背景/遮挡关系"拆清楚,而不是混在一起。
  • 遮挡内容的真实还原:利用Occlusion-Guided机制,可以"补全被遮挡的部分"——比如被前景挡住的背景,或者被目标A遮挡的目标B。
  • 边界精确到像素级:通过alpha约束损失,解决传统方法中常见的边缘模糊、残影问题。

带来的直接价值是真正的"指哪改哪"——不仅知道哪里是目标,还能单独操作该部分,同时保证整体一致性。在"All in Agent"的战略下,它是实现"可执行视觉操作"的关键基础能力。

RevealLayer已经于6月12日上线360人工智能研究院SaaS平台。
在这里插入图片描述

RefTON:虚拟试衣的"零辅助输入"突破

RefTON(CVPR 2026)针对的是虚拟试衣这一具体业务场景。

传统虚拟试衣技术有几个长期痛点:依赖人体姿态识别、图像分割等外部模型,算法流程长且易引入外部错误;常出现面料质感失真、蕾丝花纹、透明材质等细节还原不到位的问题。

RefTON的开创性在于——引入"服装上身参考图"作为视觉指引,通过创新的双阶段训练策略与多条件输入适配优化,摆脱了对复杂辅助输入的依赖。仅需人物原图与目标服装图,就能实现高保真的虚拟试穿生成,精准还原服装的材质纹理、精细设计,同时兼容掩码与无掩码两种试穿模式,在国际公开基准测试中斩获领先性能。
在这里插入图片描述

NAMI:高分辨率生成的"效果与效率"双向突破

NAMI(CVPR 2026)直击高分辨率AI图像生成的行业痛点——“效果好则速度慢、速度快则效果打折扣”

主流图像生成模型往往因参数量庞大,存在推理延迟高、算力消耗大、难以在端侧部署的问题。NAMI创新提出桥接渐进式Rectified Flow设计,将图像生成过程按分辨率分阶段拆解,通过自研BridgeFlow模块实现跨阶段流的精准对齐——让模型在低分辨率阶段快速搭建图像轮廓,高分辨率阶段精细化打磨细节。

在保证生成画质、文本语义对齐能力比肩国际顶尖模型的前提下,将1024×1024高分辨率图像的推理时间大幅降低64%。这一技术为端侧AI创新业务提供了轻量化、高性能的核心生成能力支撑。
在这里插入图片描述

生成路线小结

把三篇论文串起来,360的多模态生成路线同样清晰:

从可控图层分解(RevealLayer),到可控虚拟试衣(RefTON),再到高效可控的高分辨率生成(NAMI)——重点不是让AI"生成更多",而是让AI"生成得更准、更可控、更适合业务场景"。

四、两条路线的共同方向:精准可控

把理解和生成两条路线放在一起看,会发现360人工智能研究院的研究有一个非常明确的共同方向——精准可控

这个方向不是凭空选择的,而是基于一个清晰的行业判断:

当大模型能力普及,通用能力之间的差距正在快速缩小,AI产品在功能和体验上逐渐趋同。“能做什么"不再构成壁垒,真正的挑战转向"能否做得更细、更可控、更贴近具体场景”。

换句话说,下一轮AI竞争的差异化,正在从"模型规模"转向"模型精度与可控性"。

360的6篇顶会论文,恰好对应了这一判断的两个关键维度:

  • 理解侧的精准:看懂细节(FG-CLIP 2)、找准目标(AML)、自主学习物体概念(MoSA)。
  • 生成侧的可控:可控图层(RevealLayer)、可控试衣(RefTON)、高效可控生成(NAMI)。

这条路线已经开始向产品端延伸:

  • RevealLayer已上线360人工智能研究院SaaS平台(research.360.cn/products/Reveal-Layer)。
  • FG-CLIP 2已经支撑360云盘、亿方云等产品中的AI检索能力。

这说明360的AI研究不是停留在学术发表,而是形成了"研究问题—模型能力—产品场景"的闭环。

五、为什么是360:安全公司做AI基座模型的独特价值

技术脉络清晰之外,还有一个更宏观的问题值得讨论:为什么一家全球领先的安全公司,投入资源做AI基座模型研究,值得被关注?

答案藏在360的公司基因里。

安全公司天然关注几件事:

  • 鲁棒性:系统在异常输入下不能崩。
  • 抗干扰:面对对抗样本、噪声环境、极端场景,依然要稳定工作。
  • 复杂环境下的可靠性:真实世界不是干净的实验室数据。
  • 真实产业场景的可控性:不能"差不多能用"就交付。

这些要求,恰恰与Agent和产业应用对AI能力的要求高度一致。

这就是为什么360的AI路线,看起来不像一家偏聊天陪伴或创意生成的AI公司——它从一开始就更关注让AI在真实生产场景中准确、稳定、可控。MoSA追求的更低标注依赖、FG-CLIP 2追求的更精细理解、RevealLayer追求的更可控编辑,背后都是同一种工程价值观的延伸。

也正因为如此,海外X平台上对这6篇论文的讨论中,一个反复出现的判断是:360的AI研究方向,是面向Agent和产业应用场景,打造更精准、更可控、更可靠的AI能力——这并非偶然。

结语:把6篇论文看成一条路线

回到开篇的问题:ECCV 2026上的MoSA意味着什么?

如果把它看成单篇论文,它是一个在无监督视觉基础模型方向上的重要探索; 如果把它放回360人工智能研究院2026上半年的研究布局里,它是一条清晰路线上的最新坐标

细粒度图文对齐、Agent视觉定位、无监督物体学习、可控图层分解、可控虚拟试衣、高效高分辨率生成——这6项能力看似分散,实则共同指向同一个判断:当AI进入Agent和产业应用场景,"精准可控"会变得越来越重要

这不是一两篇论文就能讲完的故事,而是一家研究院系统性布局的结果。对于关注AI基础模型方向的开发者和技术同行来说,这条路线值得持续跟踪。

论文与产品体验入口:

  • 360人工智能研究院官网:https://research.360.cn
  • RevealLayer产品体验:https://research.360.cn/products/Reveal-Layer
  • FG-CLIP 2产品介绍:https://research.360.cn/products/fg-clip
  • 研究院GitHub:https://github.com/360CVGroup

更多推荐