官网:Cosmos 3 — Cosmos Lab

github: https://github.com/NVIDIA/cosmos

1. 介绍

英伟达最近发布了Cosmos 3一款基于突破性Transformer混合架构的物理AI世界模型。核心思想是打造一个面向物理 AI 的“通用全模态世界模型”,通过统一架构和渐进式训练,将“理解”与“生成”无缝融合在同一套 Transformer 骨干网络中,利用自回归(AR)分支处理语言和视觉理解,同时利用扩散(Diffusion)分支合成图像、视频、音频及动作。

如图1所示,根据输入输出配置,Cosmos 3可以在多种操作模式之间无缝转换:它可以作为多模式理解和推理的视觉语言模型运行;文本到图像生成器、用于文本到视频合成、图像动画(图像到视频)、未来预测(视频到视频)或同步音频-视频生成的视频生成器;用于联合行动预测和环境模拟的世界行动模型

在经过预训练和中期训练之后,得到了如下通用基础模型,支持所有模态:文本、图像、视频、音频、动作(Action) ,能处理所有的生成模式,适用场景:直接做推理 / 自定义微调

  • Cosmos3-edge :4B
  • Cosmos3-Nano :16B
  • Cosmos3-Super:64B

基于通用基础模型在下游特定任务微调就可以生成专家模型

  • Cosmos3-Nano-Policy-DROID:16B,基于Cosmos3-Nano在DROID 机器人数据集进行微调,可以 输入多视角图像和本体状态,预测动作
  • Cosmos3-Super-Image2Video  64B
  • Cosmos3-Super-Text2Image    64B

2. 模型架构

Cosmos 3能够处理多模式输入并生成多模式输出,包括语言、视觉(图像和视频)、音频和动作,集成了特定于模态的编码器,将不同的模态投影到一个统一的表示空间中,然后由混合变换器(MoT)骨干进行处理。在推理过程中,语言标记是通过下一个标记预测生成的,而其他模态是通过迭代去噪生成的

  

2.1 编码器

给定语言、视觉、音频和动作的输入序列,经专用编码器统一转化为向量嵌入(Embeddings)。为了能够区分不同的模态,在非语言模态中,额外添加可学习的“模态专属嵌入”,其作用相当于给向量打上标签

  •  Image and Video

        使用两个独立的编码器。理解任务使用预训练的ViT编码器(带DeepStack和时间戳,遵循Qwen3-VL设计),生成任务使用冻结的Wan2.2视频VAE编码器(进行4倍时间压缩和32x32空间压缩),ViT编码器与主干网络联合训练,用于生成的VAE编码器则冻结

  • Audio

采用冻结的音频VAE编码器,将48kHz立体声以1920样本的跳跃大小编码,产生每秒25个令牌。

  • Action

统一动作表示,包括自动驾驶汽车、相机运动、机器人和第一人称人类运动(头部和手部)

         - 相机和自动驾驶:Ego Pose

        - egocentric data:使用头部相机姿态增量作为自我姿势,手腕姿势增量作为末端执行器姿势,每个手指的指尖位置作为抓握状态

        - 机器人数据:头部相机姿态+末端执行器姿态+夹爪状态

在这篇论文提到采用6D旋转表示:On the continuity of rotation representations in neural networks

 相关博客:6D连续旋转表示

动作token化

解决不同机器人动作维度不一样:每一个具体的域(Domain)配备一套专属的“输入/输出投影层”,而共享MoT主干网络

x代表标准化的动作向量,W和b代表域特定输入投影矩阵和偏差,z 代表latent action token

将令牌解码回原始动作空间,我们使用特定于域的输出投影

注意事项:
1. 模型结构图中,Vision和Audio token都使用了专门的编码器和解码器,但是action没有使用专门encoder和decoder(论文中没有提到,但是图中结构有encoder,源码中是采用DomainAwareLinear进行动作的编码和解码)
2. Cosmos3没有显式传入本体状态作为condition,输入只有图像 + 域标识(指定机器人类型),这一点可以看源码进行验证

2.2 token排列和生成模式

Cosmos3定义了统一的token排列格式以支持不同任务。

双子序列结构:

  • 自回归(AR)子序列:负责“理解与推理”,输入是包含语言token和ViT编码提取的视觉token
  • 扩散(DM)子序列: 负责“视觉与动作生成”,输入是VAE 编码器压缩的连续视觉 、音频和动作Token。注意,这些输入在训练时是加了噪声

Token Arrangement    

  • 先自回归,后扩散:序列永远以负责逻辑推理的 AR Token 开头。
  • 扩散子序列内部:在扩散部分里,先放作为“提示词/条件”的清晰 Token(如指导视频转换的轮廓视频),再放需要被“去噪”生成的目标 Token。
  • 多模态顺序固定:在每个子序列内部,Token 的排列顺序永远是 视觉 -> 音频 -> 动作

生成模式

  • 语言生成:当输入只有文字或由 ViT 编码的静态图片时,Cosmos 3 就退化成了一个标准的VLM
  • 文生图:输入AR 前缀(文字提示词) 和 目标图像的噪声 Token,噪声图去噪成清晰图像
  • 文生视频 / (视频+音频):在文本后面,拼接一段长度为 n 帧的噪声视频 Token,如果生成声音,就再拼接噪声音频 Token
  • 图生视频 / 视频生视频
    • P=1(只有1张条件图),就是图生视频,序列为:[文字 + 清晰的起始帧 + 后续的噪声视频帧]
    • P>1(有多张条件图),就是视频续写,序列为:[文字 + 清晰的前P帧 + 后续的噪声视频帧]
  • Action生成 :正向动态、反向动态和联合视频动作预测(策略),如下图所示

2.3  MoT架构

双流联合注意力

  • 自回归子序列注意力。AR子序列中的标记仅使用因果自我注意来关注AR子序列内的标记。

  • 双流联合注意力:DM子序列中的令牌使用完全的双向注意力,AR和DM令牌的联合作为键和值。

2.4 多模态位置编码

多模态位置编码:扩展了3D MRoPE以对齐不同采样率的token。下面介绍位置索引分配

  • 语言模态:纯文本序列,没有空间概念,坐标设定为 t=h=w,3D MRoPE 退化成了标准的 1D RoPE 行为。
  • 图像/视频模态:𝑡 由同一帧中的所有令牌共享,且随时间帧递增,h 和 w 随空间网格(Spatial grid)变化。单张图像被视为只有 1 帧的视频,其 t 相同,只有h 和 w 在空间维度上变化。
  • 音频与动作模态(Audio/Action):它们是纯时序数据,没有空间概念,所以 h=w=0。只利用 t 轴 来表示时间的推进(每一个采样步长或音频 Hop 增加一次 t)

原文从以下两个方面介绍多模态位置编码

  • AR与扩散的Token Margin(图中的offset)

        问题:当模型的最后一个“文本 Token”的位置与第一帧“视频 Token”的位置紧挨着时,会导致模型在视频初始帧出现严重的过饱和或棋盘格伪影。这是因为最后一个语言标记和第一帧的视觉标记占据了相邻的时间位置,导致几乎相同的时间嵌入。

        做法:在 AR 子序列(文本/理解)和 DM 子序列(视频/生成)之间,强制插入一个巨大的“固定位置间隙”(15000),避免了位置嵌入的冲突

下面举例说明token  Margin如何起作用

输入参数:
                temporal_modality_margin = 15000;und_len = 332 (文本长度)

Pipeline 先为文本 token 分配连续的位置 ID( [0, 1, ..., und_len-1] ),然后计算出 vision_start_temporal_offset = und_len + 15000 ,接着将这个 offset 作为 所有生成模态(vision/sound/action)的时间轴起始位置——导致文本token(位置 0~331)与生成 token(位置 15332+)在旋转位置编码空间中的相对距离高达约 15000,使得它们的 RoPE 向量几乎 数学正交,从而确保 dual-pathway attention 中文本理解通路的因果性不被生成通路的跨模态注意所干扰

下面是3D mRoPE的计算流程

  • 绝对时间调制
    • 核心思想:为了让模型把“Token的序号”和“真实世界的物理时间(秒)”对应起来
    • 问题:视频A:帧率 60 FPS,视频B:帧率 24 FPS,如果模型只看“Token 数量“,模型会认为 A 的时间跨度比 B 长得多,但是物理时长是一样的,都是 1 秒。需要实现:无论视频是 16 FPS 还是 30 FPS,只要真实世界过去 1 秒,在模型内部的时间坐标轴上占据的长度是完全相等的。
    • 基准尺子 — TPS(每秒时间步长)
      • 视频 (Video) 的 TPS:Cosmos 3 以 24 FPS 作为基准帧率,模型里面有一个 VAE 编码器,它会在时间维度上把视频压缩 4 倍(即4个视频帧合并成 1 个内部 Token),视频基准 TPS为 6
      • 音频基准 TPS=25
      • 动作的TPS等于动作数据的采样频率   
    • 时间增量公式:决定了一帧在时间轴上应该走多远

                                           

简单来说:绝对时间调制建立了TPS基准,保证了视频、音频和动作基于这个时间基准进行对齐,确保生成的内容中视频、音频和动作都是同步的;同时也让模型理解了“快慢”。

源码中提到:只有声音和动作存在可学习的模态偏置,语言和视觉不需要。主要因为语言token和视觉 token通过margin已经隔开,对于视觉token,每帧都进行的patch切换,h,w ≠ 0 ,自然产生不同的 RoPE 编码。对于audio和acition,只有时序信息,所以需要加入额外的模态偏置进行区分。通过这样的操作,就可以区分视觉、音频和动作的token

2.5 模型版本

基础通用模型包括以下三个版本:

Cosmos3-Edge(4B):基于 Qwen3-1.7B 架构设计的,但需要从头开始训练,适合在手机、嵌入式设备等算力有限的端侧设备上运行

Cosmos3-Nano(轻量级,16B):基于预先训练的Qwen3-VL 8B 权重进行初始化,适合单卡推理或算力适中的服务器

Cosmos3-Super(超大规模,64B):基于预先训练的Qwen3-VL 32B 权重进行初始化,算力充足的大型数据中心,追求最高质量的视频/图像生成和理解能力

3. 数据

Cosmos 3 的训练分为 5 个主阶段 :

Reasoner

  • 预训练:学通用多模态理解,在22M样本上进行,以OCR、VQA、captioning、grounding、image/video reasoning等任务为主。
  • 监督微调:约2.2M样本,专注于机器人、自动驾驶、智能基础设施等Physical AI任

Generator

  • 预训练:在大规模图像(7.67亿)、视频(3.477亿片段)和音频数据上进行,采用多分辨率训练(256p, 480p, 720p)和序列打包。
  • 中期训练:保留 image/video/audio 生成能力的同时,引入 action、video transfer、driving transfer等任务。
  • 后训练:在特定领域数据集上进行,以生产领域专家模型(Cosmos3-Super-Text2Image, Cosmos3-Super-Image2Video, Cosmos3-Nano-Policy-DROID)

后续介绍各个训练阶段用到的数据

 3.1 Reasoner Data

总共使用了 2420万(24.2M) 个样本,并划分为两个差异极大的阶段:

  1. 预训练阶段 (Pre-training, 22.0M 样本): 定位:“海量、广度”。主要目的是让模型获得广泛的基础视觉和语言理解能力。 数据组成:以图像-文本(Image-text)为主导,占绝大比例(约1880万)。
  2. 监督微调阶段 (SFT, 2.2M 样本): 定位:“精准、专业”。主要目的是将模型的能力向物理 AI (Physical AI) 专精化转变。 数据组成:视频-文本(Video-text)样本的比例被大幅拉高,占据了整个 SFT 数据集 50% 的份额。这些数据专门强化模型在机器人、智能基础设施、自动驾驶等领域的时空理解与物理因果关系。

 3.2 Genarator Data

三阶段渐进式训练 (Progressive Multi-stage Curriculum)

  1. 第一阶段:预训练 (Pre-training) —— 打基础、看海量数据 规模:高达 7.67亿 张图像,3.48亿 个视频片段。 模态:专注于文生图、文生视频、以及视频续写。这个阶段模型学会了基本的多模态对齐。
  2. 第二阶段:中期训练 (Mid-training) —— 提质量、引入物理AI动作。 规模:预训练数据被大幅度压缩(例如图部分压缩到 1600万),换来的是极高的数据质量。 新增模态:在此阶段,动作模态 (Action) 和 视频迁移 (Video Transfer) 首次被引入训练。 成果:经过 Mid-training 后,得到基础模型 Cosmos3-Nano 和 Cosmos3-Super。
  3. 第三阶段:后期训练 (Post-training) —— 做精专、领域定制 定位:不再是泛化训练,而是有监督的微调(SFT),旨在解决特定能力缺口。 产出领域专精模型: Cosmos3-Super-Text2Image (文生图专家) Cosmos3-Super-Image2Video (图生视频专家) Cosmos3-Nano-Policy-DROID (具身智能动作策略专家)

为什么要在模型中引入“动作”?

普通视频生成的局限:纯视频训练让模型学会了“预测接下来可能发生什么”,但它无法理解“因果关系”。 引入数据让模型学到了双向关系:    给定动作,预测未来的视觉状态(正向动力学) 给定视觉轨迹,推断是什么动作导致了这种变化(逆向动力学)

动作数据全景分布

宏观规模:总计 840万 (8.4M) 个动作片段,总时长高达 6.13万小时 (61.3K hours)。

四大来源支柱:

  • 自我中心运动 (Egocentric motion,占比 67.4% ):时长 4.13万小时。主要来自于一种头戴式 RGB 相机捕捉的双手操作专有数据集。它不仅包含动作,每一帧还同步标注了头部相机的位姿 (Camera pose) 和双手的 21 个 3D 关键点 (Hand keypoints),让模型能同时学习“第一人称视野运动”和“精细的手部动作”。
  • 自动驾驶 (Autonomous vehicle,占比 16.3%):时长 1.0万小时。来源于 NVIDIA Hyperion 平台采集的高质量内部驾驶日志。包含丰富的天气、光照、路况和复杂的横向/纵向操纵。
  • 机器人 (Robotics,占比 8.7%):时长 5,400小时。从开源的数据集中聚合而来(见下方表4解析)。
  • 相机运动 (Camera motion,占比 7.5%):时长 4,600小时。从预训练的视频中提取。通过 ViPE 和 DepthAnything3 等模型估算相机位姿(过滤掉剧烈抖动和异常相机内参),转化为动作轨迹。这帮助模型理解镜头的推拉摇移是如何改变视觉画面的。

 8.7% (5,400小时) 机器人数据的来源:

  • 涵盖的机器人:Agibot (338个任务)、Franka Panda (67,500个任务,442小时)、Google Robot (599个任务)、WidowX-250 (21,800个任务)、UMI (43个任务)、UR (114个任务)。总计包含 90,400 个任务。
  • 核心处理方式:为了兼容不同机器人的物理控制方式(PID控制、低电平致动接口等),将底层指令统一转化为基于状态差异的“伪动作 (Pseudo-actions)”。并且,不仅保留成功的数据,也保留了失败的数据,让模型能学习到“错误的动作会导致什么糟糕的结果”。

数据标准化处理 比例归一化 (Scaling):

  • 计算每个维度的归一化因子,将不同来源的动作向量幅度统一压缩映射到 [-1, 1] 的区间内。
  • 多视角画布拼接 (Multi-view canvas):如果数据包含多个同步的视角(如自动驾驶的前视、侧视、后视多个摄像头),会将它们进行拼接
  • 保留空闲操作 (Idle-step count))

4. 训练

推理器和生成器共享相同的 Transformer 块架构,训练好的推理器权重被用来初始化生成器。 生成器预训练:只更新与生成相关的参数,推理参数保持冻结,中期、后期训练也是一样

4.1 Reasoner Training

预训练

  • 端到端联合训练:所有组件(语言模型、ViT视觉编码器、多模态投影层)上实行从头到尾的联合训练
  • 基于一个强大的预训练 VLM(Edge用自研,Nano用 Qwen3-VL-8B,Super用 Qwen3-VL-32B)进行训练
  • 数据采样:无放回采样,在整个训练过程中,同一个样本不会被重复采样
  • 序列长度限制:将预训练时的最大上下文窗口限制在 16k Token
  • 采用 “平方根归一化逐 Token 损失权重”解决预训练数据中长短序列混杂

监督微调

  • 数据采样:根据每个数据集在物理 AI 领域的重要性、数据质量和规模,为其分配固定的采样权重
  • 预训练数据回流,防灾难性遗忘:采用 固定 1:4 的预训练与 SFT 采样比。即,给模型 4 个微调样本,就强行混入 1 个高质量的预训练样本。这个设计极大地保持了模型的鲁棒性和通用能力

4.2 Generator Training

训练目标:整流流匹配(Rectified Flow Matching)

1. 预训练

策略:多分辨率训练

  • 三个层级 (Tiers):256p、480p、720p 三种分辨率,且包含 5 种宽高比(16:9, 4:3, 1:1, 3:4, 9:16)
  • 独特的数据混合比例:视频(80%)和图像(20%)联合训练。 分辨率分布:480p 占 40%,256p 与 720p 各占 20%。这种分配是为了在“高保真”和“样本多样性”之间取得最佳平衡。

工程优化:序列打包

  • 问题:长短不一的视频/图像导致输入长度差异极大。传统做法是补零(Padding)对齐,这会严重浪费 GPU 算力。
  • 解决方案:采用 “序列打包” 技术。 做法:模型设定了一个 74,000 Token 的固定上下文窗口。系统在送入 GPU 前,会将长短不一的分辨率片段贪婪地拼接到一起,直到完全填满 74,000 的限制

预训练中混合了四种条件模式数据

  • 文生图 (Text-to-Image, 比例 20%):模型学习仅凭文字生成单张图
  • 文生视频 (Text-to-Video, 比例 56% ):给定文本(以及元数据:持续时长、FPS、时间戳)从零去噪生成整段视频
  • 图生视频 (Image-to-Video, 比例 16%):模型必须根据第一帧+文本提示词,预测后续帧。
  • 视频生视频 (Video-to-Video, 比例 8%):引入前5帧真实视频作为条件,模型完成视频续写

硬件算力

  • Cosmos3-Nano 预训练:使用了 1024 张 NVIDIA GB200 显卡,在 31.05T(3.1万亿) 规模的 Token 上进行训练。
  • Cosmos3-Super 预训练:使用了 2048 张 NVIDIA GB200 显卡,在 17.86T(17.8万亿) 规模的 Token 上进行训练。

2.  Mid-Training

核心思想:大规模引入预训练中缺乏的稀缺物理数据(如精细人体动作、机器人物理动力学、自动驾驶场景),引入动作(Action)和视频生成控制信号(Control)。

数据配比转变 预训练阶段几乎全是图文和视频,而到了 Mid-Training,物理任务相关的训练数据占据了超过 50%。动作损失权重放大:因为动作向量的数值通常较小,论文将 Action 的损失函数(Loss)单独放大了 10 倍

算力与数据规模: Cosmos3-Nano:在 2.4T (2.4万亿) Token 上进行中期训练,使用 1024 张 GB200 显卡。 Cosmos3-Super:在 1.9T Token 上训练,使用 2048 张 GB200 显卡。

3.  Post-Training

目标:精准的监督微调(SFT),把基础模型炼制为具体的、垂直领域的专家模型

  • Cosmos3-Super-Text2Image(文生图)
    • 训练策略(两阶段 SFT):
      • 阶段 1:广泛语义微调(2万步)。数据配比:45% 真实图像 + 40% 合成图像 + 15% 纯文字渲染数据。在提升视觉保真度的同时死死保住语言理解能力。
      • 阶段 2:高质量精调(最后 2000 步)。仅使用 47 万对超高质量图像-字幕对,进一步提升美学感和人类偏好对齐。
    • 成绩:在 UniGenBench 基准测试中全面领先,位列开源模型 Top 1,得分 91.36。
  • Cosmos3-Super-Image2Video(图生视频) 目标:在物理 AI 和具身机器人中作为关键的“未来预测机制(世界模拟器)”。
    • 核心数据: 部分过滤后的预训练数据+ 1000 个手工精调视频 + 20k 个 合成视频剪辑,固定输出为480p / 24fps
    • 成绩:在 Artificial Analysis Image-to-Video 排行榜上位列 开源模型 Top 1。
  •  Cosmos3-Nano-Policy-DROID(具身机器人策略专家)
    • 目标:Cosmos 3全模态世界模型扩展为机器人策略模型
    • 硬件平台:使用 Franka Panda 7-DoF(七自由度)机械臂 + Robotiq 2F-85 平行夹爪
    • 数据集:DROID 数据集,包含 7.6万 条真实交互轨迹、350小时 交互数据、86个 复杂桌面操作任务
    • 模型架构修改(修改动作解码器):重新初始化了动作编码器、动作解码 MLP 和动作嵌入 Token
    • 输入模态:3个视角+ 本体感受状态 手腕视角(360×640)以及底部左侧与右侧两个外部环境视角(180×320)
    • 输出:预测未来 32 个绝对关节位置动作,额外输出辅助的 RGB 视频帧
    • 控制频率:15Hz
    • 推理优化 :极少的去噪步数(4步)以及CFG 并行
    • 成绩:在 RoboLab 和 RoboArena 两大机器人策略基准测试中,排名 世界第一

5. 基础设施

Cosmos 3 的基础设施是一个覆盖了从“海量原始数据”到“最终物理世界部署”的全生命周期端到端工程体系。原论文有很大一部分描述这一块内容,可自行看原论文,这里进行简单总结。

  • 数据基础设施— SILA 平台
    • 定位:解决百亿级多模态数据的清洗、标注、去重难题。 研发了 SILA(可扩展大规模数据处理与标注基础设施),提出关键技术:“统一列式Lance数据库”、 AI大模型打分系统 对数据进行严格过滤、通过分阶段Ray执行引擎降低任务延迟
  • 大规模训练基础设施:将清洗好的数据送入千卡 GPU 集群,进行高性能分布式训练,解决了多模态数据“长短不一”导致的 GPU 算力浪费问题
  • 模型服务基础设施 (Model Serving) :将训练好的大模型转化为工业级、低延迟的推理服务,实现了推理器(理解)与生成器(生成)在物理硬件上的极致加速。
  • 基准测试与验证基础设施 (Benchmarking & Validation):建立了“评测分离”的可追溯体系,实现对模型进行自动化、系统化评估,以数据驱动迭代。 

6. 实验结果

总体结果:

推理基准测试

生成基准测试

  • 文生图

  • 视频生成

  • 音频生成

  • 动作

    论文提到:这个是在RoboLab仿真基准测试的结果

下面是在RoboArena real-world benchmark测试的结果   

更多推荐