Kimi 团队

摘要

我们提出了Kimi-VL,这是一个高效的开源专家混合模型(MoE)视觉-语言模型(VLM),它提供了先进的多模态推理、长上下文理解和强大的代理能力,同时在语言解码器中仅激活2.8B参数(Kimi-VL-A3B)。

Kimi-VL 在具有挑战性的领域中表现出色:作为通用的VLM,Kimi-VL 在多轮代理任务中表现优异(例如OSWorld),与旗舰模型相当。此外,它在各种具有挑战性的视觉语言任务中展现出显著的能力,包括大学水平的图像和视频理解、OCR、数学推理和多图像理解。在对比评估中,它有效竞争了最先进的高效VLM,如GPT-4omini、Qwen2.5-VL-7B和Gemma-3-12B-IT,同时在几个关键领域超越了GPT-4o。
Kimi-VL 还在处理长上下文和感知清晰度方面有所进步。通过128K扩展上下文窗口,Kimi-VL 可以处理各种长输入,在LongVideoBench上取得了64.5分,在MMLongBench-Doc上取得了35.1分。其原生分辨率视觉编码器MoonViT进一步允许它看到并理解超高分辨率视觉输入,在InfoVQA上达到了83.2分,在ScreenSpot-Pro上达到了34.5分,同时保持较低的常见任务计算成本。
基于Kimi-VL,我们引入了一个先进的长时间思考变体:Kimi-VL-Thinking。通过长时间链式思维(CoT)监督微调(SFT)和强化学习(RL)开发的此模型展示了强大的长时间推理能力。它在MMMU上得分为61.7,在MathVision上为36.8,在MathVista上为71.3,同时保持紧凑的2.8B激活LLM参数,为高效而多模态的思维模型设定了新标准。代码和模型在https://github.com/MoonshotAI/Kimi-VL 公开访问。
img-0.jpeg

图1:Kimi-VL-Thinking 与前沿开源VLM的比较,包括短思考VLM(例如Gemma-3系列、Qwen2.5-VL系列)和长思考VLM(QVQ-72B-Preview)在MathVision基准上的表现。我们的模型仅用2.8B LLM激活参数就实现了强大的多模态推理。
img-1.jpeg

图2:Kimi-VL在广泛基准测试中的亮点,包括通用基准(MMMU、MMBench)、OCR(InfoVQA)、多图像(BLINK)、长视频(LongVideoBench、Video-MME)、长文档(MMLongBench-Doc)和代理(ScreenSpot-Pro 和 OSWorld)。详细结果见表3。

1 引言

随着人工智能的快速发展,人类对AI助手的期望已超越传统的仅限语言的交互,越来越符合我们世界固有的多模态特性。为了更好地理解和应对这些期望,新一代的原生多模态模型,如GPT40(OpenAI等,2024年)和Google Gemini(Gemini团队等,2024年)已经出现,它们具备同时感知和解释视觉输入与语言处理的能力。最近,由OpenAI o1系列(OpenAI,2024年)和Kimi k1.5(K团队等,2025年)开创的先进多模态模型进一步通过加深和延长多模态输入的推理能力来推动这些界限,从而解决更复杂的多模态领域问题。
然而,开源社区中的大型VLM发展明显落后于其仅限语言的对应物,特别是在可扩展性、计算效率和高级推理能力方面。虽然仅限语言的模型DeepSeek R1(DeepSeek-AI,D. Guo等,2025年)已经利用了高效且更可扩展的专家混合(MoE)架构,并促进了复杂的长链推理(CoT)推理,但最近大多数开源VLM,如Qwen2.5-VL(Bai等,2025年)和Gemma-3(Gemma团队等,2025年),仍然依赖于密集架构并且不支持长CoT推理。早期对基于MoE的视觉-语言模型的探索,如DeepSeek-VL2(Zhiyu Wu等,2024年)和Aria(D. Li等,2024年),在其他关键维度上存在局限性。从架构上看,这两种模型仍然采用相对传统的固定大小视觉编码器,限制了它们对多样视觉输入的适应性。从能力角度来看,DeepSeek-VL2仅支持有限的上下文长度(4K),而Aria在细粒度视觉任务上表现不佳。此外,两者都不支持长时间思考能力。因此,迫切需要一个能够有效整合结构创新、稳定能力和增强长时间思考推理能力的开源VLM。
鉴于此,我们推出了Kimi-VL,这是面向开源社区的视觉-语言模型。在结构上,Kimi-VL由我们的Moonlight(J. Liu等,2025a)MoE语言模型组成,该模型仅激活 2.8 B \mathbf{2 . 8 B} 2.8B参数(总共有16B参数),并配有一个4亿参数的原生分辨率MoonViT视觉编码器。在能力方面,如图2所示,Kimi-VL可以稳健地处理各种任务(细粒度感知、数学、大学水平问题、OCR、代理等)以及广泛的输入形式(单图像、多图像、视频、长文档等)。具体来说,它具有以下令人兴奋的能力:
img-2.jpeg

图3:Kimi-VL和Kimi-VL-Thinking的模型架构,包括允许原生分辨率图像的MoonViT、MLP投影仪和专家混合(MoE)语言解码器。

  1. Kimi-VL很聪明:它在高效纯文本LLM方面的文本能力相当;即使没有长时间思考,Kimi-VL已经在多模态推理和多轮代理基准测试中表现出竞争力,例如MMMU、MathVista、OSWorld。
  2. Kimi-VL处理长内容:它在其128 K上下文窗口内有效处理各种多模态输入的长上下文理解,在长视频基准测试和MMLongBench-Doc上远超同类规模的竞争者。
  3. Kimi-VL感知清晰:它在各种视觉语言场景中展示出全面的竞争能力,超过现有的高效密集和MoE VLM:视觉感知、视觉世界知识、OCR、高分辨率操作系统截图等。
    此外,通过长时间CoT激活和强化学习(RL),我们介绍了Kimi-VL的长时间思考版本——Kimi-VL-Thinking,这进一步显著提高了在更复杂多模态推理场景中的性能。尽管其规模较小,Kimi-VL-Thinking在困难推理基准测试(如MMMU、MathVision、MathVista)中表现出色,超过了许多规模更大的最先进VLM。

2 方法

2.1 模型架构

Kimi-VL 的架构由三部分组成:原生分辨率视觉编码器(MoonViT)、MLP 投影器和 MoE 语言模型,如图 3 所示。我们在本节中介绍每一部分。

MoonViT:原生分辨率视觉编码器 我们设计了 MoonViT,即 Kimi-VL 的视觉编码器,用于原生处理不同分辨率的图像,消除了对复杂子图像分割和拼接操作的需求,正如 LLaVA-OneVision(B. Li 等人,2024)中所采用的方法。我们采用了 NaViT(Dehghani 等人,2023)中的打包方法,其中图像被划分为块,展平并顺序连接成 1D 序列。这些预处理操作使 MoonViT 能够共享与语言模型相同的核计算算子和优化方法,例如由 FlashAttention(Dao 等人,2022)支持的可变长度序列注意力机制,确保对不同分辨率的图像进行非妥协的训练吞吐量。
img-3.jpeg

图4:Kimi-VL的预训练阶段在对其语言模型进行纯文本预训练后总共消耗了4.4 T tokens。为了保留文本能力,所有更新语言模型的阶段都是联合训练阶段。

MoonViT 初始化自 SigLIP-SO-400M(Zhai 等人,2023),最初采用可学习的固定大小绝对位置嵌入来编码空间信息。虽然我们插值这些原始位置嵌入以更好地保留 SigLIP 的能力,但随着图像分辨率的增加,这些插值嵌入变得越来越不足。为了解决这一限制,我们在高度和宽度维度上结合了二维旋转位置嵌入(RoPE)(J. Su 等人,2023),这改善了在高分辨率图像中精细位置信息的表示。这两种位置嵌入方法共同作用,为我们的模型编码空间信息,并无缝集成到展平和打包过程中。这种集成使 MoonViT 能够在同一批次中高效处理不同分辨率的图像。生成的连续图像特征随后被转发到 MLP 投影器,并最终到达 MoE 语言模型以进行后续训练阶段。

MLP 投影器 我们使用两层 MLP 来连接视觉编码器(MoonViT)和 LLM。具体而言,我们首先使用像素洗牌操作压缩由 MoonViT 提取的图像特征的空间维度,在空间域执行 2 × 2 2 \times 2 2×2 下采样,并相应扩展通道维度。然后我们将像素洗牌后的特征送入两层 MLP,将其投影到 LLM 嵌入的维度。

专家混合(MoE)语言模型 Kimi-VL 的语言模型使用我们的 Moonlight 模型(J. Liu 等人,2025a),这是一种 MoE 语言模型,具有 2.8B 激活参数、16B 总参数,架构类似于 DeepSeek-V3(DeepSeek-AI,A. Liu 等人,2025)。对于我们的实现,我们从 Moonlight 预训练阶段的一个中间检查点初始化——该检查点已处理了 5.2 T 纯文本数据并激活了 8192-token (8K) 上下文长度。然后我们继续使用总计 2.3 T tokens 的多模态和纯文本数据进行联合预训练,详见第 2.3 节。

2.2 Muon 优化器

我们使用增强版的 Muon 优化器(J. Liu 等人,2025b)进行模型优化。与原始 Muon 优化器(Jordan 等人,2024)相比,我们添加了权重衰减并仔细调整了每个参数的更新比例。此外,我们根据 ZeRO-1(Rajbhandari 等人,2020)优化策略开发了 Muon 的分布式实现,从而在保持算法数学特性的前提下实现了最佳内存效率和减少通信开销。在整个训练过程中,这个增强版的 Muon 优化器用于优化所有模型参数,包括视觉编码器、投影器和语言模型。

2.3 预训练阶段

如图4和表1所示,在加载上述中间语言模型之后,Kimi-VL的预训练包括总共4个阶段,总体消耗4.4 T tokens:首先,独立的ViT训练以建立一个健壮的原生分辨率视觉编码器,然后是三个联合训练阶段(预训练、冷却和长上下文激活),同时增强模型的语言和多模态能力。详情如下。

ViT 训练阶段 MoonViT 在图像-文本对上进行训练,其中文本部分包括多种目标:图像替代文本、合成标题、定位边界框和 OCR 文本。训练包含两个目标:SigLIP(Zhai et al. 2023)损失 L siglip  \mathcal{L}_{\text {siglip }} Lsiglip (对比损失的一种变体)和条件于输入图像的标题生成交叉熵损失 L caption  \mathcal{L}_{\text {caption }} Lcaption 。按照 CoCa 的方法(J. Yu et al. 2022),最终的损失函数被制定为 L = L siglip  + λ L caption  \mathcal{L}=\mathcal{L}_{\text {siglip }}+\lambda \mathcal{L}_{\text {caption }} L=Lsiglip +λLcaption ,其中 λ = 2 \lambda=2 λ=2。具体来说,图像和文本编码器计算对比损失,而文本解码器则在图像编码器的特征条件下进行下一词预测(NTP)。为了加速训练,我们初始化了两个编码器的 SigLIP SO-400M(Zhai et al. 2023)权重,并实施了渐进分辨率采样策略,逐步允许更大的尺寸;文本解码器从一个小的只解码语言模型初始化。在训练期间,我们观察到随着 OCR 的扩大,标题损失出现了上升。
表1:训练阶段概述:数据组成、令牌数量、序列长度和可训练组件。

阶段ViT 训练联合预训练联合冷却联合长上下文
数据替代文本+++
合成标题文本,知识高质量文本长文本
定位长视频
OCR视频,代理长文档
令牌 2   T + 0.1   T 2 \mathrm{~T}+0.1 \mathrm{~T} 2 T+0.1 T1.4 T0.6 T0.3 T
序列长度81928192819232768->131072
训练ViTViT & LLMViT & LLMViT & LLM

表2:针 haystack 测试中的 Needle-in-a-Haystack(NIAH)测试,其中针均匀分布在 haystack 的各个位置。我们报告不同 haystack 长度下的召回精度,最高可达 131,072 tokens(128K)。

Haystack 长度 ( 0 , 2048 ] (0,2048] (0,2048] ( 2048 , 4096 ] (2048,4096] (2048,4096] ( 4096 , 8192 ] (4096,8192] (4096,8192] ( 8192 , 16384 ] (8192,16384] (8192,16384] ( 16384 , 32768 ] (16384,32768] (16384,32768] ( 32768 , 65536 ] (32768,65536] (32768,65536] ( 65536 , 131072 ] (65536,131072] (65536,131072]
- 文本 haystack100.0100.0100.0100.0100.0100.087.0
- 视频 haystack100.0100.0100.0100.0100.0100.091.7

数据,表明文本解码器已经发展出了一些OCR能力。在使用2T tokens的CoCa-like阶段训练完ViT后,我们再使用另外0.1T tokens将MoonViT与MoE语言模型对齐,在此过程中仅更新MoonViT和MLP投影器。这一对齐阶段显著降低了MoonViT嵌入在语言模型中的初始困惑度,使得接下来的联合预训练阶段更加平稳。

联合预训练阶段 在联合预训练阶段,我们使用纯文本数据(从与初始语言模型相同的分布中采样)和多种多模态数据(如第3.1节所述)组合训练模型。我们从加载的LLM检查点继续训练,使用相同的 学习率调度器,额外消耗1.4T tokens。初始步骤仅使用语言数据,之后多模态数据的比例逐渐增加。通过这种渐进的方法和之前的对齐阶段,我们观察到联合预训练保留了模型的语言能力,同时成功集成了视觉理解能力。

联合冷却阶段 预训练阶段之后的阶段是一个多模态冷却阶段,在此阶段中,模型继续使用高质量的语言和多模态数据集进行训练,以确保卓越的性能。对于语言部分,通过经验调查,我们观察到冷却阶段中加入合成数据会带来显著的性能提升,尤其是在数学推理、知识型任务和代码生成方面。冷却数据集的一般文本成分来自预训练语料库的高保真子集。对于数学、知识和代码领域,我们采用了一种混合方法:利用选定的预训练子集,并通过专有语言模型生成合成内容,实施拒绝抽样技术以维持质量标准(Yue, Qu, et al. 2023; D. Su et al. 2024)。这些合成的问答对在经过全面验证后才被纳入冷却数据集中。对于多模态部分,除了文本冷却数据准备中使用的两种策略,即问答合成和高质量子集重放,为了允许更全面的视觉中心感知和理解(B. Li et al. 2024; Tong et al. 2024; J. Guo et al. 2024),我们将各种学术视觉或视觉-语言数据源过滤并改写为问答对。与后期训练阶段不同,这些语言和多模态问答对在冷却阶段中仅用于激活特定能力,从而促进学习高质量数据,因此我们保持它们的比例较低,以避免过度拟合这些问答模式。联合冷却阶段显著提升了模型的语言和多模态能力。

联合长上下文激活阶段 在最后一个预训练阶段,我们将模型的上下文长度从8192(8K)扩展到131072(128K),其RoPE(J. Su et al. 2023)嵌入的逆频率从50,000重置为800,000 。联合长上下文阶段分为两个子阶段进行,每个子阶段都将模型的上下文长度扩展四倍。对于数据组成,我们在每个子阶段中将长数据的比例滤波并上采样至25%,同时使用剩余的75% tokens重播前一阶段的较短数据;我们的探索确认这种组成允许模型有效地学习长上下文理解,同时保持短上下文能力。
img-4.jpeg

图5:Kimi-VL和Kimi-VL-Thinking的后期训练阶段,包括32K和128K上下文的两个联合SFT阶段,以及进一步的长CoT SFT和RL阶段以激活和增强长思考能力。

为了让模型在纯文本和多模态输入上都能激活长上下文能力,Kimi-VL的长上下文激活所使用的长数据不仅包括长文本,还包括长多模态数据,如长交错数据、长视频和长文档。类似于冷却数据,我们也合成了一小部分问答对以增强长上下文激活的学习效率。经过长上下文激活后,模型可以通过针海(NIAH)评估,无论是长纯文本还是长视频haystack,都证明了其多样的长上下文能力。我们在表2中提供了上下文长度范围最多达到128K的NIAH召回准确率。

2.4 后期训练阶段

联合监督微调(SFT) 在这一阶段,我们通过对Kimi-VL的基础模型进行指令微调来增强其遵循指令和参与对话的能力,最终创建出互动式的Kimi-VL模型。这是通过使用ChatML格式(Openai,2024)实现的,它允许有针对性的指令优化,同时保持与Kimi-VL架构的一致性。我们使用纯文本和视觉语言SFT数据的混合来优化语言模型、MLP投影器和视觉编码器,将在第3.2节中描述。监督仅应用于答案和特殊标记,系统和用户提示被屏蔽。模型暴露于精心挑选的多模态指令-响应对集合中,通过格式感知打包确保明确的对话角色标记、视觉嵌入的结构化注入和跨模态位置关系的保存。此外,为了确保模型在对话中的全面熟练度,我们结合了Moonlight中使用的多模态数据和纯文本对话数据,确保其在各种对话场景中的多样性。

我们首先在32k token的序列长度下训练模型一个epoch,然后在128k token的序列长度下再训练一个epoch。在第一阶段(32K)中,学习率从 2 × 1 0 − 5 2 \times 10^{-5} 2×105降至 2 × 1 0 − 6 2 \times 10^{-6} 2×106,然后在第二阶段(128K)重新升温至 1 × 1 0 − 5 1 \times 10^{-5} 1×105,最后降至 1 × 1 0 − 6 1 \times 10^{-6} 1×106。为了提高训练效率,我们将多个训练样本打包到每个单一训练序列中。

长时间链式思维监督微调 通过改进的RL提示集,我们采用提示工程构建了一个小型但高质量的长时间链式思维热身数据集,其中包含经准确验证的文本和图像输入的推理路径。这种方法类似于拒绝抽样(RS),但专注于通过提示工程生成长时间链式思维推理路径。由此产生的热身数据集旨在封装人类类推理的关键认知过程,如规划(模型在执行前系统地列出步骤)、评估(对中间步骤进行批判性评估)、反思(重新考虑和改进方法)和探索(鼓励考虑替代解决方案)。通过对这个热身数据集进行轻量级SFT,我们有效地引导模型内化这些多模态推理策略。结果,经过微调的长时间链式思维模型在生成更详细且逻辑连贯的响应方面表现出更强的能力,增强了其在各种推理任务中的表现。

强化学习 为进一步提升模型的推理能力,我们还通过强化学习(RL)训练模型,使其能够自主生成结构化的链式思维(CoT)理由。具体而言,类似于Kimi k1.5(K. Team等,2025),我们采用在线策略镜像下降的变体作为RL算法,迭代改进策略模型 π θ \pi_{\theta} πθ以提高其解决问题的准确性。在第 i i i次训练迭代中,我们将当前模型视为参考策略模型,并优化以下目标,通过相对熵正则化以稳定策略更新:

max ⁡ θ E ( x , y ∗ ) ∼ D [ E ( y , x ) ∼ π θ [ r ( x , y , y ∗ ) ] − τ K L ( π θ ( x ) ∣ ∣ π θ i ( x ) ) ] \max _{\theta} \mathbb{E}_{\left(x, y^{*}\right) \sim \mathcal{D}}\left[\mathbb{E}_{(y, x) \sim \pi_{\theta}}\left[r\left(x, y, y^{*}\right)\right]-\tau \mathrm{KL}\left(\pi_{\theta}(x) \mid \mid \pi_{\theta_{i}}(x)\right)\right] θmaxE(x,y)D[E(y,x)πθ[r(x,y,y)]τKL(πθ(x)∣∣πθi(x))]

其中 r r r是一个奖励模型,用于证明给定问题 x x x的建议答案 y y y的正确性,根据真实标签 y ∗ y^{*} y为其分配一个值 r ( x , y , y ∗ ) ∈ { 0 , 1 } r\left(x, y, y^{*}\right) \in\{0,1\} r(x,y,y){0,1},而 τ > 0 \tau>0 τ>0是一个控制正则化程度的参数。
每次训练迭代开始时,从数据集 D \mathcal{D} D中采样一个问题批次,使用从(1)推导出的策略梯度将模型参数更新为 θ i + 1 \theta_{i+1} θi+1,随后优化的策略模型在下一个迭代中充当参考策略。为了提高RL训练效率,我们实施了基于长度的奖励,以惩罚过长的回答,缓解模型生成冗余推理链的问题。此外,我们采用了课程抽样和优先抽样两种抽样策略,这些策略利用难度标签和每个实例的成功率,将训练努力集中在最有教育价值的例子上,从而优化学习轨迹并提高训练效率。
通过大规模强化学习训练,我们可以得出一个既能利用基本基于提示的CoT推理又能结合复杂计划增强的CoT方法的优势的模型。在推理过程中,该模型保持标准的自回归序列生成,消除了与需要并行计算的专用计划算法相关的部署复杂性。同时,该模型通过有效利用探索过的推理路径的历史作为上下文信息,发展出了重要的元推理能力,包括错误检测、回溯和迭代解决方案改进。通过从其完整推理追踪历史中进行内源性学习,该模型可以有效地将其计划搜索程序编码到其参数知识中。

2.5 基础设施

存储 我们使用来自云服务供应商的与S3(Amazon Web Services 2023)兼容的对象存储来存储我们的视觉文本数据。为了最小化数据准备和模型训练之间的时间,我们将视觉数据以原始格式存储,并开发了一个高效且灵活的数据加载系统。该系统提供以下几个关键优势:

  • 支持在训练过程中进行即时数据打乱、混合、标记化、损失掩蔽和打包,使我们能够根据需要调整数据比例;

  • 启用视觉和文本数据的随机增强,同时在转换过程中保持二维坐标和方向信息的正确性;

  • 通过严格控制不同数据加载器工作线程的随机状态和其他状态,确保可重复性,保证任何中断的训练可以无缝恢复——恢复后的数据序列与未中断运行的序列相同;

  • 提供高性能数据加载:通过多种缓存策略,我们的系统可靠地支持大规模集群上的训练,同时控制对象存储的请求速率和吞吐量。
    此外,为了确保一致的数据集质量控制,我们开发了一个集中平台用于数据注册、可视化、编译统计信息、同步跨云存储系统的数据以及管理数据集生命周期。
    并行性 我们采用4D并行策略——数据并行(S. Li等,2020)、专家并行(Fedus等,2022)、管道并行(Y. Huang等,2019;Narayanan等,2021)和上下文并行(Jacobs等,2023;H. Liu等,2023)——以加速Kimi-VL的速度。在优化并行策略后,我们模型的训练吞吐量比7B稠密VLM(例如基于Qwen2.5-7B的VLM)高出约60%。

  • 数据并行(DP)。DP在多个设备上复制模型,每个设备处理不同的微批。这种设置通过简单增加设备数量即可实现更大的有效批量大小。

  • 专家并行(EP)。EP将MoE层中的专家模块分布在多个设备上。当与DP结合时,特定设备上的专家可以处理来自不同DP组的token,从而提高计算效率。

  • 管道并行(PP)。PP将模型分成多个基于层的阶段。为了最小化管道气泡,我们将视觉塔(VT)和一些解码层分配到第一阶段,将输出层和附加解码层放置在最后一阶段,并根据时间开销将剩余解码层均匀分布在中间阶段。

  • 上下文并行(CP)。CP通过将序列拆分到不同的CP等级并与flash attention(Dao等,2022)结合来解决长序列训练问题。这大大减少了峰值内存使用量,并减轻了注意力计算带来的内存压力。

除了这四种并行策略外,我们还结合了ZeRO1(Rajbhandari等,2020)和选择性检查点激活(T. Chen等,2016;Korthikanti等,2022)以进一步优化内存使用。ZeRO1通过使用分布式优化器减少优化器状态开销,同时避免额外的通信成本。选择性检查点激活通过重新计算时间开销低但内存消耗高的那些层来换取空间,从而在计算效率和内存需求之间取得平衡。对于极长序列,我们将重新计算扩展到更广的层集以防止内存溢出错误。
img-5.jpeg

图6:手稿推理可视化。Kimi-VL-Thinking通过逐步分析手写手稿展示其进行历史和科学推理的能力。在此示例中,我们的模型基于笔迹风格、内容分析和语言线索识别作者为阿尔伯特·爱因斯坦。它推理这些手稿与引力场方程有关,这与爱因斯坦对广义相对论的贡献一致。

3 数据构建

3.1 预训练数据

我们的多模态预训练语料库旨在提供高质量的数据,使模型能够处理和理解来自多种模态的信息,包括文本、图像和视频。为此,我们从六个类别——标题、交错、OCR、知识、视频和代理——收集了高质量的数据来形成语料库。

在构建我们的训练语料库时,我们开发了几条多模态数据处理流水线以确保数据质量,涵盖过滤、合成和去重。在视觉和语言的联合训练中,建立有效的多模态数据策略至关重要,因为它既保留了语言模型的能力,又促进了跨多种模态的知识对齐。

我们在本节中详细描述这些来源,按以下类别组织:

标题数据 我们的标题数据为模型提供了基本的模态对齐和广泛的世界知识。通过纳入标题数据,多模态LLM获得了更广泛的世界知识,并具有较高的学习效率。我们整合了各种开源中文和英文标题数据集(如Schuhmann等人,2022;Gadre等人,2024),还从多个来源收集了大量内部标题数据。然而,在整个训练过程中,我们严格限制合成标题数据的比例,以降低由于现实世界知识不足而产生幻觉的风险。

对于一般标题数据,我们遵循严格的质控流程,避免重复并保持高图像-文本相关性。我们还在预训练期间改变图像分辨率,以确保视觉塔在处理高分辨率和低分辨率图像时仍保持有效性。

图像-文本交错数据 在预训练阶段,模型从交错数据中受益匪浅。例如,多图像理解能力可以通过交错数据得到提升;交错数据始终为给定图像提供详细知识;通过交错数据还可以获得更长的多模态上下文学习能力。此外,我们还发现交错数据有助于维持模型的语言能力。因此,图像-文本交错数据是我们训练语料库的重要组成部分。我们的多模态语料库考虑了开源交错数据集(如Zhu等人,2024;Laurençon等人,2024),并使用教科书、网页和教程等资源构建了大规模的内部数据。此外,我们还发现合成交错数据有助于保持文本知识,从而提升多模态LLM的性能。为了确保每张图像的知识得到充分研究,对于所有交错数据,除了标准的过滤、去重和其他质控流程外,我们还整合了一个数据重新排序程序,以确保所有图像和文本的正确顺序。
OCR 数据 光学字符识别(OCR)是一种广泛采用的技术,它可以将图像中的文本转换为可编辑格式。在我们的模型中,强大的OCR能力被认为是更好地使模型与人类价值观对齐的关键。因此,我们的OCR数据来源非常多样化,包括开源和内部数据集,涵盖了干净和增强的图像,跨越单页和多页输入。
除了公开可用的数据,我们还开发了大量的内部OCR数据集,覆盖多语言文本、密集文本布局、基于网络的内容和手写样本。此外,根据OCR 2.0(Wei et al. 2024)的原则,我们的模型还能够处理各种光学图像类型,包括图表、表格、几何图形、mermaid图和自然场景文本。我们应用了广泛的数据增强技术——如旋转、扭曲、颜色调整和噪声添加——以增强模型的鲁棒性。结果,我们的模型在OCR任务上达到了很高的熟练度。
除了单页OCR数据外,我们还收集并转换了大量内部多页OCR数据,以激活模型对现实世界长文档的理解。借助这些数据,我们的模型不仅可以准确地对单个图像进行OCR,还可以理解整篇学术论文或扫描书籍。
知识数据 多模态知识数据的概念类似于前面提到的文本预训练数据,只是在这里我们关注的是从多种来源汇编的全面的人类知识库,以进一步增强模型的能力。例如,我们数据集中的精心策划的几何数据对于发展视觉推理技能至关重要,确保模型能够解释人类创造的抽象图表。
我们的知识语料库遵循标准化分类法,以平衡各类别的内容,确保数据来源的多样性。类似于仅限文本的语料库,它从教科书、研究论文和其他学术材料中收集知识,多模态知识数据采用布局解析器和OCR模型来处理这些来源的内容。同时,我们还包括了从互联网和其他外部资源中筛选的数据。
由于我们知识语料库的很大一部分来源于互联网材料,信息图表可能会导致模型仅专注于基于OCR的信息。在这种情况下,仅仅依靠基本的OCR管道可能会限制训练效果。为了解决这个问题,我们开发了额外的管道,以更好地捕捉图像中嵌入的纯文本信息。
代理数据 对于代理任务,模型的接地和规划能力得到了显著增强。除了利用公开可用的数据,还建立了一个平台,以高效管理和执行批量虚拟机环境。在这些虚拟环境中,采用启发式方法收集屏幕截图和相应的动作数据。这些数据随后被处理成密集接地格式和连续轨迹格式。Action Space的设计根据桌面、移动和Web环境进行了分类。此外,还收集了图标数据,以加强模型对软件图形用户界面(GUIs)中图标含义的理解。为了增强模型在解决多步桌面任务中的规划能力,从人工标注员那里收集了一套计算机使用轨迹,每个轨迹都附有合成的Chain-of-Thought(Aguvis ??)。这些多步代理演示使Kimi-Flash具备了完成现实世界桌面任务(在Ubuntu和Windows上)的能力。
视频数据 除了仅限图像和图像-文本交错数据外,我们在预训练、冷却和长上下文激活阶段还结合了大规模的视频数据,以实现我们模型两个关键能力的方向:首先,理解以图像为主导的长上下文序列(例如长达数小时的视频)以及长文本;其次,在短视频剪辑中感知精细的时空对应关系。
我们的视频数据来自多种资源,包括开源数据集以及内部网络规模的视频数据,并涵盖各种时长的视频。同样,为了确保足够的泛化能力,我们的视频数据涵盖了广泛的场景和多样化任务。我们涵盖了视频描述和视频接地等任务。对于长视频,我们精心设计了一条管道以生成密集的字幕。与处理字幕数据类似,我们严格限制合成密集视频描述数据的比例,以减少幻觉风险。
文本数据 我们的文本预训练语料库直接利用了Moonlight J. Liu等人的2025a中的数据,该数据旨在为训练大语言模型(LLMs)提供全面和高质量的数据。它涵盖了五个领域:英语、中文、代码、数学与推理、知识。我们为每个领域采用复杂的过滤和质量控制机制,以确保最高质量的训练数据。对于所有预训练数据,我们进行了
针对每个数据源的严格单独验证,以评估其对整体训练配方的具体贡献。这种系统评估确保了我们多样化数据组合的质量和有效性。为了优化我们训练语料库的整体构成,通过广泛的实验经验确定了不同类型文档的采样策略。我们进行孤立评估以识别对模型知识获取能力贡献最大的文档子集。这些高价值子集在最终训练语料库中被上采样。然而,为了保持数据多样性并确保模型泛化能力,我们小心地在适当比例下保留其他文档类型的平衡表示。这种数据驱动的方法帮助我们优化了聚焦知识获取与广泛泛化能力之间的权衡。

基准(电影)GPT-4oGPT-
40-mini
Qwen2.5-
VL-7B
Llama3.2-
11B-Inst.
Gemma3-
12B-IT
DeepSeek-
VL2
Kimi-VL-
A3B
架构--密集密集密集MoEMoE
激活参数数(LLM+VT)--7.6B+0.7B8B+2.6B12B+0.4B4.1B+0.4B2.8B+0.4B
总参数数--8B11B12B28B16B
大学水平MMMU ${ }_大学水平MMMU val {}_{\text{val}} val(Pass@1)69.160.058.64859.6
VideoMMMU(Pass@1)61MMU(Pass@1)61.2-47.441.857.244.4
MMVU val {}_{\text{val}} val(Pass@1)67.461.650.144.457.052.152.2
通用MMBench-EN-v1.1(Acc)83.177.182.665.874.679.683.1
MMStar(Acc)64.754.863.949.856.155.561.3
MMVet(Pass@1)69.166.967.157.664.960.066.7
RealWorldQA(Acc)75.467.168.563.359.168.468.1
AI2D(Acc)84.677.883.977.378.181.484.9
多图像BLINK(Acc)68.053.656.439.850.3-57.3
数学MathVista(Pass@1)63.852.568.247.756.162.868.7
MathVision(Pass@1)30.4-25.113.632.117.321.4
OCRInfoVQA(Acc)80.757.982.634.643.878.183.2
OCRBench(Acc)815785864753702811867
操作系统代理ScreenSpot-V2(Acc)18.1-86.8---92.8
ScreenSpot-Pro(Acc)0.8-29.0---34.5
OSWorld(Pass@1)5.03-2.5---8.22
WindowsAgentArena(Pass@1)9.42.73.4---10.4
长文档MMLongBench-Doc(Acc)42.829.029.613.821.3-35.1
长视频Video-MME(无字幕/有字幕)71.9/77.264.8/68.965.1/71.646.0/49.558.2/62.1-67.8/72.6
MLVU MCQ {}_{\text{MCQ}} MCQ(Acc)64.648.170.244.452.3-74.2
LongVideoBench val {}_{\text{val}} val66.758.256.045.551.5-64.5
视频感知EgoSchema full {}_{\text{full}} full72.2-65.054.356.938.578.5
VSI-Bench34.0-34.220.632.421.737.4
TOMATO37.728.827.621.528.627.231.7

表3:Kimi-VL与专有和开源高效VLM的性能对比;GPT-4o的性能也以灰色列出供参考。顶部和第二好的模型分别用粗体和下划线表示。由于某些任务或模型上下文长度限制,部分竞争模型的结果不可用。

1

图7:Kimi-VL通过将视觉内容与空间、上下文和文化知识相结合,表现出强大的视觉推理能力。它能够准确识别基于结构和布局特征匹配的城市位置,利用风格线索解释《赛博朋克2077》等电子游戏中的场景,并识别现实世界地标如多伦多的罗杰斯中心。

3.2 指令数据

在此阶段,数据主要旨在增强模型的对话能力和指令遵循能力。为了涵盖尽可能多的情景,我们在不同领域丰富了数据。对于非推理任务,包括图表解释、代理接地、OCR、基于图像的对话、问答、写作和文本处理,我们最初通过人工标注构建了一个种子数据集。这个种子数据集用于训练一个种子模型。随后,我们收集了一系列多样化的提示,并利用种子模型对每个提示生成多个响应。注释者随后对这些响应进行排名,并完善排名最高的响应以生成最终版本。对于需要推理的任务,如视觉编码、视觉推理和数学/科学问题,规则基础和模型基础验证比人类判断更准确和高效,因此我们利用拒绝抽样来扩展SFT数据集。完整的原始SFT数据集大约包含文本令牌和图像令牌1:1的比例。

3.3 推理数据

我们的推理数据经过精心构建,旨在激活和增强模型在长时间链式思维监督微调和强化学习阶段的多模态推理能力。通过开发类似于拒绝抽样的生成管道和提示工程,我们收集并合成了大量的高质量长时间链式思维数据。具体来说,我们首先收集了一组需要多步推理的真实标注问答数据,例如数学问题解决和特定领域的视觉问答。随后,我们利用强大的长时间链式思维模型——
img-7.jpeg

图8:Kimi-VL通过逐步解决一个圆几何问题展示了其执行符号推理和几何推断的能力。该模型分析给定条件,应用几何定理如圆周角定理和三角形角度属性,并准确推导出目标角度。

Kimi k1.5(K. Team et al. 2025),结合精心策划的推理提示,为每个问题采样多个详细的推理轨迹。在拒绝抽样中,我们将真实标签和模型预测输入到现成的奖励模型中进行评估。根据模型评估以及一些基于规则的奖励过滤掉错误的思路响应,从而提高推理数据的质量。

4 评估

我们首先介绍我们的综合模型,并与领先的最先进(SoTA)解决方案进行比较分析。在这一介绍之后,我们通过详细性能评估来评估模型的各种子能力。此部分考察模型处理不同类型任务和场景的有效性,提供对其在不同功能领域中的优势和局限性的见解。

4.1 与最先进模型的比较

表3对Kimi-VL与最先进的视觉语言模型在多个基准测试中的表现进行了全面评估。尽管Kimi-VL具有更高效的参数架构(2.8B+0.4B激活参数),相较于更大的模型如GPT-4o、Llama-3.2-11B-Inst.和Gemma3-12B-IT,但在几个关键领域表现出相当甚至更优的性能。我们的模型采用了类似于DeepSeek-VL2的专家混合(MoE)架构,但在大多数基准测试中以显著较少的参数(激活:2.8B vs 4.5B;总:16B vs 28B)胜过它;在24个基准测试中的19个上超越Qwen2.5-VL-7B(实际为8.3B),尽管后者激活参数数量是前者的2.59倍。以下章节分析了各具体领域的表现,揭示了Kimi-VL在OCR、数学、代理、长篇内容理解、多图像和视频感知方面的优势。

4.1.1 大学水平学术问题

我们的Kimi-VL模型在大学水平学术基准测试中表现出竞争力。在MMMU验证集中,它取得了57.0%的分数,超过了DeepSeek-VL2(51.1%),并与Qwen2.5-
img-8.jpeg

图9:多样化OCR可视化。Kimi-VL在各种内容类型中展现出强大的OCR能力,包括结构化财务表格、复杂数学公式和手写中文文本。该模型准确地将表格数据解析为markdown格式,将公式转换为LaTeX,并通过上下文理解转录音频段落,展示了其在多模态文本提取和解释方面的多功能性。

VL-7B(58.6%)和Gemma-3-12B-IT(59.6%)相当,尽管其激活参数显著较少。在视频大学水平问题上,它显著优于Qwen2.5-VL-7B和DeepSeek-VL2,仅落后于>10B Gemma-3-12B-IT,表明其相比更大模型具备合理的大学水平理解能力。这些结果表明Kimi-VL有效地平衡了参数效率与学术推理能力。

4.1.2 通用视觉能力

Kimi-VL在多个基准测试中展现了强大的通用视觉理解能力。在MMBench-EN-v1.1上,它达到了83.1%的准确性,超过所有对比的高效VLM,并与GPT-40持平。对于AI2D,我们的模型达到了84.9%,超过了所有对比模型,包括GPT-40(84.6%)。在MMVet上,Kimi-VL得分66.7%,与Qwen2.5-VL-7B(67.1%)和GPT-40-mini(66.9%)不相上下。对于RealWorldQA,它达到了68.1%,超过了Gemma3-12B(59.1%),接近Qwen2.5-VL-7B(68.5%)。这些结果表明,尽管架构紧凑,我们的模型仍保持了稳健的通用视觉理解能力。
在多图像推理任务中,Kimi-VL表现出色,在BLINK基准测试中得分为57.3%。这一表现超过了Qwen2.5-VL-7B(56.4%)、GPT-40-mini(53.6%)、Gemma3-12B-IT(50.3%)和Llama3.2-11B-Inst.(39.8%)。跨多个图像进行推理需要理解视觉元素之间的空间和时间关系,我们的模型以比大多数竞争对手更少的参数有效处理了这一点。

4.1.3 数学推理

尽管规模相对较小,Kimi-VL在数学推理方面也表现出强大的能力,特别是在MathVista基准测试中,它达到了68.7%,超过了所有对比模型,包括GPT-40(63.8%)和Qwen2.5-VL-7B(68.2%)。这表明我们的模型在理解和解决视觉背景下的数学问题方面具有卓越的能力。在更具挑战性的MathVision基准测试中,由于激活参数有限,
img-9.jpeg

步骤5
img-10.jpeg

步骤4
img-11.jpeg

步骤6
img-12.jpeg

步骤7
img-13.jpeg

步骤10
img-14.jpeg

步骤11
img-15.jpeg

步骤12
img-16.jpeg

图10:Kimi-VL能够通过多步推理过程完成复杂的GUI任务。在此示例中,它成功启用了Chrome浏览器中的“不要跟踪”功能,以增强在线隐私。代理解释每个屏幕,识别相关的UI元素,并按顺序执行适当的动作,思路清晰、动作明确且API调用明确。
img-17.jpeg

图11:视频场景分割。Kimi-VL通过将长视频分割为连贯场景并提供详细的起始/结束时间戳以及每个场景的细粒度自然语言描述来处理长视频。 † { }^{\dagger}

Kimi-VL在DeepSeek-VL2和Llama-3.2-11B-Inst.上表现出色,但在Qwen2.5-VL-7B和Gemma-12B-IT上稍逊一筹。然而,通过RL和测试时扩展,Kimi-VL-Thinking已显著改进,并已与30B级VLM持平(见表4)。这些结果突显了我们模型在结合视觉感知与数学问题解决方面的有效性,这是实际应用中的关键能力。

4.1.4 文档理解和OCR

Kimi-VL在所有此类基准测试中的文档理解和OCR任务中表现出色。在InfoVQA上,它实现了83.2%的准确率,超过了GPT-4o(80.7%)和DeepSeek-VL2(78.1%)。对于OCRBench,我们的模型得分为86.7%,超过了所有其他模型,包括GPT-4o-mini(78.5%)和DeepSeek-VL2(81.1%)。这些结果表明,我们的模型在文本识别和文档理解方面具有卓越的能力,使其特别适合涉及文档处理和信息提取的应用程序。

1

指令

有一句古老的中国谚语:授人以鱼,一日之食;授人以渔,终身之用。在这个表述中,作者提出了进一步的要求。找出它然后详细解释。
img-18.jpeg

图12:从长达一小时的视频课程中捕捉和理解关键细节。Kimi-VL通过分析帧序列并提取概念进展,展示了其理解和解释说明性视频内容的能力。在此案例中,模型识别出传统谚语“授人以渔,终身之用”深化为更细致的想法:“教授他鱼的味道,让他感到饥饿。” 1 { }^{1} 1

4.1.5 代理接地和多轮代理交互

在基于代理的任务中,Kimi-VL表现出显著的性能。在单步接地任务中,我们的模型表现出强准确性,在ScreenSpot-V2上达到92.0%,在极其困难的ScreenSpot-Pro(在4K屏幕上)上达到34.5%,证明了其强代理接地能力。更重要的是,它还表现出强多步代理交互能力:对于OSWorld,Kimi-VL达到了8.22%,超过了GPT-4o(5.03%)和其他有能力的开源模型;在WindowsAgentArena上,我们的模型达到了10.4%,同样超过了GPT-4o(9.4%)和其他模型。这些结果突显了Kimi-VL在理解和与操作系统界面交互方面的卓越能力,表明其在自动化UI导航和任务执行应用中具有强大潜力。

4.1.6 长文档和长视频理解

Kimi-VL在长篇内容理解方面表现出竞争力。在MMLongBench-Doc上,这是一个具有高达100多页问题回答的具有挑战性的基准测试,它达到了34.7%,超过了GPT-4o-mini(29.0%)和Qwen2.5-VL-7B(29.6%),仅次于GPT-4o(42.8%)。对于长视频理解,在Video-MME上,我们的模型超过了所有高效的VLM,并在更公平的无字幕设置中领先,其中模型必须从视频帧中找到答案而不是从输入字幕中获取;在有字幕设置中,它也达到了
1

表4:Kimi-VL-Thinking在不同基准测试中与各种开源和专有模型的性能对比。评估的指标包括MathVista(迷你)、MMMU(验证)和MathVision(完整),结果以Pass@1表示。Kimi-VL-Thinking在大多数情况下优于非思考模型,展示了“思考”变体在不同领域和规模上的增强推理和处理能力。
img-19.jpeg

图13:在推理最大token长度扩展时,Kimi-VL-Thinking模型的测试时间准确性。
非凡的72.6%准确率。在MLVU的多项选择题子集中,Kimi-VL达到了令人印象深刻的74.2%分数,达到了最先进水平,超过了GPT-4o(64.6%)和Qwen2.5-VL-7B(70.2%)。对于LongVideoBench,它得分为64.5%,仅逊于GPT-4o(66.7%)。这些结果表明Kimi-VL具有强大的长篇PDF和视频理解能力。

4.1.7 自我中心和细粒度视频感知

Kimi-VL在更精细的视频感知任务中也表现出色。在EgoSchema完整集(隐藏测试集)上,它达到了78.5%,显著超过了GPT-4o(72.2%)、Qwen2.5-VL-7B(65.0%)。对于VSI-Bench,这是一个非常具有挑战性的基准测试,要求理解视频中多个对象的空间关系和对应关系,我们的模型得分37.4%,超过了GPT-4o(34.0%)和Qwen2.5-VL-7B(34.2%)。在TOMATO中,该基准测试检查了VLMs的细粒度时间感知能力,Kimi-VL达到了31.7%,超过了Qwen2.5-VL-7B(27.6%)和GPT-4o-Mini(28.8%)。这些结果表明我们的模型具有强大的动态视觉内容理解能力,能够在视频序列中跟踪对象并解释复杂动作,使其非常适合需要时间视觉理解的应用。

4.2 Kimi-VL的推理扩展

此外,我们进行了一项推理扩展,以赋予Kimi-VL进行CoT推理的能力,并通过长CoT激活和强化学习展示了一个长思考版本的模型Kimi-VL-Thinking。我们在几个图像基准测试中验证了其优越性能,如表4所示。
Kimi-VL-Thinking在基础Kimi-VL模型上显著改进,在MathVista上提高了2.6%,在MMMU上提高了4.7%,在MathVision上提高了15.4%,展示了其利用测试时间计算进行更深层次推理和更好地处理复杂多模态查询的能力。在表4中,Kimi-VL-Thinking进一步超过了或与最先进的思考和非思考模型相当:在MathVista上达到了71.3%,超过了GPT-4o(63.8%)和GPT-4o-mini(56.7%);在MMMU上得分61.7%,超过了GPT-4o-mini(60.0%)和Qwen2.5-VL-7B(58.6%);在MathVision上达到了36.8%,超过了GPT-4o(30.4%)和Gemma-3-27B-IT(35.5%),甚至QVQ-72B(35.9%)。尽管在某些基准测试上略逊于一些更大规模的模型,Kimi-VL-Thinking仅用3B激活参数就达成了这些结果——比其同类产品少几个数量级——强调了其在多模态推理中的强大效率和有效性。
我们的Kimi-VL-Thinking模型还表现出强大的测试时间扩展特性,如图13所示。具体而言,在推理时间增加最大思考token长度时,所有三个基准测试的测试时间准确性都得到了一致的提升。例如,在MathVision上,准确性从1k token的18.7%稳步提升到16k token的36.8%,并且在MMMU上也观察到了类似的向上趋势,表明模型能够利用更长的推理链来获得更好的性能。然而,并非所有基准测试都能从更长的思考长度中同等受益。在MathVista上,性能早期饱和,准确性在4k token时达到70.9%,随着token长度增加到16k时没有观察到进一步的显著增益。这表明对于该任务,所需的推理深度已经在相对较短的上下文中被捕捉到,额外的计算并没有带来进一步的改进。

5 结论、局限性和未来工作

我们介绍了Kimi-VL,这是一种设计均衡的VLM,涵盖了多模态和纯文本预训练/后训练,由基于MoE的架构支持,以实现可扩展的效率。其128K扩展上下文窗口使长文本和视频中的精确检索成为可能,而原生分辨率编码器MoonViT有助于在超高分辨率视觉任务中保持高精度和低计算开销。此外,Kimi-VL-Thinking促进了在复杂图像和视频推理中的有效长链推理。总体而言,Kimi-VL在多模态、长上下文和高分辨率任务中表现出强大的适应性和效率,显示出未来研究和工业应用的巨大潜力。
然而,Kimi-VL仍然面临几个挑战:

  1. 尽管当前模型尺寸在许多标准任务中表现有效,但对于高度专业或特定领域的任务,或者强烈依赖语言能力的问题,它仍然过于有限,限制了Kimi-VL处理极其复杂场景的能力。
  2. 虽然推理能力在典型用例中已经很强,但尚未达到其理论上限,特别是对于需要多步推理或更深上下文理解的复杂任务。
  3. 尽管提供了128K扩展上下文窗口,但由于其注意力层的参数有限(仅相当于3B模型),其长上下文能力对于某些涉及极长序列或大量上下文信息的高级应用仍然不足。

在未来,我们将通过扩大模型尺寸、扩展预训练数据和增强后训练算法来应对这些挑战。下一步包括优化Kimi-VL并发布更大版本,以及改进后训练和测试时间扩展机制,以获得更好的思考模型。这些努力将为研究和工业中的更高级应用铺平道路。

模板

Amazon Web Services. Amazon Simple Storage Service (Amazon S3). Web. 可用地址:https://aws.amazon.com/s3/. 2023. URL: https://aws.amazon.com/s3/(访问日期:2023年12月15日)。
Bai, Shuai等人。Qwen2.5-VL 技术报告。2025. arXiv: 2502.13923 [cs.CV]。URL: https://arxiv.org/abs/2502.13923.
Bonatti, Rogerio等人。Windows Agent Arena:大规模评估多模态操作系统代理。2024. arXiv: 2409.08264 [cs.AI]。URL: https://arxiv.org/abs/2409.08264.
Chen, Lin等人。“我们是否正走在正确的大规模视觉语言模型评估道路上?” In: arXiv预印本arXiv:2403.20330 (2024).
Chen, Tianqi等人。以低于线性内存成本训练深层网络。2016. arXiv: 1604.06174 [cs.LG]。URL: https://arxiv.org/abs/1604.06174.
Cheng, Kanzhi等人。“Seeclick:利用GUI接地实现高级视觉GUI代理”。In: arXiv预印本arXiv:2401.10935 (2024).
Dao, Tri等人。FlashAttention:快速且内存高效的精确注意机制,具有IO意识。2022. arXiv: 2205.14135 [cs.LG]。URL: https://arxiv.org/abs/2205.14135.
DeepSeek-AI, Daya Guo等人。DeepSeek-R1:通过强化学习激励LLM的推理能力。2025. arXiv: 2501.12948 [cs.CL]。URL: https://arxiv.org/abs/2501.12948.

DeepSeek-AI, Aixin Liu等人。DeepSeek-V3技术报告。2025. arXiv: 2412.19437 [cs.CL]。URL: https://arxiv.org/abs/2412.19437.
Dehghani, Mostafa等人。Patch n’ Pack:NaViT,适用于任何宽高比和分辨率的视觉变压器。2023. arXiv: 2307.06304 [cs.CV]。URL: https://arxiv.org/abs/2307.06304.
Fedus, William, Barret Zoph, 和 Noam Shazeer。Switch Transformers:通过简单有效的稀疏性扩展到万亿参数模型。2022. arXiv: 2101.03961 [cs.LG]。URL: https://arxiv.org/abs/2101.03961.
Fu, Chaoyou等人。“Video-MME:视频分析中多模态LLM的第一个综合评估基准”。In: arXiv:2405.21075 (2024).
Fu, Xingyu等人。“Blink:多模态大语言模型能看但不能感知”。In: 欧洲计算机视觉会议。Springer。2024, pp. 148-166.
Gadre, Samir Yitzhak等人。“Datacomp:寻找下一代多模态数据集”。In: Advances in Neural Information Processing Systems 36 (2024).
Grauman, Kristen等人。“Ego4d:来自全球各地的3000小时自我中心视频”。In: IEEE/CVF计算机视觉与模式识别会议论文集。2022, pp. 18995-19012.
Guo, Jarvis等人。MAmmoTH-VL:通过大规模指令调整激发多模态推理。2024. arXiv: 2412.05237 [cs.CL]. URL: https://arxiv.org/abs/2412.05237.

Hu, Kairui等人。“Video-MMMU:评估从多学科专业视频中获取知识”。In: arXiv preprint arXiv:2501.13826 (2025).
Huang, Yanping等人。GPipe:使用管道并行性高效训练巨型神经网络。2019. arXiv: 1811.06965 [cs.CV]. URL: https://arxiv.org/abs/1811.06965.

Jacobs, Sam Ade等人。DeepSpeed Ulysses:系统优化以实现极端长序列Transformer模型的训练。2023. arXiv: 2309.14509 [cs.LG]. URL: https://arxiv.org/abs/2309.14509.
Jordan, Keller等人。Muon:一种用于神经网络隐藏层的优化器。2024. URL: https://kellerjordan.github.io/posts/muon/.
Kembhavi, Aniruddha等人。“一幅图抵得上十二幅图像”。In: 欧洲计算机视觉会议。Springer. 2016, pp. 235-251.
Korthikanti, Vijay等人。减少大型Transformer模型中的激活重计算。2022. arXiv: 2205.05198 [cs.LG]. URL: https://arxiv.org/abs/2205.05198.
Laurençon, Hugo等人。“Obelics:一个开放的网页规模过滤数据集,包含交错的图像-文本文档”。In: Advances in Neural Information Processing Systems 36 (2024).
Li, Bo等人。LLVA-OneVision:轻松的视觉任务转移。2024. arXiv: 2408.03326 [cs.CV]. URL: https://arxiv.org/abs/2408.03326.
Li, Dongxu等人。Aria:一个开放的多模态本地专家混合模型。2024. arXiv: 2410.05993 [cs.CV]. URL: https://arxiv.org/abs/2410.05993.
Li, Kaixin等人。“ScreenSpot-Pro:专业高分辨率计算机使用的GUI接地”。In: 大型语言模型推理与规划研讨会。2025.
Li, Shen等人。PyTorch Distributed:加速数据并行训练的经验。2020. arXiv: 2006.15704 [cs.DC]. URL: https://arxiv.org/abs/2006.15704.
Liu, Hao, Matei Zaharia, 和 Pieter Abbeel。块状Transformer的环形注意力以实现近乎无限上下文。2023. arXiv: 2310.01889 [cs.CL]. URL: https://arxiv.org/abs/2310.01889.

Liu, Jingyuan等人。“Muon适用于LLM训练”。In: arXiv preprint arXiv:2502.16982 (2025).

  • “Muon适用于LLM训练”。In: arXiv preprint arXiv:2502.16982 (2025).
    Liu, Yuan等人。“MMBench:你的多模态模型是否全能?” In: arXiv:2307.06281 (2023).
    Liu, Yuliang等人。“大型多模态模型中OCR的隐藏秘密”。In: arXiv e-prints (2023), arXiv-2305.
    Lu, Pan等人。“Mathvista:评估视觉背景下基础模型的数学推理能力”。In: arXiv preprint arXiv:2310.02255 (2023).
    Mangalam, Karttikeya, Raiymbek Akshulakov, 和 Jitendra Malik。“Egoschema:一个非常长形式视频语言理解的诊断基准”。In: Advances in Neural Information Processing Systems 36 (2023), pp. 46212-46244.
    Mathew, Minesh等人。“Infographicvqa”。In: IEEE/CVF Winter Conference on Applications of Computer Vision Proceedings. 2022, pp. 1697-1706.
    Narayanan, Deepak等人。使用Megatron-LM在GPU集群上高效训练大规模语言模型。2021. arXiv: 2104.04473 [cs.CL]. URL: https://arxiv.org/abs/2104.04473.
    OpenAI. “学习用LLM推理”。In: (2024). URL: https://openai.com/index/learning-to-reason-with-llms/.
    OpenAI等人。GPT-4o系统卡片。2024. arXiv: 2410.21276 [cs.CL]. URL: https://arxiv.org/abs/2410. 21276.

Rajbhandari, Samyam等人。“Zero:朝向训练万亿参数模型的内存优化”。In: SC20: International Conference for High Performance Computing, Networking, Storage and Analysis. IEEE. 2020, pp. 116 .
Schuhmann, Christoph等人。“Laion-5b:一个开放的大规模数据集,用于训练下一代图像-文本模型”。In: Advances in Neural Information Processing Systems 35 (2022), pp. 25278-25294.
Shangguan, Ziyao等人。“TOMATO:评估多模态基础模型的视觉时间推理能力”。In: International Conference on Learning Representations. 2025. URL: https://openreview.net/forum?id=fC14o83Mfs.
Su, Dan等人。“Nemotron-CC:将Common Crawl转化为精炼的长视野预训练数据集”。In: arXiv preprint arXiv:2412.02595 (2024).
Su, Jianlin等人。RoFormer:带有旋转位置嵌入的增强型Transformer。2023. arXiv: 2104.09864 [cs.CL]. URL: https://arxiv.org/abs/2104.09864.
Team, Gemini等人. Gemini 1.5: 解锁数百万上下文中的多模态理解. 2024. arXiv: 2403.05530 [cs.CL]. URL: https://arxiv.org/abs/2403.05530.

Team, Gemma等人. Gemma 3 技术报告. 2025. arXiv: 2503.19786 [cs.CL]. URL: https://arxiv.org/abs/2503.19786.
Team, Kimi等人. “Kimi k1.5: 使用LLM扩展强化学习”. In: arXiv preprint arXiv:2501.12599 (2025).
Tong, Shengbang等人. Cambrian-1: 全面开放的以视觉为中心的多模态LLM探索. 2024. arXiv: 2406.16860 [cs.CV]. URL: https://arxiv.org/abs/2406.16860.

Wang, Ke等人. “使用Math-Vision数据集测量多模态数学推理能力”. In: arXiv preprint arXiv:2402.14804 (2024).
Wei, Haoran等人. “通用OCR理论:通过统一端到端模型迈向OCR-2.0”. In: arXiv preprint arXiv:2409.01704 (2024).
Wu, Haoning等人. “LongVideoBench: 长上下文交错视频语言理解基准”. In: Advances in Neural Information Processing Systems 37 (2024), pp. 28828-28857.
Wu, Zhiyong等人. “OS-Atlas: 通用GUI代理的基础动作模型”. In: arXiv preprint arXiv:2410.23218 (2024).

Wu, Zhiyu等人. DeepSeek-VL2: 用于高级多模态理解的专家混合视觉语言模型. 2024. arXiv: 2412.10302 [cs.CV]. URL: https://arxiv.org/abs/2412.10302.
x.ai. “Grok-1.5 Vision Preview”. In: (2024). URL: https://x.ai/news/grok-1.5v.

Xie, Tianbao等人. “OSWorld: 在真实计算机环境中评估多模态代理进行开放式任务的基准”. In: Advances in Neural Information Processing Systems 37 (2024), pp. 52040-52094.
Yang, Jihan等人. “在空间中思考:多模态大语言模型如何看、记住和回忆空间”. In: arXiv preprint arXiv:2412.14171 (2024).
Yu, Jiahui等人. CoCa: 对比式标题生成器是图像-文本基础模型. 2022. arXiv: 2205.01917 [cs.CV]. URL: https://arxiv.org/abs/2205.01917.
Yu, Weihao等人. “MM-Vet: 评估大型多模态模型的集成能力”. In: International conference on machine learning. PMLR. 2024.
Yue, Xiang, Yuansheng Ni, 等人. “MMMU: 一个大规模多学科多模态理解和推理基准测试,面向专家AGI”. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024, pp. 9556-9567.
Yue, Xiang, Xingwei Qu, 等人. “Mammoth: 通过混合指令调整构建数学通才模型”. In: arXiv preprint arXiv:2309.05653 (2023).
Zhai, Xiaohua等人. Sigmoid Loss for Language Image Pre-Training. 2023. arXiv: 2303.15343 [cs.CV]. URL: https://arxiv.org/abs/2303.15343.
Zhao, Yilun等人. “MMVU: 衡量专家级多学科视频理解”. In: arXiv preprint arXiv:2501.12380 (2025).
Zhou, Junjie等人. “MLVU: 一个多任务长视频理解的综合基准”. In: arXiv preprint arXiv:2406.04264 (2024).
Zhu, Wanrong等人. “Multimodal C4: 一个开放的、十亿规模的图像与文本交错语料库”. In: Advances in Neural Information Processing Systems 36 (2024).

附录

A 贡献

核心贡献者李佳明
尹博鸿苏建林
邢博文王建洲
陈成邓佳琦*
韦楚邱杰忠
张德浩王东亮
唐昊宇*刘景元
杨浩田阎俊杰
卢昊宇*欧阳坤
杨皓陈良
隋林余龙辉
王新远*董梦凡
周鑫雨董梦楠
李洋徐诺
Charles*程鹏羽
包一鸣顾启正
陈一民周润杰
吴岳欣刘少威
周再嘉曹斯涵
黄志奇宋天会
杨志林白通通
陈子维何为然
宋伟
贡献者黄维潇
徐卫新
杜昂刚袁晓坤
屈晨翟兴城
王博文*袁星城
张辰霖座新星
杜晨庄胡洋洋
王聪聪钟燕
杜迪康陈彦茹
袁恩明苗义波
卢恩哲王也捷
李芳刘义博
Sung Flood秦一涛
魏光达王依琴
赖国昆康永胜
朱韩刘元鑫
丁昊杜雨伦
胡昊王玉芝
张昊王雨知
王恒蒋则军
高宏程张征
郑华斌赵自嘉
赵子嘉
林宗宇

1

B 评估细节

B. 1 图像基准

MMMU(Yue, Ni, et al. 2024)包含从大学考试、测验和教科书中精心策划收集的11.5K个多模态问题。这些问题涵盖了六个主要学术领域:艺术与设计、商业、科学、健康与医学、人文与社会科学以及技术和工程。
MMBench-EN-v1.1(刘元等,2023)是一个细粒度基准,包含2974个多项选择题,覆盖20个能力维度。它在其能力分类法中将感知和推理作为顶级能力维度,从而在各种能力维度上进行不同级别的评估。
MMStar(陈林等,2024)是一个精英视觉不可或缺的多模态基准,由人类精心挑选的1500个挑战样本组成。它旨在通过仔细平衡和净化样本选择来衡量LVLM的6个核心能力和18个详细轴的能力。
MMVet(于伟等,2024)基于这样的见解设计:解决复杂任务的有趣能力通常是通过一个通用模型能够整合不同的核心视觉-语言能力而实现的。它定义了6个核心VL能力,并检查了由能力组合派生出的16个感兴趣的整合。
RealWorldQA(x.ai 2024)是一个旨在评估多模态模型现实世界空间理解能力的基准。它评估模型对物理环境的理解程度。该基准包括超过700张图片,每张图片都附带一个问题和可验证的答案,这些图片来自各种现实场景。
AI2D(Kembhavi等,2016)是一个包含超过5000张小学科学图表的数据集,配有超过150000个丰富的注释、它们的真实语法解析以及超过15000个相应的多项选择题。
MathVision(K. Wang等,2024)是一个精心策划的集合,包含源自实际数学竞赛的3040个高质量数学问题,涵盖16个不同的数学学科,并按5个难度级别分级。该数据集提供了一套全面且多样化的挑战,非常适合评估LMMs的数学推理能力。
MathVista(P. Lu等,2023)是一个基准,它整合了来自多种数学和视觉任务的挑战,要求参与者展示精细的深度视觉理解和组合推理,以成功完成任务。
BLINK(X. Fu等,2024)是一个旨在评估多图像视觉认知的基准,涵盖深度关系、特征匹配、数字取证和时空推理等任务。它包含一组多样化的多图像感知相似性任务,并通过标准化协议进行了验证。
InfoVQA(Mathew等,2022)是一个专门设计的数据集,用于评估模型解释和推理结合文本、图形和视觉元素的复杂信息图的能力。该数据集的性能评估使用测试集上的ANLS指标。
OCRBench(刘昱良等,2023)评估了MLLMs在五个任务上的OCR能力:文本识别、场景文本VQA、文档VQA、关键信息提取和手写数学表达式识别。该基准满分为1000分。

B. 2 视频和长文档基准

VideoMMMU(K. Hu等,2025)是一个视频基准,旨在评估大型多模态模型的大学水平知识获取能力。它由300个专家级视频和900个人工标注的问题组成。这些视频涵盖了六个不同的学术学科:艺术、人文学科、医学、商业、科学和工程。问题结构与三个认知阶段相对应:感知、理解和适应。
MMVU(Y. Zhao等,2025)是一个视频基准,旨在评估专家级视频理解能力。该基准包含1529个视频上的3000个人工标注的问题,涵盖四个核心学科的27个主题:科学、医疗保健、人文学科和社会科学及工程。
Video-MME(C. Fu等,2024)是一个视频基准,包含手动选择的900个视频(总计254小时长度),以及2700个问答对。这些视频根据持续时间不同,被归类为六个不同领域的30个细粒度类别:知识、电影与电视、体育比赛、艺术表演、生活记录和多语言内容。评估在两种不同的设置下进行:有字幕和无字幕。
MLVU(J. Zhou等,2024)旨在从多个方面评估模型对长视频的理解能力。它由1730个视频及其对应的3102个问答对组成(开发集中有2593个,测试集中有509个)。这些视频来自多个场景,包括运动、自我中心、生活记录、教程等。MLVU的封闭式任务集包括7个不同任务:动作顺序、动作计数、主题推理、异常识别、情节问答、自我推理和针问答。
LongVideoBench(H. Wu等,2024)是一个视频问答基准,旨在评估大型多模态模型的长篇多模态感知和关系能力。该基准包括3763个网络收集的视频,涵盖各种时长和主题,以及相应的字幕。它包括6678个人工标注的多项选择题,分布在17个细粒度类别中,访问视频语言理解的不同方面。
EgoSchema(Mangalam等,2023)是一个视频基准,旨在评估自我中心情景下的长篇视频理解能力。该基准来源于Ego4D(Grauman等,2022),包含超过5031个多项选择题-答案对,跨越超过250小时的真实世界视频,采用半自动数据管道。
VSI-Bench(杨等,2024)旨在评估大型多模态模型的视觉空间综合能力。它包含约290个真实室内场景视频的5000多个问答对。
TOMATO(尚观等,2025)是一个视频基准,包含1484个人工标注的问答对和1417个视频。TOMATO专注于评估大型多模态模型的时间推理能力,包括动作计数、方向预测、旋转分析、形状与趋势检测、速度与频率估计和视觉线索解释。

B. 3 代理基准

ScreenSpot V2(Zhiyong Wu等,2024)是ScreenSpot(K. Cheng等,2024)基准的增强版本,重点评估跨多个平台(包括Web、桌面和移动界面)的GUI接地模型的性能。此更新版本解决了原始ScreenSpot数据集中发现的几个问题,如不正确或模糊的注释、拼写错误和标记错误的边界框。
ScreenSpot Pro(K. Li等,2025)是一个评估高分辨率、复杂UI环境中GUI接地的基准。它包含1581个真实世界的高分辨率图像和来自不同专业领域的专家注释任务。包括特定领域的接口约定,挑战模型理解专业级接口超越消费者应用。
OSWorld(T. Xie等,2024)是一个开创性的可扩展真实计算机环境,专为多模态代理设计,促进跨多个操作系统的任务设置、基于执行的评估和交互式学习。它作为一个统一平台,评估涉及任意应用程序的开放式计算机任务,解决了现有基准通常缺乏交互环境或局限于特定应用程序或领域的局限性。
WindowsAgentArena(Bonatti等,2024)是一个旨在评估多模态代理在真实Windows环境中的表现的基准。基于OSWorld框架构建,允许代理与一系列应用程序和网络工具进行交互。该基准具有可扩展性,可以在Azure上不到20分钟内完成评估。它提供了关于代理表现的见解,突显了未来代理开发和任务自动化研究的潜力。

参考论文:https://arxiv.org/pdf/2504.07491


    • 项目负责人。
      # 香港大学,Moonshot.ai
      作者列表按其名字首字母顺序排列。
    ↩︎ ↩︎ ↩︎ ↩︎
Logo

惟楚有才,于斯为盛。欢迎来到长沙!!! 茶颜悦色、臭豆腐、CSDN和你一个都不能少~

更多推荐