文章概括

引用:

@article{yang2025cambrian,
  title={Cambrian-S: Towards Spatial Supersensing in Video},
  author={Yang, Shusheng and Yang, Jihan and Huang, Pinzhi and Brown, Ellis and Yang, Zihao and Yu, Yue and Tong, Shengbang and Zheng, Zihan and Xu, Yifan and Wang, Muhan and others},
  journal={arXiv preprint arXiv:2511.04670},
  year={2025}
}
Yang, S., Yang, J., Huang, P., Brown, E., Yang, Z., Yu, Y., Tong, S., Zheng, Z., Xu, Y., Wang, M. and Lu, D., 2025. Cambrian-S: Towards Spatial Supersensing in Video. arXiv preprint arXiv:2511.04670.

主页: https://cambrian-mllm.github.io/
原文: https://arxiv.org/pdf/2511.04670
代码、数据和视频: https://github.com/cambrian-mllm/cambrian-s

系列文章:
请在 《 《 文章 》 》 专栏中查找



宇宙声明!


引用解析部分属于自我理解补充,如有错误可以评论讨论然后改正!



Appendix

本附录提供了主文所涉及的完整实现细节、实验结果以及补充性分析,用以支撑全文的主要结论:

• 第A节给出了在不同评测设定下,对视频MLLM基准进行诊断测试的详细结果。

• 第B节详细描述了VSI-SUPER基准,包括其实现细节、可视化示例,以及针对Recall与Count两类任务的流式评测设定。

• 第C节完整记录了VSI-590K数据集的相关信息,包括问题类型的分类体系、问答对构建流程、消融实验结果以及定性示例。

• 第D节详细介绍了Cambrian-S的模型架构、训练数据混合策略、四个训练阶段各自的配方,以及所采用的计算基础设施配置。

• 第E节展示了更多实验结果,包括具体的评测设定、不同模型规模在图像与视频基准上的表现、图像—视频数据贡献的消融分析,以及“空间感知能力”与“一般视频理解能力”之间权衡关系的分析。

• 第F节介绍了预测式感知相关组件,包括潜在帧预测的实现细节、用于VSI-SUPER Recall的记忆框架设计、用于VSI-SUPER Count的“agent式”框架设计,以及与现有长视频方法的对比。


A. 基准诊断测试结果

我们在表8中给出了图2所对应的详细结果。

在这里插入图片描述


B. VSI-SUPER 基准测试

B.1. VSI-SUPER Recall

实现细节。
为了构建该基准,我们首先使用来自 VSI-Bench 数据集 [148] 的视频。标注人员从视频中挑选片段,并使用 Gemini-2.0-Flash 从预先挑选的物体池中手动将一个“不寻常的物体”插入到四个不同的帧中,同时确保这些物体放置在视觉上合理的位置。对于每次插入,标注人员都会记录物体的空间位置及其出现顺序。接着,我们将这些经过编辑的片段与随机抽取的未编辑视频组合,生成时长为 10、30、60、120 和 240 分钟的最终视频。对于每个时长,我们制作 60 个视频,每个视频对应一个问题。我们将视频降采样为每秒 1 帧,以确保模型在推理时一定能看到被编辑过的帧。

可视化展示。
我们在图 18 中展示了经过编辑的 VSR 视频数据集中的示例帧。插入的物体在其位置上表现得视觉自然,这是我们高质量标注的直接结果。

B.2. VSI-SUPER Count

实现细节。
为了构建 VSI-SUPER Count,我们将来自 VSI-Bench [148] 的视频连接起来,并对它们的物体数量求和,形成新的真实标签。该过程需要两个额外的归一化步骤。首先,我们对不同源数据集(ScanNet [33]、ScanNet++ [153]、ARKitScenes [12])中的物体类别标签进行统一。其次,我们通过重新平衡问答对来消除数据中对小数量物体的偏置,使物体数量呈现更均匀的分布。最终基准包含时长为 10、30、60 和 120 分钟的视频,每个视频带有 50 个问题。与 VSR 不同,VSC 中的所有视频均被降采样至 24 FPS。

流式设置。
在流式设置中,我们在 10 个不同时间点上重复查询视频中物体的总数量。为了构建每个查询时间点的真实标签,我们需要确定视频中每个独特物体的首次出现时间。为了找到这些出现时间,我们采用 VSI-Bench [148] 中提出的方法。这使得我们可以直接计算任意时间点上的真实物体数量。

本节详细说明了 VSI-SUPER 两个子任务——Recall 与 Count——的构建过程。Recall
通过在真实房间视频中插入不寻常物体,测试模型是否能在长时视频中进行选择性的观察、记忆与回忆。Count
通过拼接多段室内扫描视频并重新平衡物体数量,测试模型在不断变化场景中持续累计并更新空间信息的能力。两者共同构成对空间
supersensing 的严格考验,强调模型必须能够跨房间、跨场景、跨长时间跨度地组织视觉信息,而不只是依赖语言先验或短期视觉提示。


C. VSI-590K 数据集

本节详细介绍 VSI-590K 数据集,包括问题类型定义、问答对构建流程,以及各数据来源的示例。

C.1. 问题类型定义的细节

分类体系。 在构建视觉-空间智能的监督微调数据集时,一个关键视角是如何定义问题类型。 受 VSI-Bench [148] 启发,我们以更系统化的方式扩展其任务定义。 如表 9 所示,我们从四个角度区分这些问题类型:
在这里插入图片描述

• Spatial-temporal attributes:
空间—时间属性: 我们将问题划分为五种不同的时空属性类型:大小(比较或测量物体/空间的尺度)、方向(在空间中的朝向)、数量(对物体进行计数)、距离(物体之间的接近程度)、以及出现顺序(视频中物体出现的时间先后顺序)。

• Relative versus absolute:
相对 vs. 绝对: 当问题涉及多个物体之间的比较(例如,“哪个更大?”)时,我们将其归类为相对问题;当问题需要具体的度量或数量(例如,“高度是多少米?”)时,则归类为绝对问题。这样的区分适用于大多数属性类型。

• Perspective taking:
视角设定: 这一维度刻画的是用哪种视角来评估空间关系。问题可以从摄像机的视角提出(例如,“从摄像机的视角看,这个物体在左边还是右边?”),也可以从场景中某个具体物体的视角提出(例如,“从物体2面向物体1时……”)。

• Modality:
模态: 我们根据问题是否仅凭静态图像就能回答,或者是否需要动态视频信息来对问题进行分类。有些属性类型(如出现顺序)只适用于视频,而像大小这样的属性,则可以在图像或视频这两种模态下进行提问。

另外,借鉴VSI-Bench,我们也根据问题在时空特性上的差异,将问题类型进一步划分为三大类(即:Configuration、Measurement 和 Spatiotemporal)。

C.2. 问答对构建流程的细节

下面介绍我们构建 VSI-590K 的具体流程。

3D 标注的真实视频。
对于这些 3D 标注的真实视频,我们遵循 Thinking in Space [148] 中已经建立的做法。我们首先检索所有同时包含三维实例级标注与视频或全景图像的公开数据集。在这些数据集中,我们提取包括物体数量、物体边界框以及房间尺寸测量在内的关键信息,并将它们统一转换为一个标准化的数据格式。随后,我们将这些结构化信息填入扩展后的问题模板中,从而构造出成对的问题—答案数据集。

3D 标注的模拟视频与图像。
对于具有丰富内置标注的模拟数据,我们采用与 3D 标注真实视频类似的处理流程。对于 ProcTHOR [36],我们的主要工作是生成包含随机放置智能体的三维场景,并据此渲染穿行视频。对于 Hypersim [113],该数据集提供的是图像级而非场景级的三维标注,我们使用其中的单幅图像及其对应的三维标注。在这两种情况下,我们都提取所需信息,将其转换为我们设计的统一格式,并按照处理 3D 标注真实视频相同的方式,将其填入扩展后的问题模板中。

未标注的网络抓取真实视频。
对于未标注的网络抓取真实视频,如算法 1 所示,我们设计并实现了一条多阶段处理流水线。我们首先以固定时间间隔对视频进行抽帧,并过滤掉模糊图像。对于每一帧有效图像,我们使用开放词汇目标检测器 Grounding-DINO [80],并指定预定义的关注类别进行检测。当某一帧中包含足够多的有效目标时,我们使用 SAM2 [109] 提取实例级语义掩码。此外,为了将二维图像内容转化为三维表示,我们对每幅图像使用 VGGT [133] 提取三维点集,并将其与先前生成的实例掩码进行融合。需要指出的是,我们还对实例掩码应用腐蚀算法进行细化,从而减轻物体边界处点云估计不准确的问题。借助这一流水线,我们对来自 YouTube 和机器人学习数据集的大约 19,000 段房间参观视频生成了伪标注,在无需人工三维标注的前提下,获得了覆盖多种房间类型与布局的多样化空间问答对。通过对单帧而非整段视频进行处理,我们的流水线在语义信息提取与重建质量上更具保障,避免了在整段视频上直接应用重建与语义提取技术时常见的噪声与不一致问题。

C.3. 额外消融实验

表 10 展示了一个消融实验,用于分析不同任务组对模型空间感知能力的影响。我们的结果表明,三类任务组——配置(configuration)、测量(measurement)以及时空(spatiotemporal)——都是不可或缺的,因为去掉其中任意一类都会导致性能下降。我们进一步通过保留出来的 Route Plan 子任务来评估空间推理能力,发现配置任务组的影响最大,而测量任务组的影响最小。我们将这一结果归因于:路径规划需要对空间布局有整体性的理解,而与测量和时空任务相比,配置类问答(configuration QA pairs)更显式地提供了这种关于空间布局的结构信息。

在这里插入图片描述

C.4. VSI-590K 的示例

为更好地展示 VSI-590K,我们在图 19 至图 25 中给出了若干定性可视化结果。这些可视化结果表明,VSI-590K 在空间问答任务的监督微调方面提供了高度多样且高质量的数据支撑。


D. Cambrian-S 的实现细节

在本节中,我们提供 Cambrian-S 模型的完整训练细节。

D.1. 模型架构

遵循原始 Cambrian-1 [124] 与大多数多模态大模型(MLLMs)[78, 65] 的常见做法,我们的模型(包括升级版 Cambrian-1 与 Cambrian-S)整合了一个预训练视觉编码器、一个作为解码器的预训练语言模型,以及一个连接视觉与语言模态的视觉-语言连接器。具体而言,我们使用 SigLIP2-So400M [128] 作为视觉编码器。该编码器的训练采用多种损失组合:文本下一词预测(LocCa [131])、图文对比损失(或 sigmoid 形式 [105, 157]),以及遮盖式自预测(SILC [96] / TIPS [88])。在语言模型方面,我们采用了经过指令微调的 Qwen2.5 大模型 [145]。与使用 SVA 进行更深层视觉-语言融合的 Cambrian-1 不同,我们采用更简单的、使用 GELU 激活 [35] 的两层 MLP 作为视觉-语言连接器,以平衡性能与效率。

D.2. 训练数据混合

如 3.4 节所述,Cambrian-S 模型通过四个训练阶段进行训练(见图 8)。对于前两个阶段(视觉-语言对齐阶段与图像指令微调阶段),详细的数据混合方式可参考 Cambrian-1 [124]。在第三阶段,我们微调图像指令微调后的模型 CambrianS-3M;而在最后阶段,我们通过在 VSI-590K 上进行空间视频指令微调来进一步增强模型。CambrianS-3M 是我们构建的视频指令微调数据集,包含约 300 万条视频问答样本,基于多个开源视频数据集构建(如 LLaVA-Video [161]、ShareGPT4o [32]、VideoChat2 [71]、MovieChat [119]、EgoIT [149]、Perception Test [103]、Vript [146]、VideoChatGPT-Plus [85]、Ego4D [47]、HowTo100M [94]、HD-VILA [144]、HTStep [2]、TimeIT [111]、HowToInterlink7M [132]、GUI-World [23]、Video-Localized-Narratives [129] 等)。我们在图 16 中给出了该数据集的组成细节。

在这里插入图片描述

在这里插入图片描述

D.3. 训练流程

阶段 1:视觉-语言对齐。
我们冻结模型的大多数参数,仅在 Cambrian-Alignment-2.5M 数据集 [124] 上训练视觉-语言连接器。输入图像被填充到固定分辨率 384×384,最大序列长度设置为 2048。

阶段 2:图像指令微调。
我们解冻视觉-语言连接器与 LLM 解码器,但继续冻结视觉编码器。随后模型在 Cambrian-7M 图像指令微调数据集上进行微调。与 Cambrian-1 [124] 相比,我们采用 AnyRes 策略 [77] 以增强模型的图像理解能力。具体而言,输入图像在保持长宽比的前提下进行缩放,然后被切分成多个 384×384 子图像。这使得模型可以处理更高、更灵活分辨率的图像。为适应 AnyRes 策略带来的视觉 token 数量增加,我们将序列长度扩展到 8192。阶段 1 与阶段 2 的详细训练配置见表 11。

在这里插入图片描述

阶段 3:通用视频指令微调。
为了赋予模型通用视频理解能力,我们在混合数据上进行视频指令微调,其中包括 CambrianS-3M 视频数据,以及从 Cambrian-7M 抽样的图像指令数据。与前面阶段相同,我们继续冻结视觉编码器,仅微调其余模块。对于图像数据,我们沿用阶段 2 的采样策略。对于视频数据,我们均匀采样每个视频的 64 帧,将其缩放到 384×384,并进一步将特征图降采样到 8×8,即每帧 64 个 token。

阶段 4:空间视频指令微调。
最后阶段的目标是通过在我们提出的 VSI-590K 数据集上微调,提高模型的空间推理能力。为保持模型的通用图像与视频理解能力,我们混合了来自 CambrianS-3M 的 59 万视频样本与来自 Cambrian-7M 的 12 万图像样本。训练设置与阶段 3 基本一致,但有两点关键变化:(1)将每段视频的采样帧数提升到 128,(2)将序列长度扩展到 16,384,以支持更丰富的时间建模。阶段 3 与阶段 4 的详细配置见表 12。

在这里插入图片描述

D.4. 基础设施

本文所有模型均使用 TPU v4 Pod,并基于 TorchXLA 框架训练。为支持大规模视频指令微调——其中长序列长度会带来巨大计算与内存开销——我们使用 Pallas 提供的 GSPMD [143] 与 FlashAttention [34]。

GSPMD 是一种自动并行化系统,旨在实现灵活、易用的大规模分布式训练。它允许用户像在单设备上写代码一样开发训练逻辑,然后以极少改动扩展到数百个设备。我们的训练框架基于 TorchXLA 和 GSPMD,将数据、模型参数、激活值与优化器状态分片到多个设备。这减少了训练时的峰值内存开销,并提升吞吐量。

为支持长序列输入,我们集成了基于 Pallas 的 FlashAttention,它能显著降低长上下文场景下 TPU 的 HBM(V-Mem)占用。这使我们能够在 TPU v4-512 Pod 上,将 7B 模型的输入序列长度扩展至 16,384 个 token。

在这里插入图片描述


E. Cambrian-S 的补充结果

E.1. 详细评测设置

我们描述用于大多数图像和视频基准测试的评测设置,不包括 VSI-SUPER。对于图像输入,遵循训练流程中采用的任意分辨率(any-resolution)设计,每张图像在保持长宽比的情况下进行缩放,其分辨率被最大化,以便最多能够划分成九张 384×384 的子图像。对于视频输入,我们以固定帧数进行均匀帧采样。具体来说,阶段 1 与阶段 2 的模型 checkpoints 使用 32 帧均匀采样进行评估,而阶段 3 与阶段 4 的模型分别使用 64 帧和 128 帧。

E.2. 图像与视频基准上的详细性能结果

表 13 与表 14 分别展示了我们所有模型(从阶段 1 到阶段 4,模型规模从 0.5B 到 7B)在图像基准与视频基准上的详细性能。在图像基准部分,我们按照 Cambrian-1 的分组策略,报告模型在 MME [155]、MMBench [81]、SeedBench [66]、GQA [55]、ScienceQA [114]、MMMU [156]、MathVista [83]、AI2D [59]、ChartQA [91]、OCRBench [82]、TextVQA [165]、DocVQA [92]、MMVP [125]、RealworldQA [141] 与 CVBench [124] 上的结果。

在这里插入图片描述
在这里插入图片描述

E.3. 图像指令微调与视频指令微调的贡献分析

为了阐明图像指令微调与视频指令微调对最终视频理解能力的各自贡献,我们进行了系列实验。这些实验在微调过程中采用不同比例的图像与视频数据,并对其在多个视频基准上的性能趋势进行了观察。

更具体地,在最初的图像 MLLM 训练中,我们从 Cambrian-7M 随机采样 100 万、400 万与 700 万条图像 QA 对,分别训练三个不同的模型。随后,在视频微调阶段,我们从 LLaVA-Video-178K(约 160 万样本)中随机采样 25%、50%、75% 和 100% 的视频 QA 对,对上述三个预训练图像模型分别进行仅视频的微调。图像指令微调与视频微调的超参数分别与表 11 和表 12 中一致。实验结果呈现在表 15 中,并导致以下结论:

  • 在未进行视频微调的情况下,在视频基准上,使用更多图像数据训练的模型并不会天然优于使用较少图像数据训练的模型。表中显示,三个模型(分别用 1M、4M、7M 图像数据训练)在直接视频评测中表现相近。

  • 在大部分情况下,对视频数据进行微调对使用大量图像数据预训练的模型更有利,但并非在所有基准上都成立。 在 100% 视频数据微调后,7M 图像预训练模型在 9 个视频基准中的 5 个上取得最好表现。

  • 在训练过程中加入视频数据能始终提升所有视频基准的性能。 我们观察到,即使仅加入 25% 的视频数据,也能使图像 MLLM 在所有视频基准上的表现提升。

  • 增加视频微调数据的比例,并不能保证在所有基准上持续提升性能。 一些基准(如 VideoMME、VSI-Bench、Tomato)在 100% 视频微调下并未优于 25% 版本。 只有 EgoSchema、MVBench 与 Perception Test 在更多视频数据下持续提升。 我们推测这与训练视频的数据分布有关。

在这里插入图片描述

E.4. On the Trade-off between Spatial Sensing and General Video Understanding 空间感知与通用视频理解之间的权衡

在 3.3 节中,我们比较了仅使用 VSI-590K 微调与使用 VSI-590K+通用视频混合数据微调时的性能差异。我们发现,仅用 VSI-590K 微调能在空间感知任务上取得更高性能,而混合数据微调能在空间理解与通用视频理解之间取得更好的平衡。为进一步探索不同模型规模下的这一平衡,我们在 stage 3 后对四个模型规模(0.5B、1B、3B、7B)分别进行 VSI-590K-only 与混合数据微调。随后,我们在通用视频理解与空间感知基准上评估这些模型(结果见图 17)。

结果证实之前的结论在所有模型规模上都成立:仅用 VSI-590K 微调在空间感知任务上最强,而混合微调在整体性能上更均衡。值得注意的是,随着模型规模增大,VSI-Bench 的性能差距逐渐缩小。我们将此归因于大模型具备更强的容量去同时学习并保持多种能力。这一趋势表明,进一步扩大模型规模可能会进一步减轻混合数据微调带来的空间感知性能下降。

在这里插入图片描述


F. 预测感知

F.1. 潜在帧预测的实现细节

潜在帧预测头。
如算法 2 所示,我们的下一帧预测头是一个带有 GELU 激活函数 [51] 的两层 MLP,它与多模态大语言模型(MLLM)的原始语言模型头并行运行。该预测头的输出维度被设为 1152,与我们的视觉编码器(即 siglip2-so400m-patch14-384)的输出维度相匹配。
在这里插入图片描述

关于 LFP 损失与指令微调损失之间的平衡。
如 4.1 节所述,为了构建模型的内部世界模型,我们对第 4 阶段做了小幅修改:引入了两种辅助损失(即余弦距离与均方误差),以优化下一帧预测的客观性。我们为 LFP 损失与指令微调损失之间引入了一个权重系数来进行平衡,并在表 16 中对该系数进行了消融研究。

在这里插入图片描述

F.2. VSI-SUPER Recall 的记忆框架设计

如主文中所介绍的(并在算法 3 中给出),我们的预测记忆机制由三个不同层级的记忆( M s M_s Ms M l M_l Ml M w M_w Mw)以及四个关键的转换函数组成,这四个函数控制它们之间的交互:感知流(Sensory Streaming)、记忆压缩(Memory Compression)、记忆巩固(Memory Consolidation)和检索(Retrieval)。本节将详细说明这些函数的实现方式。

基本记忆单元。
在我们的实现中,我们使用来自每一层大语言模型(LLM)的编码后键值对(key-value pairs)作为基本记忆单元。与直接使用视觉编码器或视觉-语言连接器输出的潜在特征相比,这一选择使我们能够充分利用 LLM 的内部能力来构建记忆,而无需额外的外部模块。这一设计选择将在后续部分中进一步展开说明。

流式感知(Streaming sensing)。
每一帧新到达的画面首先在窗口大小为 W s W_s Ws 的条件下,由视觉编码器和视觉-语言连接器独立处理。随后,该帧在参考若干已选前帧的基础上,由 LLM 进行进一步编码。这些前序帧的键值对被缓存于感知记忆缓冲区 M s M_s Ms 中,为这一编码步骤提供必要的上下文信息。

基于“惊讶度”的记忆压缩。
在对单帧进行编码的同时,我们会评估该帧的“惊讶度”水平。具体而言,我们通过计算模型对当前帧的预测与实际观测之间的差异(两者都在潜在特征空间中)来获得这一惊讶度。当时间步为 t t t 的某一帧从感知记忆缓冲区 M s M_s Ms 迁移到长期记忆 M l M_l Ml 时,如果它被认为“不惊讶”(即其惊讶度低于预设阈值 T s T_s Ts),我们会在空间维度( H × W H \times W H×W)上对其键值对进行 2 倍下采样。这种基于惊讶度的压缩机制可以减轻存储在 M l M_l Ml 中信息的冗余程度。

基于“惊讶度”的记忆巩固。
长期记忆 M l M_l Ml 具有预定义的容量上限 B l o n g B_{long} Blong(例如 32,768 个 token)。当记忆 token 的数量超过这一预算时,我们对 M l M_l Ml 施加基于惊讶度的记忆巩固函数,以确保其保持在容量限制之内。我们的巩固函数形式简单却行之有效:我们首先为 M l M_l Ml 中的每一帧确定其对应的惊讶度得分。接着,我们移除(即“遗忘”)惊讶度最低的那一帧。随后,我们会根据各帧的惊讶度决定合并或丢弃其中一部分帧(我们在此尝试了三种不同策略:1)遗忘最旧的记忆;2)遗忘惊讶度最低的记忆;3)遗忘惊讶度最低的记忆,并在存在相邻高惊讶度记忆时合并这些相邻的惊讶记忆)。这一过程会不断迭代,直至 M l M_l Ml 的总体大小回落到预算限制之下。

记忆检索(Retrieval)。
当接收到用户查询 q q q 时,我们首先从长期记忆 M l M_l Ml 中检索最相关的若干帧,用以构建工作记忆 M w M_w Mw。随后, M w M_w Mw 将作为上下文,用于回答用户的查询。为了在不依赖外部模块的前提下高效完成检索,我们利用 LLM 注意力机制中固有的相似度度量能力。具体而言,在每一层 Transformer 中,我们将用户查询 q q q 映射到注意力机制所使用的查询特征空间。然后,我们计算该查询特征与存储在 M l M_l Ml 中各帧键特征之间的相似度。相似度采用余弦距离进行度量,并且为了简化计算,我们将多头注意力的特征视作一个整体特征来处理。具有最高相似度得分的 k k k 帧会被选中,其键值对被注意力机制使用,以进一步编码用户查询。

在这里插入图片描述

F.3. VSI-SUPER Count 的 Agentic 框架设计

算法 4 给出了我们为 VSI-SUPER Count 任务设计的 agentic 框架。与算法 3 中的记忆设计类似,我们使用滑动窗口方法对感知帧进行编码,窗口大小为 W s W_s Ws。潜在帧预测模块持续预测期望的下一帧,并通过计算预测误差来量化实际下一帧的“惊讶”程度。随着新帧不断到来,超出感知记忆窗口范围的最旧帧将被出队并存入长期记忆中。如果某一出队的帧被认为是“惊讶的”(即其预测误差超过预设阈值 τ \tau τ),这可能表明场景或空间边界的出现,此时我们会利用当前累积的长期记忆触发一次查询响应,并在响应之后重置该长期记忆。生成的响应会被存储到答案记忆库中。最终答案通过对答案记忆库中所有中间答案进行聚合得到。

在这里插入图片描述

F.4. 与现有长视频方法的比较

我们在表 17 中,将我们的方法(包括基于惊讶度的记忆机制与 agentic 框架)与已有面向长视频理解的方法进行了对比。具体来说,这里的所有实验均使用经过 LFP 微调的 Cambrian-S-7B 模型,主要区别在于处理不断扩展的视觉感知输入的策略不同。对于 MovieChat,我们遵循其官方实现 [119],使用固定大小的长期记忆库,并将长期记忆与短期记忆的容量上限分别设为 64 和 16。对于 Flash-VStream [159],由于其抽象记忆模块会引入额外参数并需要单独的训练过程,我们仅实现其中剩余的三个记忆组件(即空间记忆、时间记忆与检索记忆),并将其他超参数保持与默认设置一致。

在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

更多推荐