LongCat封面

美团开源136亿参数视频大模型LongCat-Video:小白也能看懂的保姆级解析

引言:AI 视频生成,卷到新高度了

如果你关注过 AI 圈,一定听说过"文生视频"——输入一句话,AI 帮你生成一段视频。前有 Sora 惊艳全球,后有可灵、即梦、Runway 各显神通。

但过去的大模型有个通病:视频一长就崩。生成 5 秒的短视频还行,一旦要生成 1 分钟以上的长视频,画面就开始"鬼畜"——颜色漂移、人物变形、动作穿帮。

2025 年 10 月 25 日,美团 LongCat 团队开源了 LongCat-Video,一个 136 亿参数(13.6B)的视频生成基础模型,主打的就是分钟级长视频连贯生成。上线至今已在 GitHub 收获 6000+ Star,成为开源视频生成领域的明星项目。

这篇文章不堆术语,用大白话把 LongCat-Video 讲清楚:它是什么、厉害在哪、技术上有哪些门道、以及普通人怎么上手玩。

一、LongCat-Video 是什么?

一句话:它是一个能"听懂人话、生成视频"的超级模型,而且一口气能干三件事

任务 大白话解释 应用场景
文生视频 输入一段文字描述,生成对应视频 "一只橘猫在夕阳下打哈欠"→ 出片
图生视频 给一张图片,让它"动起来" 给一张风景照 → 生成航拍运镜视频
视频续写 给一段已有视频,接着往下编 5 秒短片 → 续写成 1 分钟完整故事

关键点是:这三个能力不是三个模型,而是同一个模型原生支持的。就像一个人既能写文章、又能画画、还能谱曲——不需要换"脑子"。

二、它凭什么火?四大核心亮点

🌟 亮点一:长视频生成,不"翻车"

这是 LongCat-Video 最大的卖点。

其他模型生成长视频,容易出现颜色漂移(画面色调越变越怪)和质量退化(后半段画面糊成马赛克)。

LongCat-Video 采用"视频续写"作为预训练任务——它天生就擅长"接着上一段继续编",所以能稳定输出分钟级的长视频,画面质量始终如一。

打个比方:别的模型像"一次性写一篇长作文",写着写着就词穷了;LongCat-Video 像"一段一段接着写小说",每一段都衔接自然。

🌟 亮点二:统一架构,一个模型打天下

它把文生视频、图生视频、视频续写统一在一个框架里,训练数据互相补充,模型能力互相增强。用户不用根据不同任务切换不同模型,一个 LongCat-Video 全搞定。

🌟 亮点三:高效推理,几分钟出 720p 视频

生成 720p、30 帧/秒的视频,只需要几分钟。它用了两条加速技术:

  1. 由粗到细(Coarse-to-Fine)生成策略:先快速生成一个模糊的"草稿视频",再逐步细化成高清画面,而不是一上来就精雕细琢每一帧。
  2. 块稀疏注意力(Block Sparse Attention):让模型"选择性关注"重要区域,减少大量无效计算——高清分辨率下尤其省力。

🌟 亮点四:多奖励 RLHF,越学越强

模型训练后期用了 GRPO(Group Relative Policy Optimization,组相对策略优化)——一种多奖励强化学习技术。

大白话:模型生成视频后,多个"评审老师"(奖励模型)从不同维度打分——画面质量、动作合理性、文字匹配度。模型根据综合反馈不断改进自己,越练越强,最终在多项评测中逼近甚至超越顶级商业模型。

三、技术内幕:代码里藏着哪些门道?

对于想深入学习的朋友,我们扒一扒仓库的代码结构(GitHub: meituan-longcat/LongCat-Video)。

仓库结构一览

LongCat-Video/
├── longcat_video/                  # 核心代码包
│   ├── modules/                    # 模型组件
│   │   ├── longcat_video_dit.py    # ★ 核心:DiT 扩散 Transformer 主模型
│   │   ├── attention.py            # 注意力机制(含块稀疏注意力)
│   │   ├── autoencoder_kl_wan.py   # 视频 VAE 编解码器(基于 Wan)
│   │   ├── blocks.py               # 基础模块(时间嵌入、PatchEmbed3D 等)
│   │   ├── rope_3d.py              # 3D 旋转位置编码
│   │   └── scheduling_flow_match_euler_discrete.py  # 采样调度器
│   ├── block_sparse_attention/     # ★ 块稀疏注意力加速模块
│   ├── context_parallel/           # 上下文并行(多卡推理)
│   ├── audio_process/              # 音频处理(Avatar 系列用)
│   └── pipeline_longcat_video.py   # ★ 推理管线(6 万行级别的大文件)
├── run_demo_text_to_video.py       # 文生视频 demo
├── run_demo_image_to_video.py      # 图生视频 demo
├── run_demo_video_continuation.py  # 视频续写 demo
├── run_demo_long_video.py          # 长视频生成 demo
├── run_demo_interactive_video.py   # 交互式视频 demo
├── run_streamlit.py                # Web 界面 demo
└── assets/                         # 示例素材

核心技术点(通俗版)

1. DiT(Diffusion Transformer)架构

LongCat-Video 本质是一个"扩散模型 + Transformer"的组合体。

  • 扩散模型(Diffusion):先给视频加噪点,直到变成纯雪花,再训练模型一步步"去噪",还原出清晰视频。就像雕塑家先看一块石头,再一点点凿出雕像。
  • Transformer:擅长处理序列数据,视频本质是一连串带时间顺序的画面帧,正好是 Transformer 的菜。

代码中的 LongCatSingleStreamBlock 就是这种架构的基本单元,包含自注意力(self-attention)、交叉注意力(cross-attention,用于把文字提示融合进视频)和前馈网络(FFN)。

2. 块稀疏注意力(BSA)

视频注意力计算量巨大(每一帧都要和所有其他帧互动)。BSA 的思路是:把注意力计算切成块,只计算关键块,大幅减少计算量。代码里 block_sparse_attention/ 目录就是干这个的,支持 FlashAttention-2/3、xformers 等多种后端。

3. 上下文并行(Context Parallel)

视频太长,一块 GPU 显存放不下怎么办?把视频"切成几段",分给多块 GPU 并行处理,最后拼接。context_parallel/ 目录实现了 Ulysses 并行方案。这也解释了为什么官方 demo 推荐用 torchrun --nproc_per_node=2 多卡跑。

4. 3D 旋转位置编码(RoPE-3D)

视频有"宽、高、时间"三个维度,模型需要知道每一帧"在什么位置"。RoPE-3D 就是给视频加"时空坐标"的技术,让模型理解空间布局和时间顺序。

四、效果怎么样?用数据说话

官方在内部基准上做了 MOS(平均意见分)评测,与市面主流模型对比:

文生视频对比:

指标 Veo3 PixVerse-V5 Wan 2.2-T2V-A14B LongCat-Video
架构 闭源 闭源 MoE 28B Dense 13.6B
文本对齐 3.99 3.81 3.70 3.76
画面质量 3.23 3.13 3.26 3.25
动作质量 3.86 3.81 3.78 3.74
综合质量 3.48 3.36 3.35 3.38

图生视频对比:

指标 Seedance 1.0 Hailuo-02 Wan 2.2-I2V-A14B LongCat-Video
图像对齐 4.12 4.18 4.18 4.04
画面质量 3.22 3.18 3.23 3.27
综合质量 3.35 3.27 3.26 3.17

划重点:LongCat-Video 只有 13.6B 参数,而 Wan 2.2 是 28B 参数的 MoE 架构。用不到一半的参数量,打出了接近甚至部分超越的成绩——这就是"高效"二字的含金量。

五、小白上手指南:怎么跑起来?

第一步:环境准备

需要一台有 NVIDIA GPU 的电脑(建议显存 ≥ 24GB,或用多卡),系统装好 CUDA。

# 1. 克隆仓库
git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video
cd LongCat-Video

# 2. 创建 conda 环境
conda create -n longcat-video python=3.10
conda activate longcat-video

# 3. 安装 PyTorch(按你的 CUDA 版本调整)
pip install torch==2.6.0+cu124 torchvision==0.21.0+cu124 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu124

# 4. 安装其他依赖
pip install ninja pstuil packaging
pip install flash_attn==2.7.4.post1
pip install -r requirements.txt

第二步:下载模型权重

模型权重在 Hugging Face 上(MIT 协议,完全免费商用):

pip install "huggingface_hub[cli]"
huggingface-cli download meituan-longcat/LongCat-Video --local-dir ./weights/LongCat-Video

第三步:跑一个文生视频 demo

# 单卡推理
torchrun run_demo_text_to_video.py --checkpoint_dir=./weights/LongCat-Video --enable_compile

# 双卡并行推理(更快)
torchrun --nproc_per_node=2 run_demo_text_to_video.py --context_parallel_size=2 --checkpoint_dir=./weights/LongCat-Video --enable_compile

想用网页界面?一条命令搞定:

streamlit run ./run_streamlit.py --server.fileWatcherType none --server.headless=false

小白提示

  • 硬件门槛:13.6B 模型推理需要较大显存,个人玩家建议用云 GPU(AutoDL、恒源云等按小时租)。
  • 提示词技巧:描述越具体越好,例如"一位年轻女性留着黑色长发,微笑说话,穿着白色外套,坐在明亮的咖啡馆里"——丰富的细节能显著提升生成质量。
  • 长视频:用 run_demo_long_video.py 可以生成分钟级长视频。

六、彩蛋:LongCat 家族的 Avatar 系列

LongCat 团队不止做了视频生成,还开源了数字人(Avatar)系列

  • LongCat-Video-Avatar(2025.12):音频驱动人物动画,输入一段语音,生成人物说话的视频,支持单人和多人对话场景。基于 Wav2Vec2 音频编码。
  • LongCat-Video-Avatar-1.5(2026.5):升级版,换用 Whisper-Large 音频编码器,口型同步更精准;支持动漫、动物等风格化领域;推理加速到 8 步蒸馏,速度更快。

想象一下:以后你只需要一段录音 + 一张照片,AI 就能生成"照片里的人开口说话"的视频——数字人直播、虚拟客服、有声绘本,全都能做。

七、总结:对普通人意味着什么?

LongCat-Video 的开源意义,可以归结为三点:

  1. 长视频不再是难题:分钟级连贯生成的突破,让 AI 从"短视频玩具"走向"内容生产力工具"。
  2. 开源让门槛降低:MIT 协议 + 完整代码 + 免费权重,个人开发者、小团队也能基于它做二次开发。
  3. 世界模型的第一步:官方明确表示,这是探索"世界模型"(让 AI 理解物理世界运行规律)的起点。能生成连贯视频的模型,未来才可能真正"理解"世界。

美团这次不仅秀了技术肌肉,更展现了"技术普惠"的姿态——把最前沿的视频生成能力,交到了每一个开发者手里

如果你对 AI 视频生成感兴趣,不妨 clone 下来跑一跑。当看到自己写的一句话变成一段流畅的视频时,那种"造物主"的快乐,值得体验一次。


本文基于 LongCat-Video 官方 GitHub 仓库(meituan-longcat/LongCat-Video)及技术报告(arXiv:2510.22200)整理分析。

更多推荐