Announcing vLLM-Omni: Easy, Fast, and Cheap Omni-Modality Model Serving
宣布推出 vLLM-Omni:简单、快速、经济的全模态模型服务
2025 年 11 月 30 日 • vLLM-Omni 团队
我们很高兴地宣布 vLLM-Omni 正式发布。它是 vLLM 生态系统的一个重大扩展,旨在支持下一代 AI:全模态模型(omni-modality models)。

vLLM 自成立以来,一直专注于为大型语言模型(LLMs)提供高吞吐量、内存高效的服务。然而,生成式 AI 的格局正在迅速变化。模型不再仅仅是文本输入、文本输出。如今最先进的模型能够跨文本、图像、音频和视频进行推理,并使用多样化的架构生成异构输出。
vLLM-Omni 是首批支持全模态模型服务的开源框架之一,它将 vLLM 卓越的性能扩展到了多模态和非自回归推理领域。

为什么选择 vLLM-Omni?
传统的服务引擎是为基于文本的自回归(AR)任务而优化的。随着模型发展成为能够“看、听、说”的“全能”(omni)智能体,服务基础设施也必须随之演进。
vLLM-Omni 解决了模型架构中的三个关键转变:
- 真正的全模态: 无缝处理和生成文本、图像、视频和音频。
- 超越自回归: 将 vLLM 高效的内存管理扩展到 Diffusion Transformers (DiT) 和其他并行生成模型。
- 异构模型流水线: 协调复杂的模型工作流程,其中单个请求可以调用多个异构的模型组件(例如,多模态编码、AR 推理、基于扩散的多模态生成等)。
架构内部
vLLM-Omni 不仅仅是一个封装器;它是对 vLLM 内部和外部数据流的重新构想。它引入了一个完全解耦的流水线,允许在生成的不同阶段动态分配资源。如上图所示,该架构统一了不同的阶段:
- 模态编码器(Modality Encoders): 高效编码多模态输入(ViT、Whisper 等)。
- LLM 核心(LLM Core): 利用 vLLM 通过一个或多个语言模型进行自回归文本和隐藏状态的生成。
- 模态生成器(Modality Generators): 为 DiT 和其他解码头部提供高性能服务,以生成丰富的媒体输出。
关键特性
-
简单性: 如果您知道如何使用 vLLM,就知道如何使用 vLLM-Omni。我们保持与 Hugging Face 模型的无缝集成,并提供一个兼容 OpenAI 的 API 服务器。
-
灵活性: 借助 OmniStage 抽象,我们提供了一种简单直接的方式来支持各种全模态模型,包括 Qwen-Omni、Qwen-Image 和其他最先进的模型。
-
性能: 我们利用流水线式阶段执行来重叠计算,以实现高吞吐量性能,确保在一个阶段处理时,其他阶段不会空闲。

我们将 vLLM-Omni 与 Hugging Face Transformers 进行了基准测试,以证明在全模态服务方面的效率提升。

未来路线图
vLLM-Omni 正在快速发展。我们的路线图侧重于扩展模型支持,并将高效推理的界限推得更远,同时构建合适的框架来赋能未来对全模态模型的研究。
- 扩展模型支持: 我们计划支持更广泛的开源全模态模型和扩散 Transformers。
- 自适应框架改进: 我们将持续发展和改进框架,以支持新兴的全模态模型和执行模式,确保它仍然是生产工作负载和前沿研究的可靠基础。
- 更深入的 vLLM 集成: 将核心全模态功能合并到上游,使多模态成为整个 vLLM 生态系统中的一等公民。
- 扩散加速: 并行推理 (DP/TP/SP/USP…)、缓存加速 (TeaCache/DBCache…) 和计算加速 (量化/稀疏注意力…)。
- 完全解耦: 基于 OmniStage 抽象,我们期望支持不同推理阶段(编码器/预填充/解码/生成)的完全解耦,以提高吞吐量并减少延迟。
- 硬件支持: 遵循硬件插件系统,我们计划扩展对各种硬件后端的支持,以确保 vLLM-Omni 在任何地方都能高效运行。
入门指南
开始使用 vLLM-Omni 非常简单。vllm-omni v0.11.0rc 的初始版本构建在 vLLM v0.11.0 之上。
安装
请查看我们的 安装文档 获取详细信息。
服务全模态模型
请查看我们的 示例目录,获取启动图像、音频和视频生成工作流程的特定脚本。vLLM-Omni 还提供 Gradio 支持以改善用户体验,以下是服务 Qwen-Image 的演示示例:
加入社区
这仅仅是全模态服务(omni-modality serving)的开始。我们正在积极开发对更多架构的支持,并邀请社区帮助塑造 vLLM-Omni 的未来。
- 代码与文档: GitHub 仓库 - 文档
- Slack: 在 slack.vllm.ai 的
#sig-omniSlack 频道提问并提供反馈。 - 周例会: 加入我们,每周二太平洋夏令时 19:30 讨论路线图和功能。点击此处加入。
让我们共同建设全模态服务的未来!
更多推荐

所有评论(0)