当下人工智能正从云端数据中心下沉至各类实体业务场景,新一代视频边缘 AI 对多模态联合推理、超低延迟、多路视频高并发处理的需求持续攀升。为打破传统目标检测算法功能单一、泛化性不足的瓶颈,视程空间科技依托 NVIDIA Jetson T5000 硬件平台,针对 NVIDIA Cosmos3-Nano、Cosmos3-Edge、Qwen3.5-9B 三款全新视觉语言大模型(VLM)开展完整性能基准评测。

        NVIDIA Cosmos 3 作为通用世界基础模型,可适配感知决策、多模态视觉语言推理等多元业务。本次测试聚焦公共安全实景场景,围绕车祸、火情、积水内涝等突发事件搭建二元视觉问答评测任务,全方位对比各模型事件识别精度,以及高并发负载下的推理吞吐扩展能力。

核心性能对比:精度与吞吐的双向权衡

        实测数据显示,Cosmos3-Nano 与 Qwen3.5-9B 在吞吐性能上差距显著:49 路视频并发工况下,Cosmos3-Nano 推理吞吐量达到 Qwen3.5-9B 两倍以上,整体识别准确率仅相差 1.13%(96.31% VS 97.44%)。对于搭载海量摄像头的高密度边缘部署场景,该取舍方案具备极高工程落地价值。两款模型在边缘端均拥有优秀的事件理解推理能力,但架构设计各有侧重,适配不同业务需求。

Qwen3.5-9B:语义理解与综合精度均衡最优

        该模型综合识别准确率 97.44%,F1 分数 91.15;49 路并发测试环境中,总词元吞吐速率达 215.37 token/s。模型精准率与召回率平衡度出色,擅长复杂场景语义解析、深层事件逻辑推理,是对识别可靠性要求严苛场景的最优选择。

Cosmos3-Nano:多路视频高并发吞吐标杆

        模型识别准确率 96.31%,F1 分数 88.14;在 49 路极限并发负载下,稳定实现 525.01 token/s 的超高推理速度,吞吐性能远超同工况下的 Qwen3.5-9B。
注:以上两组量产级数据均采用 vLLM 推理引擎搭配 NVFP4 量化方案,为视程空间标准化落地优化配置。

Cosmos3 家族轻量化成员 Cosmos3-Edge 基准对照测试

        为完整覆盖 Cosmos3 全系列模型性能梯度,视程空间同步完成 Cosmos3-Edge 基准评测。该版本是 Cosmos3 系列最轻量模型,专为算力、功耗受限的极致边缘设备打造。
受架构限制,Cosmos3-Edge 暂不支持 llm-compressor 工具实现 NVFP4 量化,也无法兼容 vLLM、vLLM-Omni 推理框架。为搭建无量化、无推理框架优化干扰、可横向公平对比的统一基线,三款模型统一采用 FP32 全精度,基于 Hugging Face Transformers 原生框架完成测试。

        统一基线下,更能客观反映模型综合能力的 F1 指标随模型参数量级提升同步上涨:Qwen3.5-9B 以 90.32 位居首位,Cosmos3-Nano-Reasoner 为 88.32,Cosmos3-Edge 达 87.40。Cosmos3-Edge 以小幅精度损耗,换取更小模型体积、更低算力占用。

        单路视频(并发数 = 1)吞吐测试结果与高并发场景形成鲜明反差:无量化、无批量推理的基线环境中,Cosmos3-Edge 以 7.37 token/s 领跑,Cosmos3-Nano 为 3.83 token/s,Qwen3.5-9B 仅 2.95 token/s。
        由此可见,Cosmos3-Edge 适配单路摄像头、功耗敏感型边缘终端;而面向多路摄像头并行运行的量产高并发业务,视程空间仍推荐采用 Cosmos3-Nano 搭配 NVFP4 量化 + vLLM 推理引擎的优化组合方案。

从传统视频分析迈向物理人工智能新时代

        传统视频 AI 依赖人工预设目标检测规则,场景适配灵活性差。依托视程空间自研边缘推理技术,搭配多模态视觉语言模型,工作人员可直接使用自然语言下发查询指令,例如 “道路区域是否发生交通事故”“监控范围内是否存在异常事件”。

        依托 NVIDIA Jetson T5000 强大算力底座,结合视程空间自研视频采集、多路摄像头融合、SmartNVR、SmartVMS 一体化平台能力,可在本地边缘侧完成实时场景解析与事件自主推理。整套方案数据无需上传云端,充分保障用户数据隐私安全,同时推动传统视频智能分析业务,向具备自主决策能力的物理人工智能(Physical AI)、智能体 AI(Agentic AI)全面升级。

更多推荐