在这里插入图片描述

📖标题:Qwen3.5-Omni Technical Report
🌐来源:arXiv, 2604.15804v2

🛎️文章简介
🔸研究问题:如何构建一个能原生支持文本、图像、音频及音视频理解与生成,并具备实时交互和自主代理能力的统一全模态大模型?
🔸主要贡献:论文提出了 Qwen3.5-Omni,通过混合专家架构和自适应对齐技术,实现了 256k 上下文、超低延迟流式交互及音视频代码生成等 SOTA 能力。

📝重点思路
🔸采用 Thinker-Talker 双塔架构,两者均基于混合注意力混合专家(Hybrid Attention MoE)设计,利用 Gated Delta Net 模块加速长序列建模,显著提升推理效率与并发能力。
🔸引入 ARIA(自适应速率交错对齐)技术,动态调整文本与语音单元的对齐比例,解决了流式语音合成中因编码效率差异导致的卡顿和韵律不自然问题。
🔸构建全新的时间感知机制,通过在音视频片段前显式插入格式化时间戳字符串,替代传统的稀疏位置编码,增强了模型对长视频和复杂时序关系的感知精度。
🔸实施三阶段预训练策略,从编码器对齐到通用多模态学习,再到 256k 长上下文专项训练,并结合蒸馏与交互对齐强化学习优化后训练过程。
🔸支持零样本声音克隆与跨语言语音生成,通过系统提示词控制音色、情感及语速,实现了高保真的个性化语音交互。

🔎分析总结
🔸在 215 个音频及音视频基准测试中,Qwen3.5-Omni-Plus 全面超越 Gemini-3.1 Pro,尤其在语音识别、翻译及端到端对话任务上表现卓越。
🔸模型在保持文本和视觉能力不退化的前提下,成功实现了超过 10 小时的音频理解和 400 秒 720P 视频的长上下文处理,验证了长序列建模的有效性。
🔸实验显示 ARIA 技术显著降低了首包延迟,Flash 版本在音频输入下仅需 235ms,且在多并发场景下仍能保持稳定的生成吞吐率。
🔸发现了“音视频氛围编程”的新兴能力,模型可直接根据音视频指令生成可执行代码,展示了全模态模型在自主代理行为上的巨大潜力。
🔸在多语言语音生成评估中,模型在 29 种语言的零样本生成及跨语言声音克隆任务中,内容一致性和说话人相似度均优于主流商业系统。

💡个人观点
论文打破了模态间的壁垒,不仅通过 ARIA 解决了流式交互的痛点,更通过显式时间戳和长上下文训练让模型具备了深度的时序推理能力。

在这里插入图片描述
在这里插入图片描述

更多推荐