【Voice】Qwen3-ASR模型
·
note
- 三个模型:
- Qwen3-ASR-1.7B:主打高精度
- Qwen3-ASR-0.6B:主打轻量、高吞吐
- Qwen3-ForcedAligner-0.6B:把已有文本和语音精确对齐,输出字词时间戳。适合字幕打轴、语音数据标注、歌词对齐。比如得到
What's [time] your [time] name [time]的结果
- 支持 30 种语言、22 种中文方言,同时具备语言识别、流式/离线识别、长语音、噪声语音和歌曲识别能力
- AuT 会把 100Hz 的 FBank 特征做 8 倍降采样,变成约 12.5Hz 的音频表示。同时采用 1~8 秒动态注意力窗口,因此同一个模型既能处理短块流式输入,也能处理长音频离线转写。1.7B 版本使用约 300M 参数的 AuT 编码器,0.6B 使用约 180M 参数的编码器
- 使用约 5 万条困难样本做 GSPO,重点提升:噪声环境鲁棒性、转写稳定性、困难语音处理能力、多语言和功能场景表现
一、研究动机
《Qwen3-ASR Technical Report》
- 传统端到端 ASR(Transducer / AED)靠自下而上声学匹配,在长音频、噪声、方言、命名实体、多语种等场景天然吃力。
- 大模型音频语言模型(LALM)范式先把音频"理解"一遍再出文字,能借用 LLM 的世界知识和语言建模能力,但开源 ASR 在公开 benchmark 上已卷到标注误差天花板,真实场景差异被掩盖。
- 工程侧两个痛点:①工业部署要带时间戳(字幕/对齐),传统用 CTC/CIF 后处理,准度和速度都不理想;②端侧/高并发需要小模型兼顾准度与吞吐。
- 所以 Qwen 的动机很直接:从 Qwen3-Omni 底座切出统一多语种 ASR + LID、小模型高效版、以及首个 LLM 基非自回归强制对齐器,补齐语音栈里开源缺失的一环。
二、论文核心

1、模型家族

模型家族(三个,Apache 2.0 开源)
- Qwen3-ASR-1.7B:Qwen3-1.7B + Projector + AuT 音频编码器(300M,12.5Hz),30 语种 + 22 种中文方言,支持离线/流式(最长 1200s),歌声+带 BGM 歌曲都能转。
- Qwen3-ASR-0.6B:结构同比例缩小(编码器 180M),主打端侧与高并发,平均 TTFT 92ms,128 并发 RTF 0.064(等效每秒吞 2000s 音频)。
- Qwen3-ForcedAligner-0.6B:LLM 基 NAR 槽位填充对齐器,覆盖 11 语种,词/字/句/段级时间戳灵活输出,AuT 帧 80ms 离散化,预测
[time]槽位索引。
2、训练流水线
训练流水线(四段)
-
AuT 编码器预训练:~4000 万小时伪标数据,AED 框架。
-
Omni 预训练:继承 Qwen3-Omni 多模态 3T token 能力。
-
ASR SFT:格式化成
language XXX<asr_text>...,刻意做成"不接自然语言指令"的纯 ASR 模式,防指令注入;引入流式增强、context biasing。 -
ASR RL:GSPO 策略优化,5 万 utt(中英文 35% / 多语种 35% / 功能 30%),专治噪声鲁棒与难例。
3、ForcedAligner 关键设计
ForcedAligner 关键设计
- 放弃 next-token 偏移训练,改用 causal 非偏移训练,槽位与标签对齐,交叉熵只算在
[time]上。 - 用 MFA 伪标蒸馏+平滑,不照搬 MFA 的系统偏移。
- 动态槽位插入增强泛化;推理时 NAR 一次性填所有槽,索引×80ms 还原时间。
三、实验结果
中英与方言(表 3)
- 英文:1.7B 在 GigaSpeech 8.45、CV-en 7.39、VoxPopuli 9.15,整体逼近/超过 GPT-4o-Transcribe 与 Gemini-2.5-Pro,LibriSpeech other 3.38 优于 Whisper-large-v3 的 3.97。
- 中文:WenetSpeech net/meeting 4.97/5.88(CER),明显甩开 Whisper(9.86/19.11);KeSpeech 方言 5.10,粤语 CV-yue 7.57。
- 0.6B 版本在同尺寸开源里基本是最强,如 WenetSpeech 5.97/6.88。
内部鲁棒集(表 4)
- 重口音英文 WER 16.07(1.7B)vs Doubao 20.41 / Whisper 21.30。
- 极端噪声 16.17、绕口令 2.44、老人小孩 3.81、多方言对话 15.94——全部第一。
多语种 + LID(表 5、6)
- Fleurs 12 语种 WER 4.90(1.7B)vs Whisper 5.27;Fleurs++ 30 语种退到 12.60 但仍优于其他开源。
- LID 准确率平均 97.9%(Whisper 94.1%),剩的错主要是 ms/id 混淆。
歌声与整歌(表 7)
- M4Singer 5.98、Opencpop 3.08、整首英文歌 14.60、整首中文歌 13.91;Whisper 和 FunASR-MLT-Nano 在"整歌+BGM"直接 N/A(长度/崩坏)。
流式(表 8)
- 2s chunk 流式相对离线略有退化(如 1.7B LibriSpeech other 3.38→4.51),但绝对水平仍能打。
强制对齐(表 9)
- AAS(累计平均偏移 ms)在人标集平均 32.4ms,MFA/NFA/WhisperX 在 101~141ms;300s 拼接长音频下对手飙到 2708ms(WhisperX)或 246ms(NFA),Qwen 仍 52.9ms。相对偏移降 67%~77%。
效率(表 2)
- 0.6B @128 并发:TTFT avg 92ms,throughput 2000×实时。
- ForcedAligner 0.6B RTF 可到 ~0.001 级,1 秒处理 1000s 音频。
四、分析
- 为什么准:不是单纯堆数据,而是 Omni 多模态底座给"语义先验"+ RL 阶段专补真实脏数据,所以公开集没拉开时,内部噪声/方言/歌声集优势放大。
- 小模型能打:0.6B 靠 AuT 编码器(180M)把声学表征先压住,LLM 部分只做语言决策,参数分配比 Whisper 式全量 decoder 更省。
- 对齐器是真创新:把 FA 从"音素字典+对齐工具"变成"LLM 槽位填充",跨语种不用重训、长音频不漂移、NAR 推理快;代价是依赖 MFA 伪标起点,极低频语种仍可能受伪标上限约束。
- 局限:30 语种全开时 1.7B 在 Fleurs++ 仍比 Whisper 掉得多,说明长尾语种数据覆盖还不够;ForcedAligner 目前 11 语种、300s 上限,再长要切片。
- 定位:1.7B 对标商用 API 闭源顶线,0.6B 吃端侧/高并发,ForcedAligner 补字幕/标注基建——三者组合等于把"识别—语言判定—时间戳"一条龙开源化了。
更多推荐


所有评论(0)