note

  • 三个模型:
    • Qwen3-ASR-1.7B:主打高精度
    • Qwen3-ASR-0.6B:主打轻量、高吞吐
    • Qwen3-ForcedAligner-0.6B:把已有文本和语音精确对齐,输出字词时间戳。适合字幕打轴、语音数据标注、歌词对齐。比如得到What's [time] your [time] name [time]的结果
  • 支持 30 种语言、22 种中文方言,同时具备语言识别、流式/离线识别、长语音、噪声语音和歌曲识别能力
  • AuT 会把 100Hz 的 FBank 特征做 8 倍降采样,变成约 12.5Hz 的音频表示。同时采用 1~8 秒动态注意力窗口,因此同一个模型既能处理短块流式输入,也能处理长音频离线转写。1.7B 版本使用约 300M 参数的 AuT 编码器,0.6B 使用约 180M 参数的编码器
  • 使用约 5 万条困难样本做 GSPO,重点提升:噪声环境鲁棒性、转写稳定性、困难语音处理能力、多语言和功能场景表现

一、研究动机

《Qwen3-ASR Technical Report》

  • 传统端到端 ASR(Transducer / AED)靠自下而上声学匹配,在长音频、噪声、方言、命名实体、多语种等场景天然吃力。
  • 大模型音频语言模型(LALM)范式先把音频"理解"一遍再出文字,能借用 LLM 的世界知识和语言建模能力,但开源 ASR 在公开 benchmark 上已卷到标注误差天花板,真实场景差异被掩盖。
  • 工程侧两个痛点:①工业部署要带时间戳(字幕/对齐),传统用 CTC/CIF 后处理,准度和速度都不理想;②端侧/高并发需要小模型兼顾准度与吞吐。
  • 所以 Qwen 的动机很直接:从 Qwen3-Omni 底座切出统一多语种 ASR + LID小模型高效版、以及首个 LLM 基非自回归强制对齐器,补齐语音栈里开源缺失的一环。

二、论文核心

在这里插入图片描述

1、模型家族

在这里插入图片描述

模型家族(三个,Apache 2.0 开源)

  • Qwen3-ASR-1.7B:Qwen3-1.7B + Projector + AuT 音频编码器(300M,12.5Hz),30 语种 + 22 种中文方言,支持离线/流式(最长 1200s),歌声+带 BGM 歌曲都能转。
  • Qwen3-ASR-0.6B:结构同比例缩小(编码器 180M),主打端侧与高并发,平均 TTFT 92ms,128 并发 RTF 0.064(等效每秒吞 2000s 音频)。
  • Qwen3-ForcedAligner-0.6B:LLM 基 NAR 槽位填充对齐器,覆盖 11 语种,词/字/句/段级时间戳灵活输出,AuT 帧 80ms 离散化,预测 [time] 槽位索引。

2、训练流水线

训练流水线(四段)

  1. AuT 编码器预训练:~4000 万小时伪标数据,AED 框架。

  2. Omni 预训练:继承 Qwen3-Omni 多模态 3T token 能力。

  3. ASR SFT:格式化成 language XXX<asr_text>...,刻意做成"不接自然语言指令"的纯 ASR 模式,防指令注入;引入流式增强、context biasing。

  4. ASR RL:GSPO 策略优化,5 万 utt(中英文 35% / 多语种 35% / 功能 30%),专治噪声鲁棒与难例。

3、ForcedAligner 关键设计

ForcedAligner 关键设计
在这里插入图片描述

  • 放弃 next-token 偏移训练,改用 causal 非偏移训练,槽位与标签对齐,交叉熵只算在 [time] 上。
  • 用 MFA 伪标蒸馏+平滑,不照搬 MFA 的系统偏移。
  • 动态槽位插入增强泛化;推理时 NAR 一次性填所有槽,索引×80ms 还原时间。

三、实验结果

中英与方言(表 3)
在这里插入图片描述

  • 英文:1.7B 在 GigaSpeech 8.45、CV-en 7.39、VoxPopuli 9.15,整体逼近/超过 GPT-4o-Transcribe 与 Gemini-2.5-Pro,LibriSpeech other 3.38 优于 Whisper-large-v3 的 3.97。
  • 中文:WenetSpeech net/meeting 4.97/5.88(CER),明显甩开 Whisper(9.86/19.11);KeSpeech 方言 5.10,粤语 CV-yue 7.57。
  • 0.6B 版本在同尺寸开源里基本是最强,如 WenetSpeech 5.97/6.88。

内部鲁棒集(表 4)

  • 重口音英文 WER 16.07(1.7B)vs Doubao 20.41 / Whisper 21.30。
  • 极端噪声 16.17、绕口令 2.44、老人小孩 3.81、多方言对话 15.94——全部第一。

多语种 + LID(表 5、6)

  • Fleurs 12 语种 WER 4.90(1.7B)vs Whisper 5.27;Fleurs++ 30 语种退到 12.60 但仍优于其他开源。
  • LID 准确率平均 97.9%(Whisper 94.1%),剩的错主要是 ms/id 混淆。

歌声与整歌(表 7)

  • M4Singer 5.98、Opencpop 3.08、整首英文歌 14.60、整首中文歌 13.91;Whisper 和 FunASR-MLT-Nano 在"整歌+BGM"直接 N/A(长度/崩坏)。

流式(表 8)

  • 2s chunk 流式相对离线略有退化(如 1.7B LibriSpeech other 3.38→4.51),但绝对水平仍能打。

强制对齐(表 9)

  • AAS(累计平均偏移 ms)在人标集平均 32.4ms,MFA/NFA/WhisperX 在 101~141ms;300s 拼接长音频下对手飙到 2708ms(WhisperX)或 246ms(NFA),Qwen 仍 52.9ms。相对偏移降 67%~77%。

效率(表 2)

  • 0.6B @128 并发:TTFT avg 92ms,throughput 2000×实时。
  • ForcedAligner 0.6B RTF 可到 ~0.001 级,1 秒处理 1000s 音频。

四、分析

  • 为什么准:不是单纯堆数据,而是 Omni 多模态底座给"语义先验"+ RL 阶段专补真实脏数据,所以公开集没拉开时,内部噪声/方言/歌声集优势放大。
  • 小模型能打:0.6B 靠 AuT 编码器(180M)把声学表征先压住,LLM 部分只做语言决策,参数分配比 Whisper 式全量 decoder 更省。
  • 对齐器是真创新:把 FA 从"音素字典+对齐工具"变成"LLM 槽位填充",跨语种不用重训、长音频不漂移、NAR 推理快;代价是依赖 MFA 伪标起点,极低频语种仍可能受伪标上限约束。
  • 局限:30 语种全开时 1.7B 在 Fleurs++ 仍比 Whisper 掉得多,说明长尾语种数据覆盖还不够;ForcedAligner 目前 11 语种、300s 上限,再长要切片。
  • 定位:1.7B 对标商用 API 闭源顶线,0.6B 吃端侧/高并发,ForcedAligner 补字幕/标注基建——三者组合等于把"识别—语言判定—时间戳"一条龙开源化了。

更多推荐