Qwen-Audio-3.0-TTS与Qwen3-TTS
Qwen-Audio-3.0-TTS是阿里云新推出的语音合成模型,核心特点是能听懂“人话”指令,让AI说话带有情绪和风格。它主要通过阿里云百炼平台以API方式调用。
🚀 如何使用(以Python为例)
模型通过阿里云的DashScope SDK调用。基础流程如下:
- 安装SDK:
pip install dashscope - 准备API Key:从阿里云百炼控制台获取,并配置环境变量
DASHSCOPE_API_KEY。 - 编写代码:
import os
import dashscope
from dashscope.audio.tts_v2 import *
# 1. 配置API Key (建议从环境变量读取)
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')
# 2. 选择模型和音色
# 模型: qwen-audio-3.0-tts-flash (实时) 或 qwen-audio-3.0-tts-plus (高质量)
model = "qwen-audio-3.0-tts-flash"
# 音色: 系统音色如 longanhuan_v3.6,或从音色列表中选取
voice = "longanhuan_v3.6"
# 3. 创建合成器并生成语音
synthesizer = SpeechSynthesizer(model=model, voice=voice)
text = "今天天气真好,我们去公园散步吧!"
# 如果需要控制情绪,可以通过 instruction 参数
# instruction = "用开心、轻快的语气说"
# synthesizer = SpeechSynthesizer(model=model, voice=voice, instruction=instruction)
audio = synthesizer.call(text)
# 4. 保存音频到本地
with open('output.mp3', 'wb') as f:
f.write(audio)
🎤 核心功能与参数
- 双版本选择:实时交互用Flash(首包延时300ms级别),内容创作等追求音质用Plus(48kHz采样率)。
- 细粒度情绪控制:在文本中插入
[angry]、[giggles]等标签,精准控制某句话甚至某个词的情绪和语气。 - Freestyle指令:用自然语言描述想要的风格,例如“用悬疑剧旁白的语气,紧张一点”。
- 多语种与方言:支持中、英、日、韩、德等16种语言,以及广东话、四川话等20种中文方言。
- 音色库:提供超过1000种基础音色(含系统音色和基础音色列表)。
- 可调参数:支持调整语速(
speed)、音调(pitch)、音量(volume)和输出格式(response_format)。
💡 应用场景
- 实时交互:智能语音助手、车载语音、实时客服(推荐Flash版本)。
- 内容创作:有声书、播客、课程配音(推荐Plus版本)。
- 娱乐与泛社交:游戏角色配音、虚拟主播、情感陪伴。
你是打算用在实时语音助手这类低延迟场景,还是在做有声内容创作?告诉我你的具体用途,我帮你推荐最合适的版本和音色配置。
好的,这里有个关键点需要先说清楚——Qwen-Audio-3.0-TTS 和 Qwen3-TTS 是两个不同的产品线,容易搞混:
重要区分
| Qwen-Audio-3.0-TTS | Qwen3-TTS | |
|---|---|---|
| 性质 | 闭源,仅限阿里云百炼(DashScope) API 调用 | 开源,权重可下载 |
| 能否本地部署 | 不能,没有开放权重 | 可以,HuggingFace/ModelScope 有完整权重 |
| 发布时间 | 2026年7月 | 2026年1月 |
本次发布的 Qwen-Audio-3.0-TTS Flash 与 Plus 是通过阿里云百炼平台调用的闭源 API 模型,此前 Qwen 团队曾在 2026 年初开源过 Qwen3-TTS 系列,两者是不同产品线。所以严格来说,“qwen-audio-3.0-tts 本地部署” 是做不到的——只能调 API。下面分两部分说。
一、Qwen-Audio-3.0-TTS(API方式,无法本地部署)
模型地址(DashScope Model ID):qwen-audio-3.0-tts-flash(低延迟,首包约300ms)/ qwen-audio-3.0-tts-plus(高质量,在 Artificial Analysis 榜单夺冠)
非实时调用示例(HTTP):
curl -X POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/SpeechSynthesizer -H “Authorization: Bearer $DASHSCOPE_API_KEY” -H “Content-Type: application/json” -d ‘{ “model”: “qwen-audio-3.0-tts-flash”, “input”: { “text”: “我家的后面有一个很大的花园。”, “voice”: “longanhuan_v3.6”, “format”: “wav”, “sample_rate”: 24000 } }’
实时流式(WebSocket,Python SDK 示例):
# coding=utf-8
import os
import dashscope
from dashscope.audio.tts_v2 import *
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')
# 新加坡地域示例,北京地域另有默认地址
dashscope.base_websocket_api_url = 'wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'
model = "qwen-audio-3.0-tts-flash" # 或 qwen-audio-3.0-tts-plus
voice = "longanlingxi"
synthesizer = SpeechSynthesizer(model=model, voice=voice)
audio = synthesizer.call("你好,欢迎使用通义千问语音合成。")
with open("output.wav", "wb") as f:
f.write(audio)
Qwen-Audio-TTS 和 CosyVoice 使用相同的 WebSocket 协议,只需替换 model 和 voice 参数。SDK 还提供 Java、Go、C#、PHP、Node.js 版本。
应用场景:支持声音克隆、预设音色、自然语言风格/指令控制,以及细粒度的行内情感/非语言标签,覆盖16种语言和20个中文方言区,长文本一次性合成约3分钟;Flash 适合实时语音助手/对话,Plus 适合有声书、数字人、影视配音等质量优先场景。
二、如果你真的需要"本地部署"——用开源的 Qwen3-TTS
这是唯一能在本地跑起来的同系列模型。
模型地址:
- HuggingFace:
Qwen/Qwen3-TTS-12Hz-1.7B-Base(克隆)/-CustomVoice(预设音色+指令)/-VoiceDesign(文本生成新音色),另有 0.6B 轻量版 - ModelScope(国内推荐):同名仓库
下载:
# ModelScope(国内推荐)
pip install -U modelscope
modelscope download --model Qwen/Qwen3-TTS-Tokenizer-12Hz --local_dir ./Qwen3-TTS-Tokenizer-12Hz
modelscope download --model Qwen/Qwen3-TTS-12Hz-1.7B-Base --local_dir ./Qwen3-TTS-12Hz-1.7B-Base
# 或 HuggingFace
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-Base --local-dir ./Qwen3-TTS-12Hz-1.7B-Base
安装与推理代码:
conda create -n qwen3-tts python=3.12 -y
conda activate qwen3-tts
pip install -U qwen-tts
pip install -U flash-attn --no-build-isolation # 可选,减少显存占用
import torch
import soundfile as sf
from qwen_tts import Qwen3TTSModel
model = Qwen3TTSModel.from_pretrained(
"Qwen/Qwen3-TTS-12Hz-1.7B-Base",
device_map="cuda:0",
dtype=torch.bfloat16,
attn_implementation="flash_attention_2",
)
wavs, sr = model.generate_voice_clone(
text="你想让 AI 说的话",
language="Chinese",
ref_audio="你的参考音频.wav", # 3秒左右干净语音即可
ref_text="参考音频对应的文本",
)
sf.write("output.wav", wavs[0], sr)
也有一键启动的 WebUI 项目(如 qwen-tts-webui、Qwen3-TTS-studio),显存占用低至几 GB,适合消费级显卡。
需要我帮你写一个更完整的本地部署脚本(比如带 Gradio 界面),还是需要 Qwen-Audio-3.0-TTS 的完整 API 调用封装?
两者效果差距还是比较明显的,Qwen-Audio-3.0-TTS 作为新一代闭源商用模型,在质量上明显领先自家的开源版本。具体来看:
客观榜单表现
- Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis Speech Arena(第三方语音竞技场榜单)中登顶,Elo 得分 1234,基于1517个样本、8种供应商声音的对比;第二名 SpeechifyAI 的 Simba 3.2 为1230分,仅相差4分,Google Gemini 3.1 Flash TTS 为1215分排第三
- Qwen3-TTS(开源版)没有进入这个第三方竞技场榜单的记录,说明其质量对标的是开源生态里的其他方案(如 CosyVoice、IndexTTS 等),而不是和顶级商用模型正面竞争
具体指标对比
Qwen-Audio-3.0-TTS 家族在16种语言中的10种上取得了最佳的 WER/CER(识别错误率),Flash 版本平均 WER/CER 低至3.87,Plus 为3.96,均优于对比的其他系统;在音色相似度上,Plus 版本在全部16种语言上排名第一,平均相似度达82.75,Flash 为80.44,这是官方博客给出的内部对比数据(对比对象包括同类商用模型)。
语言覆盖
Qwen-Audio-3.0-TTS 支持16种语言+20个中文方言区,而 Qwen3-TTS 官方页面标注的是10种主要语言,前者语言覆盖面明显更广(尤其新增了5种东南亚语言,覆盖印尼、越南、泰国、菲律宾等西方TTS厂商长期忽视的市场)。
主观体验(第三方实测)
有实测者表示语音自然度和标签控制效果都不错,声音克隆质量也较好;虽然没做严谨的发音精度评测,但相比之前试用 Qwen3-TTS 时的印象,明显感觉质量有所提升,认为这符合"商用模型"该有的水准。
速度上的短板
不过 Plus 版本有个明显缺点:吞吐量大约只有每秒16个字符,相比 Sonic 3.5 的120字符/秒慢了很多——对于逐句生成的语音助手场景影响不大,但批量生成长文本时会比较慢。
一句话总结
| 维度 | Qwen-Audio-3.0-TTS | Qwen3-TTS |
|---|---|---|
| 整体质量 | 更高(商用SOTA级别,登顶第三方榜单) | 良好,开源里算强,但不对标顶级商用模型 |
| 语言覆盖 | 16语言+20方言 | 10语言+部分方言 |
| 生成速度 | Plus较慢(~16字符/秒),Flash较快 | 本地跑,97ms超低延迟(流式) |
| 成本 | 按量付费,但比 ElevenLabs 便宜约72% | 免费(仅算力成本) |
| 可控性 | 更细粒度(86种行内标签+自由指令) | 支持指令控制,标签种类较少 |
| 部署方式 | 只能调API,无法本地化、无法离线 | 可完全本地部署,数据不出本地 |
简单说:如果你要最好的效果、多语言(尤其方言/东南亚语种)、且不介意用API和付费,选 Qwen-Audio-3.0-TTS;如果你需要离线部署、免费、数据隐私(比如你之前做的语文考试系统这种教育场景,涉及学生数据),Qwen3-TTS 本地版更合适——毕竟质量差距不算断层式的,本地部署省心不少。
更多推荐



所有评论(0)