Qwen-Audio-3.0-TTS是阿里云新推出的语音合成模型,核心特点是能听懂“人话”指令,让AI说话带有情绪和风格。它主要通过阿里云百炼平台以API方式调用。

🚀 如何使用(以Python为例)

模型通过阿里云的DashScope SDK调用。基础流程如下:

  1. 安装SDKpip install dashscope
  2. 准备API Key:从阿里云百炼控制台获取,并配置环境变量DASHSCOPE_API_KEY
  3. 编写代码
import os
import dashscope
from dashscope.audio.tts_v2 import *

# 1. 配置API Key (建议从环境变量读取)
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')

# 2. 选择模型和音色
# 模型: qwen-audio-3.0-tts-flash (实时) 或 qwen-audio-3.0-tts-plus (高质量)
model = "qwen-audio-3.0-tts-flash" 
# 音色: 系统音色如 longanhuan_v3.6,或从音色列表中选取
voice = "longanhuan_v3.6" 

# 3. 创建合成器并生成语音
synthesizer = SpeechSynthesizer(model=model, voice=voice)
text = "今天天气真好,我们去公园散步吧!"

# 如果需要控制情绪,可以通过 instruction 参数
# instruction = "用开心、轻快的语气说"
# synthesizer = SpeechSynthesizer(model=model, voice=voice, instruction=instruction)

audio = synthesizer.call(text)

# 4. 保存音频到本地
with open('output.mp3', 'wb') as f:
    f.write(audio)

🎤 核心功能与参数

  • 双版本选择:实时交互用Flash(首包延时300ms级别),内容创作等追求音质用Plus(48kHz采样率)。
  • 细粒度情绪控制:在文本中插入[angry][giggles]等标签,精准控制某句话甚至某个词的情绪和语气。
  • Freestyle指令:用自然语言描述想要的风格,例如“用悬疑剧旁白的语气,紧张一点”。
  • 多语种与方言:支持中、英、日、韩、德等16种语言,以及广东话、四川话等20种中文方言
  • 音色库:提供超过1000种基础音色(含系统音色和基础音色列表)。
  • 可调参数:支持调整语速(speed)、音调(pitch)、音量(volume)和输出格式(response_format)。

💡 应用场景

  • 实时交互:智能语音助手、车载语音、实时客服(推荐Flash版本)。
  • 内容创作:有声书、播客、课程配音(推荐Plus版本)。
  • 娱乐与泛社交:游戏角色配音、虚拟主播、情感陪伴。

你是打算用在实时语音助手这类低延迟场景,还是在做有声内容创作?告诉我你的具体用途,我帮你推荐最合适的版本和音色配置。

好的,这里有个关键点需要先说清楚——Qwen-Audio-3.0-TTS 和 Qwen3-TTS 是两个不同的产品线,容易搞混:

重要区分

Qwen-Audio-3.0-TTS Qwen3-TTS
性质 闭源,仅限阿里云百炼(DashScope) API 调用 开源,权重可下载
能否本地部署 不能,没有开放权重 可以,HuggingFace/ModelScope 有完整权重
发布时间 2026年7月 2026年1月

本次发布的 Qwen-Audio-3.0-TTS Flash 与 Plus 是通过阿里云百炼平台调用的闭源 API 模型,此前 Qwen 团队曾在 2026 年初开源过 Qwen3-TTS 系列,两者是不同产品线。所以严格来说,“qwen-audio-3.0-tts 本地部署” 是做不到的——只能调 API。下面分两部分说。


一、Qwen-Audio-3.0-TTS(API方式,无法本地部署)

模型地址(DashScope Model ID)qwen-audio-3.0-tts-flash(低延迟,首包约300ms)/ qwen-audio-3.0-tts-plus(高质量,在 Artificial Analysis 榜单夺冠)

非实时调用示例(HTTP)
curl -X POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/SpeechSynthesizer -H “Authorization: Bearer $DASHSCOPE_API_KEY” -H “Content-Type: application/json” -d ‘{ “model”: “qwen-audio-3.0-tts-flash”, “input”: { “text”: “我家的后面有一个很大的花园。”, “voice”: “longanhuan_v3.6”, “format”: “wav”, “sample_rate”: 24000 } }’

实时流式(WebSocket,Python SDK 示例)

# coding=utf-8
import os
import dashscope
from dashscope.audio.tts_v2 import *

dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')
# 新加坡地域示例,北京地域另有默认地址
dashscope.base_websocket_api_url = 'wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'

model = "qwen-audio-3.0-tts-flash"   # 或 qwen-audio-3.0-tts-plus
voice = "longanlingxi"

synthesizer = SpeechSynthesizer(model=model, voice=voice)
audio = synthesizer.call("你好,欢迎使用通义千问语音合成。")
with open("output.wav", "wb") as f:
    f.write(audio)

Qwen-Audio-TTS 和 CosyVoice 使用相同的 WebSocket 协议,只需替换 model 和 voice 参数。SDK 还提供 Java、Go、C#、PHP、Node.js 版本。

应用场景:支持声音克隆、预设音色、自然语言风格/指令控制,以及细粒度的行内情感/非语言标签,覆盖16种语言和20个中文方言区,长文本一次性合成约3分钟;Flash 适合实时语音助手/对话,Plus 适合有声书、数字人、影视配音等质量优先场景。


二、如果你真的需要"本地部署"——用开源的 Qwen3-TTS

这是唯一能在本地跑起来的同系列模型。

模型地址

  • HuggingFace: Qwen/Qwen3-TTS-12Hz-1.7B-Base(克隆)/ -CustomVoice(预设音色+指令)/ -VoiceDesign(文本生成新音色),另有 0.6B 轻量版
  • ModelScope(国内推荐):同名仓库

下载

# ModelScope(国内推荐)
pip install -U modelscope
modelscope download --model Qwen/Qwen3-TTS-Tokenizer-12Hz --local_dir ./Qwen3-TTS-Tokenizer-12Hz
modelscope download --model Qwen/Qwen3-TTS-12Hz-1.7B-Base --local_dir ./Qwen3-TTS-12Hz-1.7B-Base

# 或 HuggingFace
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-Base --local-dir ./Qwen3-TTS-12Hz-1.7B-Base

安装与推理代码

conda create -n qwen3-tts python=3.12 -y
conda activate qwen3-tts
pip install -U qwen-tts
pip install -U flash-attn --no-build-isolation   # 可选,减少显存占用
import torch
import soundfile as sf
from qwen_tts import Qwen3TTSModel

model = Qwen3TTSModel.from_pretrained(
    "Qwen/Qwen3-TTS-12Hz-1.7B-Base",
    device_map="cuda:0",
    dtype=torch.bfloat16,
    attn_implementation="flash_attention_2",
)

wavs, sr = model.generate_voice_clone(
    text="你想让 AI 说的话",
    language="Chinese",
    ref_audio="你的参考音频.wav",  # 3秒左右干净语音即可
    ref_text="参考音频对应的文本",
)
sf.write("output.wav", wavs[0], sr)

也有一键启动的 WebUI 项目(如 qwen-tts-webuiQwen3-TTS-studio),显存占用低至几 GB,适合消费级显卡。

需要我帮你写一个更完整的本地部署脚本(比如带 Gradio 界面),还是需要 Qwen-Audio-3.0-TTS 的完整 API 调用封装?

两者效果差距还是比较明显的,Qwen-Audio-3.0-TTS 作为新一代闭源商用模型,在质量上明显领先自家的开源版本。具体来看:

客观榜单表现

  • Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis Speech Arena(第三方语音竞技场榜单)中登顶,Elo 得分 1234,基于1517个样本、8种供应商声音的对比;第二名 SpeechifyAI 的 Simba 3.2 为1230分,仅相差4分,Google Gemini 3.1 Flash TTS 为1215分排第三
  • Qwen3-TTS(开源版)没有进入这个第三方竞技场榜单的记录,说明其质量对标的是开源生态里的其他方案(如 CosyVoice、IndexTTS 等),而不是和顶级商用模型正面竞争

具体指标对比

Qwen-Audio-3.0-TTS 家族在16种语言中的10种上取得了最佳的 WER/CER(识别错误率),Flash 版本平均 WER/CER 低至3.87,Plus 为3.96,均优于对比的其他系统;在音色相似度上,Plus 版本在全部16种语言上排名第一,平均相似度达82.75,Flash 为80.44,这是官方博客给出的内部对比数据(对比对象包括同类商用模型)。

语言覆盖

Qwen-Audio-3.0-TTS 支持16种语言+20个中文方言区,而 Qwen3-TTS 官方页面标注的是10种主要语言,前者语言覆盖面明显更广(尤其新增了5种东南亚语言,覆盖印尼、越南、泰国、菲律宾等西方TTS厂商长期忽视的市场)。

主观体验(第三方实测)

有实测者表示语音自然度和标签控制效果都不错,声音克隆质量也较好;虽然没做严谨的发音精度评测,但相比之前试用 Qwen3-TTS 时的印象,明显感觉质量有所提升,认为这符合"商用模型"该有的水准。

速度上的短板

不过 Plus 版本有个明显缺点:吞吐量大约只有每秒16个字符,相比 Sonic 3.5 的120字符/秒慢了很多——对于逐句生成的语音助手场景影响不大,但批量生成长文本时会比较慢。

一句话总结

维度 Qwen-Audio-3.0-TTS Qwen3-TTS
整体质量 更高(商用SOTA级别,登顶第三方榜单) 良好,开源里算强,但不对标顶级商用模型
语言覆盖 16语言+20方言 10语言+部分方言
生成速度 Plus较慢(~16字符/秒),Flash较快 本地跑,97ms超低延迟(流式)
成本 按量付费,但比 ElevenLabs 便宜约72% 免费(仅算力成本)
可控性 更细粒度(86种行内标签+自由指令) 支持指令控制,标签种类较少
部署方式 只能调API,无法本地化、无法离线 可完全本地部署,数据不出本地

简单说:如果你要最好的效果、多语言(尤其方言/东南亚语种)、且不介意用API和付费,选 Qwen-Audio-3.0-TTS如果你需要离线部署、免费、数据隐私(比如你之前做的语文考试系统这种教育场景,涉及学生数据),Qwen3-TTS 本地版更合适——毕竟质量差距不算断层式的,本地部署省心不少。

更多推荐