LongCat团队发布文本转语音大模型1B/3.5B双选
·

一、 LongCat-AudioDiT概览
LongCat-AudioDiT是由美团LongCat团队发布的一个先进的文本转语音模型。其核心定位是一个非自回归的、基于扩散模型的TTS系统,并在多项指标上达到了当时的最先进性能。
1. 核心创新与优势:
- 直接操作于波形潜在空间:与以往主流方法(如F5-TTS, E2-TTS等)需要先预测梅尔频谱图,再用声码器转换为波形不同,LongCat直接在一个由波形变分自编码器学习到的连续潜在空间中进行建模和生成。这避免了“预测梅尔谱”和“梅尔谱转波形”这两个步骤可能产生的复合误差,简化了流程。
- 简化的端到端架构:整个系统仅由两个核心组件构成:
- 波形变分自编码器:将原始音频波形压缩为一个低维、连续的潜在表示。
- 扩散Transformer主干:在该潜在空间中,根据文本条件生成目标语音的潜在表示。
- 卓越的零样本语音克隆能力:在权威的Seed基准测试中,其最大版本(3.5B参数)在说话人相似度指标上超越了之前的SOTA模型(如Seed-TTS)。例如,在Seed-ZH上,SIM分数从0.809提升至0.818;在更难的Seed-Hard数据集上,从0.776提升至0.797。
- 两项关键的推理改进:
- 识别并修正了长期存在的训练-推理不匹配问题。
- 用自适应投影引导 替代了传统的分类器无关引导,以提升生成质量并减少伪影。
LongCat-AudioDiT在Seed基准测试上实现了SOTA的零样本语音克隆性能,同时保持了有竞争力的可懂度。这验证了其“波形潜在空间建模”这一核心设计的优越性。
3. 资源开放:
团队已开源代码和模型权重(1B和3.5B参数版本),以促进社区研究。
- GitHub仓库:
https://github.com/meituan-longcat/LongCat-AudioDiT - Hugging Face模型:
- 3.5B:
https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B - 1B:
https://huggingface.co/meituan-longcat/LongCat-AudioDiT-1B

- 3.5B:
二、 技术原理详解
LongCat-AudioDiT的架构,其原理可分为三个核心部分:
1. 波形变分自编码器
Wav-VAE的目标是将高维的原始音频波形(如24kHz采样率)压缩到一个低维、连续的潜在空间,同时保留重建高保真音频所需的所有信息。
- 架构:采用全卷积编码器-解码器结构。编码器通过分层下采样(使用Oobleck块和特殊的无参数快捷路径来稳定训练)将波形映射为潜在序列
z。解码器则以对称的方式将z上采样重建为波形。 - 关键参数:潜在维度
D和下采样因子R。论文通过大量消融实验发现,并非Wav-VAE的重建质量越高,下游TTS性能就越好。存在一个最优的权衡点。最终他们采用的默认配置是D=64, 帧率FPS=11.72 Hz。 - 训练目标:采用两阶段对抗训练,损失函数包含多分辨率STFT损失、多尺度梅尔损失、时域L1损失、KL散度损失以及对抗损失和特征匹配损失。
2. 扩散TTS主干
这是模型的核心生成器,在Wav-VAE定义的潜在空间中操作。
- 生成范式:采用条件流匹配(Conditional Flow Matching, CFM)框架,将其建模为一个常微分方程。它学习一个速度场,用于将高斯噪声
z0确定性地“流动”到目标语音潜在z1。这种方法比基于SDE的传统扩散模型公式更简单。 - 网络架构:基于扩散Transformer, 使用标准的Transformer骨干。通过交叉注意力机制隐式学习文本-语音对齐,无需额外的时长预测器。采用了AdaLN注入时间步条件、QK-Norm、RoPE位置编码等技术。
- 多语言文本编码:使用UMT5-base作为文本编码器。一个关键创新是,不仅使用其最后一层隐藏状态,还融合了原始词嵌入,以同时捕获高层次语义和低层次音素线索,这被证明对可懂度至关重要。
- 零样本语音克隆机制:在训练时,随机掩码部分语音潜在
z1作为上下文提示z_ctx输入给模型,使其学会在给定一段参考语音(提示)的情况下补全剩余部分,从而获得了零样本语音克隆能力。
3. 两项关键的推理改进
这是论文的重点贡献之一,显著提升了实际生成质量。
- 解决训练-推理不匹配:
- 问题:在训练时,整个噪声潜在轨迹
z_t(包括提示部分和生成部分)都是通过线性插值公式(3)精确构造的。但在推理时,由于CFM损失只计算在生成区域,模型对提示区域的速度预测是未被约束的,导致z_t的提示部分在迭代中逐渐偏离其应有的轨迹,产生不匹配。 - 解决方案:在推理的每一步,都强制用公式(7)的理论值覆盖
z_t的提示部分,确保其始终与训练时的分布一致。
- 问题:在训练时,整个噪声潜在轨迹
- 用自适应投影引导替代分类器无关引导:
- 问题:传统的CFG在强度较大时可能导致“过饱和”现象,产生听觉伪影。
- 解决方案:采用APG。其核心思想是将CFG的引导残差分解为平行和正交于当前条件预测的两个分量。理论表明,平行分量是导致过饱和的主因。APG通过选择性抑制平行分量(默认阻尼因子 η=0.5),同时保留正交分量的引导作用,从而在提升质量的同时避免了伪影。论文还结合了负动量的技巧。
三、 部署与使用方式
项目提供了Hugging Face兼容的实现。
基本部署步骤可能包括如下流程:
- 环境准备:克隆GitHub仓库,并按照
requirements.txt安装依赖库(如PyTorch, Transformers, Hugging Face Hub等)。 - 获取模型:可以直接从Hugging Face Hub加载模型和处理器。代码中很可能提供了类似于以下的便捷方式:
from transformers import AutoProcessor, AutoModel processor = AutoProcessor.from_pretrained(“meituan-longcat/LongCat-AudioDiT-1B“) model = AutoModel.from_pretrained(“meituan-longcat/LongCat-AudioDiT-1B“) - 语音合成:使用加载的模型和处理器进行推理。通常需要提供文本和一段参考音频(用于语音克隆)。
# 伪代码示例 text = “你好,欢迎体验长猫语音合成模型。“ # 加载或录制一段参考音频 prompt_audio, sampling_rate = load_audio(”reference.wav“) # 预处理:提取参考音频的潜在提示,处理文本 inputs = processor(text=text, prompt_audio=prompt_audio, sampling_rate=sampling_rate, ...) # 模型生成 with torch.no_grad(): generated_audio = model.generate(**inputs) # 保存结果 save_audio(”output.wav“, generated_audio, sampling_rate) - 高级配置:您可能可以在推理时调整一些参数,如CFG/APG的引导强度、扩散步数等,以在质量、速度和多样性之间进行权衡。
LongCat-AudioDiT是一个设计精巧、性能强大的TTS模型。它通过“波形潜在空间扩散生成”这一核心路径,简化了系统架构,有效避免了复合误差,从而在零样本语音克隆任务上取得了突破性进展。其开源的代码和模型为研究者和开发者提供了一个优秀的基线,可用于进一步的研究、应用和开发。
更多推荐
所有评论(0)