开源版 ElevenLabs 替代品

实时听写、零样本语音复刻、电影级视频配音——全部在桌面端完成。
开源、无需 API 密钥、完全本地运行。支持 646 种语言。

功能

🎙️ 语音复刻3 秒音频 → 复制任何声音。
646 种语言,零样本。
🎨 声音设计性别、年龄、口音、音高、语速、
情感、方言——随心调节
🎬 视频配音YouTube 链接或文件 → 转录 →
翻译 → 重新配音 → MP4
⌨️ 听写工具从任何应用中按 ⌘+⇧+Space
转录、自动粘贴、无痕消失。
🔊 人声分离基于 Demucs。从背景音乐中
分离人声,保留背景音
👥 说话人分离Pyannote + WhisperX。
自动识别谁说了什么。
📦 批量队列一次拖入 50 个视频,然后离开。
每个任务有进度条。
🤖 MCP 服务器从 Claude、Cursor 或
任何 MCP 客户端使用 OmniVoice。
🛡️ AI 水印AudioSeal(Meta)。不可见
能抵抗压缩。
🔐 完全本地无需密钥、云端、账号。
仅限你的设备
⚡ GPU 自动检测CUDA · MPS · ROCm · CPU。
显存 ≤8 GB?自动卸载
🧩 可扩展继承 TTSBackend
约 50 行代码添加任意引擎。

系统要求

最低配置 推荐配置
操作系统 Windows 10, macOS 12+, Ubuntu 20.04+ 任意现代 64 位操作系统
内存 8 GB 16 GB+
显存(GPU) 4 GB(自动将 TTS 卸载到 CPU) 8 GB+(NVIDIA RTX 3060+)
硬盘 10 GB 可用空间(模型 + 缓存) 20 GB+ SSD
Python 3.10+(由 uv 管理) 3.11–3.12
GPU 可选——CPU 可用 NVIDIA CUDA · Apple Silicon MPS · AMD ROCm

Tip

对于显存 ≤8 GB 的 GPU,OmniVoice 会在转录期间自动将 TTS 卸载到 CPU——无需配置。不需要专用 GPU;整个流程可在 CPU 上运行(只是速度较慢)。

TTS 引擎

OmniVoice 配备多引擎 TTS 后端。默认引擎(OmniVoice)始终可用;其他引擎可选装并自动检测。在 设置 → TTS 引擎 中切换引擎,或通过 OMNIVOICE_TTS_BACKEND 环境变量设置。

引擎 语言 克隆 指令 Linux macOS ARM Windows 许可证
OmniVoice(默认) 600+ ✅ CUDA/CPU ✅ MPS ✅ CUDA/CPU 内置
CosyVoice 3 9 + 18 种方言 ✅ CUDA/CPU ✅ MPS ✅ CUDA/CPU Apache-2.0
MLX-Audio(Kokoro, Qwen3-TTS, CSM, Dia 等) 多语言 因引擎而异 因引擎而异 ✅ 原生 因引擎而异
VoxCPM2 30 ✅ CUDA/CPU ✅ MPS ✅ CUDA/CPU Apache-2.0
MOSS-TTS-Nano 20 ✅ CUDA/CPU ✅ CPU ✅ CUDA/CPU Apache-2.0
KittenTTS 英语 ✅ CPU ✅ CPU ✅ CPU MIT

CUDA = GPU 加速 · MPS = Apple Silicon Metal · CPU = 随处可运行,大模型较慢 · KittenTTS 和 MOSS-TTS-Nano 可在 CPU 上实时运行 · MLX-Audio 仅限 Apple Silicon。

下载地址:
资源荟萃

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐