[特殊字符]️免费本地离线 AI 语音复刻 无需 API 密钥、完全本地运行 支持 646 种语言
·
开源版 ElevenLabs 替代品
实时听写、零样本语音复刻、电影级视频配音——全部在桌面端完成。
开源、无需 API 密钥、完全本地运行。支持 646 种语言。
功能
| 🎙️ 语音复刻3 秒音频 → 复制任何声音。 646 种语言,零样本。 |
🎨 声音设计性别、年龄、口音、音高、语速、 情感、方言——随心调节。 |
🎬 视频配音YouTube 链接或文件 → 转录 → 翻译 → 重新配音 → MP4。 |
⌨️ 听写工具从任何应用中按 ⌘+⇧+Space。转录、自动粘贴、无痕消失。 |
🔊 人声分离基于 Demucs。从背景音乐中 分离人声,保留背景音。 |
👥 说话人分离Pyannote + WhisperX。 自动识别谁说了什么。 |
| 📦 批量队列一次拖入 50 个视频,然后离开。 每个任务有进度条。 |
🤖 MCP 服务器从 Claude、Cursor 或 任何 MCP 客户端使用 OmniVoice。 |
🛡️ AI 水印AudioSeal(Meta)。不可见, 能抵抗压缩。 |
| 🔐 完全本地无需密钥、云端、账号。 仅限你的设备。 |
⚡ GPU 自动检测CUDA · MPS · ROCm · CPU。 显存 ≤8 GB?自动卸载。 |
🧩 可扩展继承 TTSBackend,约 50 行代码添加任意引擎。 |
系统要求
| 最低配置 | 推荐配置 | |
|---|---|---|
| 操作系统 | Windows 10, macOS 12+, Ubuntu 20.04+ | 任意现代 64 位操作系统 |
| 内存 | 8 GB | 16 GB+ |
| 显存(GPU) | 4 GB(自动将 TTS 卸载到 CPU) | 8 GB+(NVIDIA RTX 3060+) |
| 硬盘 | 10 GB 可用空间(模型 + 缓存) | 20 GB+ SSD |
| Python | 3.10+(由 uv 管理) |
3.11–3.12 |
| GPU | 可选——CPU 可用 | NVIDIA CUDA · Apple Silicon MPS · AMD ROCm |
Tip
对于显存 ≤8 GB 的 GPU,OmniVoice 会在转录期间自动将 TTS 卸载到 CPU——无需配置。不需要专用 GPU;整个流程可在 CPU 上运行(只是速度较慢)。
TTS 引擎
OmniVoice 配备多引擎 TTS 后端。默认引擎(OmniVoice)始终可用;其他引擎可选装并自动检测。在 设置 → TTS 引擎 中切换引擎,或通过 OMNIVOICE_TTS_BACKEND 环境变量设置。
| 引擎 | 语言 | 克隆 | 指令 | Linux | macOS ARM | Windows | 许可证 |
|---|---|---|---|---|---|---|---|
| OmniVoice(默认) | 600+ | ✅ | ✅ | ✅ CUDA/CPU | ✅ MPS | ✅ CUDA/CPU | 内置 |
| CosyVoice 3 | 9 + 18 种方言 | ✅ | ✅ | ✅ CUDA/CPU | ✅ MPS | ✅ CUDA/CPU | Apache-2.0 |
| MLX-Audio(Kokoro, Qwen3-TTS, CSM, Dia 等) | 多语言 | 因引擎而异 | 因引擎而异 | ❌ | ✅ 原生 | ❌ | 因引擎而异 |
| VoxCPM2 | 30 | ✅ | ✅ | ✅ CUDA/CPU | ✅ MPS | ✅ CUDA/CPU | Apache-2.0 |
| MOSS-TTS-Nano | 20 | ✅ | ❌ | ✅ CUDA/CPU | ✅ CPU | ✅ CUDA/CPU | Apache-2.0 |
| KittenTTS | 英语 | ❌ | ❌ | ✅ CPU | ✅ CPU | ✅ CPU | MIT |
CUDA = GPU 加速 · MPS = Apple Silicon Metal · CPU = 随处可运行,大模型较慢 · KittenTTS 和 MOSS-TTS-Nano 可在 CPU 上实时运行 · MLX-Audio 仅限 Apple Silicon。
下载地址:
资源荟萃
更多推荐


所有评论(0)