Voicebox:本地运行的 AI 语音工作站,替代 ElevenLabs 和 WisprFlow
文章目录
Voicebox:本地运行的 AI 语音工作站,替代 ElevenLabs 和 WisprFlow
GitHub 上有个项目叫 Voicebox,Star 数已经过了 3.4 万。它做的事情很明确,把语音输入和语音输出两件事整合到一个本地运行的桌面应用里。
现在做语音克隆、文字转语音的工具不少,但大多是云服务,数据要传到别人的服务器上。做语音转文字的也有,但跟语音输出是割裂的。Voicebox 把这两块拼在一起,而且全部跑在你自己的机器上,数据不出本机。

语音输出:7 个引擎随便切
Voicebox 内置了 7 个 TTS 引擎,覆盖中英日韩等 23 种语言。不同引擎各有侧重:
Qwen3-TTS 做多语言克隆效果好,支持"慢慢说""低语"这类指令。Chatterbox Multilingual 语言覆盖最广,阿拉伯语、丹麦语、芬兰语、希腊语、希伯来语、印地语、马来语、挪威语、波兰语、斯瓦希里语、瑞典语、土耳其语都能处理。Kokoro 模型只有 82MB,CPU 上就能跑得很快,还内置了 50 个预设声音。
最特别的是 Chatterbox Turbo,它能识别 [laugh]、[sigh]、[gasp] 这类情感标签,在语音中自然插入笑声、叹气、喘气。别的引擎碰到这些标签只会把文字念出来。
生成长度没有硬性限制。长文本会自动按句子切分,逐段生成后用交叉淡入拼接,最多支持 5 万字符。还有个 Stories 编辑器,能做多声轨时间线,适合做对话、播客、有声叙事这类内容。

语音输入:全局热键 + Whisper 转写
另一半是语音输入。按住全局热键说话,松手后转写文字自动粘贴到当前焦点的文本框里,macOS 上已验证无障碍注入。Windows 和 Linux 的自动粘贴在路线图上。
转写用的是 OpenAI Whisper,从 Base 到 Large 到 Turbo 都支持,跑在 MLX(苹果芯片)或 PyTorch(CUDA/ROCm/DirectML/CPU)上。Turbo 版本比 Large 快 8 倍,质量损失很小。
每次录音都会保存到 Captures 标签页,原始音频和转写文字配对存储。可以随时回听、用不同 Whisper 模型重新转写、或者让本地 LLM 清理口语化的"嗯""啊"和口误。
跟 AI Agent 联动
Voicebox 内置了 MCP 服务器,Claude Code、Cursor、Windsurf 这类支持 MCP 的 Agent 可以直接调用语音输出。一个工具调用,Agent 就能用你克隆的声音跟你说话。
await voicebox.speak({
text: "部署完成。",
profile: "Morgan",
});
还能给每个声音配一个人设,用内置的 Qwen3 本地 LLM 做文本改写。比如设定了一个"严厉导师"的人设,输入"这次做得还行",输出可能变成"及格而已,别得意"。Agent 也可以通过 MCP 触发这个改写。
还可以在 Settings 里给不同 Agent 绑定不同声音,Claude Code 用 Morgan 的声音,Cursor 用 Scarlett 的声音,不用看屏幕就知道谁在说话。
技术栈
桌面端用 Tauri(Rust)构建,不是 Electron,内存占用和启动速度都好很多。前端是 React + TypeScript + Tailwind,后端是 Python FastAPI。音频效果处理用的 Spotify 的 pedalboard 库,提供变调、混响、延迟、合唱、压缩等 8 种效果。
支持 macOS(MLX/Metal)、Windows(CUDA)、Linux、AMD ROCm、Intel Arc,也有 Docker 部署方案。
说说不足
Linux 上还没有预编译包,需要从源码编译。Windows 和 Linux 的语音输入自动粘贴还没实现。另外这些 TTS 模型加起来体积不小,首次使用需要下载,对硬盘和显存都有一定要求。
适合谁用
需要语音克隆但不想把数据传到云端的人。做播客、有声书、游戏配音需要多角色多声音的团队。想让 AI Agent 能开口说话的开发者。或者就是单纯想找个好用的本地语音转文字工具的人。
Voicebox 把语音输入输出、声音克隆、AI 文本改写、Agent 集成这几件事揉到一起,跑在本地,免费开源。在同类工具里,这个完成度确实少见。
、声音克隆、AI 文本改写、Agent 集成这几件事揉到一起,跑在本地,免费开源。在同类工具里,这个完成度确实少见。
更多推荐



所有评论(0)