41K Star 本地开源AI声音工作室,几秒克隆你的声音,7引擎TTS,内置MCP让Codex自动配音
⭐ 开源免费Voicebox 是一个「本地优先」的开源 AI 声音工作室,被称为 ElevenLabs 和 WisprFlow 的免费开源替代品。只需几秒参考音频就能克隆任意声音,支持 23 种语言、7 大 TTS 引擎;还能用全局热键把语音听写进任意输入框。最有意思的是它内置了一个 MCP 服务器,让 Cursor、Claude Code、Codex、Cline 等支持 MCP 的 AI 助手,直接用你克隆的声音"自动配音"。
所有模型、声音数据和录音全部在你自己的电脑上运行,一点不外泄。桌面端基于 Tauri(Rust)+ React 构建,Apple Silicon 用 MLX 推理、其余平台用 PyTorch(CUDA/ROCm/CPU)。目前已在 GitHub 收获 41K+ Star。
在 GitHub 搜索 jamiepine/voicebox,进入 Releases 页面下载对应系统(macOS / Windows / Linux)的安装包;也可按仓库说明本地构建。首次启动时会自动下载你选用的 TTS 模型。
录一小段或导入几秒参考音频,创建一个专属"声音档案";如果懒得录,也可以直接用 Kokoro、Qwen CustomVoice 提供的 50+ 预置声音。
输入文字、选好引擎即可生成语音,支持调节语速、情绪、语言(Qwen3-TTS 还能用自然语言下达"慢一点""小声说"等指令);也可用全局热键,把你说的话实时听写进任意输入框。
Voicebox 内置一个 MCP 服务器。在支持 MCP 的客户端(Cursor、Claude Code、Cline、VS Code MCP 扩展等)里添加 voicebox 服务,之后 AI 只需一次 voicebox.speak 调用,就能用你克隆的声音开口汇报。
不需要。模型下载完成后完全在本地运行,开源免费(MIT 协议),声音数据和录音都不会上传到任何服务器。
桌面端基于 Tauri,支持 macOS / Windows / Linux;Apple Silicon 用 MLX 加速,其余平台走 PyTorch(CUDA / ROCm / CPU)。语言方面支持包括中文在内的 23 种语言。
它内置了 MCP 服务器,在支持 MCP 的 AI 客户端里添加 voicebox 服务,调用它的 speak 工具,AI 生成的内容就会用你指定的声音念出来——真正做到"让 Codex 自动配音"。