Voicebox 使用教程

41K Star 本地开源AI声音工作室,几秒克隆你的声音,7引擎TTS,内置MCP让Codex自动配音

⭐ 开源免费

📖 项目简介

Voicebox 是一个「本地优先」的开源 AI 声音工作室,被称为 ElevenLabs 和 WisprFlow 的免费开源替代品。只需几秒参考音频就能克隆任意声音,支持 23 种语言、7 大 TTS 引擎;还能用全局热键把语音听写进任意输入框。最有意思的是它内置了一个 MCP 服务器,让 Cursor、Claude Code、Codex、Cline 等支持 MCP 的 AI 助手,直接用你克隆的声音"自动配音"。

所有模型、声音数据和录音全部在你自己的电脑上运行,一点不外泄。桌面端基于 Tauri(Rust)+ React 构建,Apple Silicon 用 MLX 推理、其余平台用 PyTorch(CUDA/ROCm/CPU)。目前已在 GitHub 收获 41K+ Star。

核心亮点

🎙️
近乎完美的声音克隆
几秒参考音频即可零样本克隆音色,也内置 50+ 预置声音,音调、情感自然
🔀
7 大 TTS 引擎
Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox、TADA、Kokoro 等,逐次可切
🔌
内置 MCP 服务器
Cursor / Claude Code / Codex / Cline 一次 speak 调用,就用你的声音说话
🔒
完全本地 · 免费
模型、声音、录音都不出本机,免费平替 ElevenLabs 与 WisprFlow

🚀 如何使用

1

安装 Voicebox

在 GitHub 搜索 jamiepine/voicebox,进入 Releases 页面下载对应系统(macOS / Windows / Linux)的安装包;也可按仓库说明本地构建。首次启动时会自动下载你选用的 TTS 模型。

2

克隆你的声音(或选预置音)

录一小段或导入几秒参考音频,创建一个专属"声音档案";如果懒得录,也可以直接用 Kokoro、Qwen CustomVoice 提供的 50+ 预置声音。

3

生成语音 / 全局听写

输入文字、选好引擎即可生成语音,支持调节语速、情绪、语言(Qwen3-TTS 还能用自然语言下达"慢一点""小声说"等指令);也可用全局热键,把你说的话实时听写进任意输入框。

4

接入 Codex / Cursor(MCP)

Voicebox 内置一个 MCP 服务器。在支持 MCP 的客户端(Cursor、Claude Code、Cline、VS Code MCP 扩展等)里添加 voicebox 服务,之后 AI 只需一次 voicebox.speak 调用,就能用你克隆的声音开口汇报。

常见问题

Q: 需要联网或付费吗?

不需要。模型下载完成后完全在本地运行,开源免费(MIT 协议),声音数据和录音都不会上传到任何服务器。

Q: 支持哪些系统?中文能用吗?

桌面端基于 Tauri,支持 macOS / Windows / Linux;Apple Silicon 用 MLX 加速,其余平台走 PyTorch(CUDA / ROCm / CPU)。语言方面支持包括中文在内的 23 种语言。

Q: 怎么让 Cursor / Codex 用我克隆的声音说话?

它内置了 MCP 服务器,在支持 MCP 的 AI 客户端里添加 voicebox 服务,调用它的 speak 工具,AI 生成的内容就会用你指定的声音念出来——真正做到"让 Codex 自动配音"。