Codex自动配音实测对比

4个开源配音对号入座:GPT-SoVITS、IndexTTS 2.5、VoxCPM2、edge-tts

⭐ 合计约 13 万 Star

📖 项目简介

Codex自动配音实测对比 不是再推一个「克隆你声音」的工作室,而是把四条开源配音路摆在一起,按机器和用途对号入座。四个仓库合计约 13 万 Star:GPT-SoVITS(MIT,约 6.1 万)、VoxCPM2(Apache-2.0,约 3.6 万)、IndexTTS 2.5(约 2.3 万)、edge-tts(约 1.0 万)。

要中文听着像本人、愿意等微调,走 GPT-SoVITS;中文解说要语气,走 IndexTTS 2.5;要多语种或不想录音,走 VoxCPM2;没显卡、先要出声,走 edge-tts。edge-tts 不装模型、不吃显卡,但走微软在线朗读,断网就不能用,不要理解成「本地部署」。

四个都能用命令行或本地服务让 Codex 去调。131 讲的是 Voicebox 工作室;本期只讲选型。

核心亮点

🏷️
GPT-SoVITS · 像本人
约 1 分钟素材微调,中英日韩粤。要显卡,还要等训练。
🆓
IndexTTS 2.5 · 要语气
中文解说起伏更好。零样本出声,中英日西阿。本机显卡。
🔍
VoxCPM2 · 多语种
30 语言 + 9 种中文方言,48kHz。可用文字描述音色,不必先录音。约 8G 显存。
👥
edge-tts · 零安装
不装模型、不吃显卡,一行命令出 mp3,还能吐字幕。必须联网。

🧩 它能做什么、输出什么

项目说明
输入文本;SoVITS / IndexTTS / VoxCPM 还可加参考音频或音色描述
适用类型短视频口播、解说、多语种翻译配音、没显卡先出声
输出wav / mp3;edge-tts 还可同时出 srt
语言 / 兼容SoVITS:中英日韩粤;IndexTTS:中英日西阿;VoxCPM2:30 语 + 方言;edge-tts:300+ 音色
规格 / 容量本地三家要显卡;edge-tts 走在线接口,无本地模型体积

🖥️ 环境要求

环境建议配置
操作系统Windows / Linux / macOS(各仓库 README 为准)
运行环境Python 3.10+;edge-tts 一条 pip 即可
硬件SoVITS / IndexTTS 要消费级显卡;VoxCPM2 约 8G 显存
低配 / 无卡方案只装 edge-tts,不要硬上三家本地大模型
关键依赖PyTorch+CUDA(本地三家);edge-tts 只需网络

🚀 如何使用

💡
先定用途再装。没显卡只装 edge-tts;有显卡再按「像本人 / 要语气 / 多语种」三选一往下走。
1

确认有没有显卡

没有独显:只走第 3 步的 edge-tts。有独显:再按仓库 README 装对应环境,不要四个一起装。

bash nvidia-smi
2

下载对应仓库

在 GitHub 搜索仓库全名,按该仓库 README 的安装段走。正文不贴克隆地址。

text 搜索:RVC-Boss/GPT-SoVITS 、 index-tts/index-tts 、 OpenBMB/VoxCPM
3

没显卡:先跑通 edge-tts

一行出 mp3。必须联网。这是零安装门槛,不是省钱话术。

bash pip install edge-tts edge-tts --text "同一句口播,四个引擎各念一遍" --write-media out.mp3 --write-subtitles out.srt

常用参数说明:

参数作用
--text要念的句子
--write-media输出音频
--write-subtitles同时出字幕
4

有显卡:同一句口播分别跑三家

GPT-SoVITS 先把模型微调完再录「打字出声」,不要录训练进度条。IndexTTS 录屏避开哔哩哔哩台标。VoxCPM2 用文字描述音色即可,不必先录音。

text 同一句口播,四个引擎各念一遍
5

结合 Codex 使用

把安装命令和「用同一句话出音频」写进 Codex 任务。edge-tts 直接 CLI;另外三家按各自 WebUI / 本地 API 让它点。不要四个同时装进一个环境。

Codex 当安装和出声操作员,选型仍由你按用途定。

🎯 典型应用场景

📑
本人出镜口播
GPT-SoVITS 微调后固定音色
📚
中文解说号
IndexTTS 2.5 要语气起伏
✍️
出海翻译配音
VoxCPM2 多语种、可不录音
🧮
笔记本没独显
edge-tts 联网出声
🤖
交给 Codex 批量出
CLI / 本地服务让 Agent 调
🔒
数据不上传
本地三家模型在自己机器;edge-tts 文本会出网

📈 性能表现

指标表现
GPT-SoVITS Star / 协议约 6.1 万 / MIT(2026-08)
VoxCPM2 显存官方约 8 GB(RTX 级)
edge-tts 音色300+,无需 API Key
🧠
四条路不是音质排行,是约束不同:训练成本、情绪、语种、以及要不要显卡和网络。

常见问题

Q: 和 131 Voicebox 那条有什么不一样?

那条讲的是一个工作室里切引擎、克隆声音。这条是四个独立开源方案按用途选,不比谁留下。

Q: edge-tts 是本地部署吗?

不是。它不装模型、不吃显卡,但音频在微软服务器上合成,断网不能用。文本会出网。

Q: 为什么不推荐 Fish Speech?

1.5 是 CC BY-NC-SA,非商用;S2 要单独商业授权。做视频发出去就是商用,不往坑里带。

Q: 没显卡怎么办?

只装 edge-tts。不要下载三家本地大模型再抱怨跑不动。

Q: 四个怎么选?

像本人 → SoVITS;中文解说要语气 → IndexTTS;多语种或不录音 → VoxCPM2;没显卡 → edge-tts。

Q: 怎么和 Codex 结合?

把「装哪一个 + 用同一句话出音频」写成任务。edge-tts 直接 CLI,另外三家跟仓库的 WebUI 或本地接口。

Q: IndexTTS 录屏要注意什么?

页面上可能出现哔哩哔哩台标,录的时候避开,或后期涂掉。

Q: 可以商用吗?

GPT-SoVITS 是 MIT,VoxCPM2 是 Apache-2.0。IndexTTS 和 edge-tts 协议写 Other / NOASSERTION,商用前自己读仓库 LICENSE。edge-tts 还受微软在线服务条款约束。