做自媒体必装的 5 个开源神器:出片 · 配音 · 剪辑 · 成片 · 发布
⭐ 合计 17 万 Star · 全部开源免费一个人做短视频,真正吃时间的从来不是"想创意",而是后面那一长串重复劳动:写稿、录音、对时间轴、剪口水词、烧字幕、导出、再一个平台一个平台地传。 这份合集把这条流水线上的五个环节,各挑了一个 GitHub 上最能打的开源项目,交给 Codex / Claude Code / Cursor 这类编程 Agent 去执行。
五个项目按流水线顺序是:HyperFrames(写代码直接出片)→ Voicebox(克隆你自己的声音配音)→ video-use(自动剪口水词、烧字幕)→ OpenMontage(一句话端到端出片)→ AiToEarn(成片自动发到多个平台)。 截至 2026 年 8 月,五个项目 GitHub Star 合计约 17.7 万,全部开源,装起来基本都是一条命令。
它们的共同点是都以"技能 / MCP"的形式挂到编程 Agent 上,而不是又一个要你重新学界面的软件。 也就是说:你还是在跟 Codex 对话,只是它突然多了会渲染视频、会说话、会剪片、会发布的手脚。五个不必全装,缺哪补哪——文末有选型对照表。
| 工具 | Star | 解决什么 | 关键能力 |
|---|---|---|---|
| ① HyperFrames HeyGen 开源 |
约 39.4K | 不想开剪辑软件对轨道 | 用 HTML/CSS 写视频合成,可实时预览、直接渲染成 MP4;内置 19 个技能,Agent 按需加载;转场、图表、社交样式等效果一条命令加 |
| ② Voicebox MIT |
约 48.9K | 不想露脸出声、不想付云配音费 | 本地 AI 语音工作室,几秒素材克隆声音;集成 Qwen3-TTS / Kokoro / Chatterbox / CosyVoice / Fish Speech 等 7 个引擎、23 种语言;仓库自带 MCP 配置,Agent 可直接调用 |
| ③ video-use browser-use 团队 · MIT |
约 18.9K | 素材录了一堆懒得剪 | 把原始素材转成带时间戳的文字稿,自动剪掉"嗯/那个"这类口水词与长静音,自动调色、生成并烧入字幕,成片后自行质检、不合格重来 |
| ④ OpenMontage AGPL-3.0 |
约 45K | 想一句话从零出片 | 号称首个开源 agentic 视频制作系统:12 条制作流水线、100+ 工具、700+ 技能与制作知识文件;联网调研 → 出图 → 写稿配音 → 配乐 → 逐词字幕 → 渲染 → 多点自检 |
| ⑤ AiToEarn MIT |
约 24.6K | 片子做完没时间一个个平台传 | 一次上传,多个自媒体平台同步排期发布;标题/简介/标签按平台差异自动适配;支持定时发布与评论自动回复;桌面客户端 + MCP 两种用法 |
| 工具 | 运行环境 | 硬件 / 其他要求 |
|---|---|---|
| HyperFrames | Node.js 18+、FFmpeg | 普通笔记本即可;渲染吃 CPU,长片建议 8 核以上。需要一个支持 skills 的编程 Agent(Codex / Claude Code / Cursor / Gemini CLI) |
| Voicebox | Python 3.11+、Bun、Rust、Tauri 依赖;macOS 还需 Xcode | 纯 CPU 能跑但慢;有 NVIDIA 显卡可用 CUDA 版本、Apple 芯片走 MLX 加速。建议 16GB 内存起 |
| video-use | Python、FFmpeg | 硬件要求低,主要吃磁盘和转码时间。旁白环节需要一个 TTS 服务的 API Key(也可换成本地方案,见常见问题) |
| OpenMontage | Python 3.10+、Node.js 18+、FFmpeg、make |
渲染基于 Remotion,吃 CPU 和内存,建议 16GB 起;AI 出图/配音可选本地或云端服务 |
| AiToEarn | 桌面客户端(Electron)或直接用网页端;MCP 用法需要能编辑 Agent 配置文件 | 无特殊硬件要求;需先完成各平台账号授权,部分平台要开启中转服务 |
| 操作系统 | 五个都支持 Windows / macOS / Linux。Windows 上跑 Voicebox 与 OpenMontage 建议用 WSL2,能少踩一半依赖坑 | |
五个项目里有四个都要 FFmpeg,三个要 Node.js,两个要 Python。先一次装齐,后面能省很多事。
# 检查是否已具备(有版本号输出就算过)
node --version # 需要 18 及以上
python3 --version # 需要 3.10 及以上
ffmpeg -version
# macOS 一次装齐
brew install node python ffmpeg
# Ubuntu / WSL2
sudo apt update && sudo apt install -y nodejs npm python3 python3-venv ffmpeg
它不是剪辑软件,而是"用代码描述视频"的渲染框架。安装其实是给 Agent 装一组技能,装完在对话里直接说要什么片子。
# 给编程 Agent 装 HyperFrames 技能(推荐加 --full-depth 拿最新版)
npx skills add heygen-com/hyperframes --full-depth
# 非交互环境(脚本 / CI)用这条,只装核心技能集
npx hyperframes skills update
装好后,在 Codex 里直接下指令,例如:
用 /hyperframes 做一条 10 秒的产品介绍视频:
标题淡入 + 背景视频 + 轻量背景音乐,最后一帧留出二维码位置。
也可以自己起项目、预览、渲染:
npx hyperframes init my-video # 新建一个视频工程
npx hyperframes preview # 浏览器里实时预览,改代码即刷新
npx hyperframes render # 渲染导出 MP4
# 按需追加现成效果
npx hyperframes add flash-through-white # 白闪转场
npx hyperframes add data-chart # 数据图表
关键命令说明:
| 命令 | 作用 |
|---|---|
init | 生成一个 HTML 视频工程骨架 |
preview | 起本地预览服务,可拖动时间轴逐帧看,改代码即时生效 |
render | 把 HTML 合成渲染成 MP4 |
add <效果名> | 装官方现成的转场 / 图表 / 社交样式组件 |
skills update | 只装核心技能集,适合脚本或 Agent 自动执行 |
--full-depth 时,skills add 拿的是技能仓库的缓存快照,可能比主干落后几小时,容易装到旧版技能。一整套跑在本机的 AI 语音工作室:克隆音色、文字转语音、语音输入三件事都能干,还自带 MCP 配置文件,Agent 能直接调。
# 先装命令运行器 just
brew install just # macOS
# 或者:cargo install just
# 在 GitHub 搜索 jamiepine/voicebox,克隆到本地
git clone <voicebox 仓库地址>
cd voicebox
just setup # 建 Python 虚拟环境、装齐所有依赖
just dev # 同时起后端 + 桌面应用
just --list # 想看还有哪些命令就跑这个
想编译成独立应用长期用:
just build # 编译 CPU 版服务端 + 桌面应用
just build-local # Windows:同时编译 CPU 与 CUDA 版
克隆音色的做法:在应用里录一段自己的说话(几秒到几十秒都行,越干净越准),存成一个音色; 之后任何文字都能用这个音色念出来,还能调语速和情绪强度。
接进 Codex:仓库根目录预置了 MCP 配置,桌面应用跑起来后,在这个目录里启动 Agent 就能自动识别到 Voicebox 的工具,直接让它"把这段稿子用我的声音配好音"。
它的安装方式很特别——不用你自己配环境,而是把一段"安装提示词"丢给 Agent,让它自己 clone、装依赖、注册技能。
帮我安装 GitHub 上的 browser-use/video-use。
先读它的 install.md 完成安装,配好 ffmpeg,把技能注册到你当前所在的 Agent 里,
需要 TTS 的 API Key 时问我要。装完先读 SKILL.md 了解日常用法,
再读 helpers/ 目录(剪辑脚本都在那儿)。装完不要自己开始转写,
告诉我准备好了,等我把素材放进目录。
装好之后,把素材丢进一个目录,在该目录里启动 Agent 下指令:
cd /你的/素材目录
codex # 或 claude,用你顺手的那个
把这个目录里的素材剪成一条 90 秒成片:
先转文字稿,剪掉口水词和超过 1 秒的静音,
自动调色走电影感,字幕烧进画面,最后导出 final.mp4。
它自动做的几件事:
| 环节 | 做了什么 |
|---|---|
| 转写 | 把素材转成带时间戳的文字稿,后面所有剪辑都基于这份稿子定位 |
| 剪口水词 | 识别并剪掉"嗯""那个"这类填充词、重启的废句,以及镜头之间的长静音 |
| 调色 | 逐段自动调色,支持电影感、中性增强,或你自定义的处理参数 |
| 字幕 | 生成并烧入字幕,可指定样式与位置 |
| 自检 | 成片后自己回看输出,发现跳帧、爆音、字幕异常会重跑 |
这个最"重",但也最省心:把编程 Agent 直接变成一间视频制作公司,内置 12 条制作流水线、100 多个工具、700 多个技能与制作知识文件。
# 在 GitHub 搜索 calesthio/OpenMontage,克隆到本地
git clone <OpenMontage 仓库地址>
cd OpenMontage
make setup
机器上没有 make 的话,手动等价步骤:
python3 -m venv .venv
source .venv/bin/activate
python -m pip install -r requirements.txt
cd remotion-composer && npm install && cd ..
python -m pip install piper-tts
cp .env.example .env # 再按注释填要用的服务密钥
然后用你的编程 Agent 打开这个项目目录,直接说要什么片子:
# 全 AI 生成画面的路子
做一条 60 秒的科普动画,讲清楚神经网络是怎么学习的。
# 用真实素材的路子
做一条 75 秒的城市雨天纪录片式混剪,只用真实素材、不要旁白,
基调偏挽歌,配上音乐。
接到指令后它会自己联网调研选题、生成画面、写稿并按情绪指导配音、自动找可商用的背景音乐、烧入逐词字幕,最后渲染。 出片前还会跑一轮多点自检:用 ffprobe 校验文件、抽帧看画面、分析音量、核对"是否真的做到了你要求的东西"、检查字幕。 每个环节选用哪个服务,它会按 7 个维度打分并留下可追溯的决策记录,重要的创作决定都会先问你。
片子做好了,最后这段重复劳动交给它:一次上传,多个自媒体平台同步排期发布,标题、简介、标签按各平台差异自动适配。
用法 A(最简单):装桌面客户端或直接开网页端 → 注册登录 → 授权你要发布的平台账号 → 勾选平台、上传成片 → 一次提交。
用法 B(接进 Codex):它提供统一 MCP 接口,在 Agent 配置里加一段就能让 Codex 直接调用发布工具。以 Codex 的 config.toml 为例:
[mcp_servers.aitoearn]
url = "官方站点的统一 MCP 接口地址"
[mcp_servers.aitoearn.http_headers]
x-api-key = "你在后台申请到的 API-Key"
配好后在 Codex 里直接说人话即可:
把 out/final.mp4 发布出去,标题用「Codex 一人做完短视频」,
带上开源工具相关话题标签,定在今晚 8 点发。
| 你的情况 | 先装 | 理由 |
|---|---|---|
| 不想开剪辑软件、要的是可复用模板 | ① HyperFrames | 视频变成代码,改文案改配色就是改代码,一句话重出一版 |
| 不想露脸出声,也不想付云配音费 | ② Voicebox | 全本地跑,克隆一次自己的声音后长期复用,边际成本为零 |
| 已经录了一堆素材,就是懒得剪 | ③ video-use | 它专治"有素材没成片",转稿、剪废话、烧字幕全自动 |
| 手上什么都没有,想一句话出片 | ④ OpenMontage | 唯一真正端到端的,从调研到渲染一条流水线走完 |
| 片子攒了一堆,卡在"没时间发" | ⑤ AiToEarn | 把最枯燥的重复上传和排期接走,还能定时和自动回评论 |
| 纯新手,只想先感受一下 | ④ 再 ⑤ | 先用端到端那个跑通一条完整片子,再解决发布,最省心 |
不用全装,而且它们互不依赖,随便装一个都能单独跑通。技术上也不冲突:HyperFrames 是 Agent 技能,Voicebox 和 AiToEarn 走 MCP,video-use 和 OpenMontage 各自独立的项目目录。唯一要注意的是都要 FFmpeg,装一份大家共用即可。
能。这五个项目对接的都是"支持技能或 MCP 的编程 Agent"这一类,官方明确列出的兼容对象包括 Codex、Claude Code、Cursor、Gemini CLI、Copilot、Windsurf 等。命令完全一样,区别只在 MCP 配置文件写在哪个位置。
五个项目本身都是开源免费的。但要注意两笔可能的外部开销:一是 video-use 的旁白环节默认接第三方 TTS 服务,用它就要那家的 API Key;二是 OpenMontage 的出图/配音如果选云端服务商,会按那家的价格计费。两者都能换成本地方案,见下一条。
可以,但要自己接一下。配音把 video-use 和 OpenMontage 的 TTS 指向本地 Voicebox(OpenMontage 本身就预装了本地语音方案 piper-tts);出图换成本地模型。这样除了 AiToEarn 的发布环节必须联网,其余都能不出本机。
能。HyperFrames、video-use、AiToEarn 基本不吃显卡,主要吃 CPU 和转码时间。Voicebox 纯 CPU 能跑,只是克隆和合成会慢一些,有 NVIDIA 卡可以用 CUDA 版本、Apple 芯片走 MLX 加速。OpenMontage 若选云端出图,本地压力也不大。
Voicebox 和 OpenMontage 的依赖链比较长(Rust、Tauri、Python 原生扩展),Windows 原生环境容易卡住。强烈建议用 WSL2,按 Ubuntu 的步骤走能少一半问题。HyperFrames 和 AiToEarn 在 Windows 原生跑没什么障碍。
定位完全不同。HyperFrames 是渲染框架——你(或 Agent)要写清楚每一帧长什么样,换来的是完全可控和可复用,适合做模板化、需要精确排版的片子。OpenMontage 是制作系统——你只给一句话,它自己决定怎么拍怎么剪,省心但可控性低。做系列片用前者,做单条内容用后者。
差在"谁做决策"。普通工具是你点按钮、它执行固定流程;video-use 是把剪辑脚本交给编程 Agent,你用自然语言描述要什么风格、剪多长、字幕什么样,它自己组合脚本去实现,改需求不用重新学界面。而且它成片后会自己回看质检,不合格自动重来。
不需要。它走各平台的官方 OAuth 授权,你在平台自己的登录页确认授权,授权一次长期可用。部分平台受接口限制还要在设置里开启中转服务,按客户端里的提示操作即可。
工具本身只是替你完成上传动作,内容合规责任仍然在你。三条务必自己守住:AI 生成的内容该勾的声明一定要勾;标题标签避开各平台的敏感表述;同一条内容在多平台发布时按平台习惯做差异化,别一字不改地群发。自动化只省时间,不替你规避规则。
Voicebox、video-use、AiToEarn 是 MIT 协议,商用限制很少。OpenMontage 是 AGPL-3.0,如果你把它改造成对外提供的网络服务,按协议需要开源你的修改,商业项目里用之前先看清楚。另外别忘了:素材、音乐、音色的版权是另一码事,工具协议管不到那一层。