Codex 一人做完短视频

做自媒体必装的 5 个开源神器:出片 · 配音 · 剪辑 · 成片 · 发布

⭐ 合计 17 万 Star · 全部开源免费

📖 这份合集是什么

一个人做短视频,真正吃时间的从来不是"想创意",而是后面那一长串重复劳动:写稿、录音、对时间轴、剪口水词、烧字幕、导出、再一个平台一个平台地传。 这份合集把这条流水线上的五个环节,各挑了一个 GitHub 上最能打的开源项目,交给 Codex / Claude Code / Cursor 这类编程 Agent 去执行。

五个项目按流水线顺序是:HyperFrames(写代码直接出片)→ Voicebox(克隆你自己的声音配音)→ video-use(自动剪口水词、烧字幕)→ OpenMontage(一句话端到端出片)→ AiToEarn(成片自动发到多个平台)。 截至 2026 年 8 月,五个项目 GitHub Star 合计约 17.7 万,全部开源,装起来基本都是一条命令。

它们的共同点是都以"技能 / MCP"的形式挂到编程 Agent 上,而不是又一个要你重新学界面的软件。 也就是说:你还是在跟 Codex 对话,只是它突然多了会渲染视频、会说话、会剪片、会发布的手脚。五个不必全装,缺哪补哪——文末有选型对照表。

为什么是这 5 个

🧩
覆盖完整一条流水线
出片、配音、剪辑、成片、发布五个环节各一把,不是五个功能重复的同类工具
🤖
全部挂在编程 Agent 上
以 Skill / MCP 形式接入,Codex、Claude Code、Cursor 都能用,不用另学新软件
🔒
关键环节能全本地跑
配音、剪辑、渲染都可以不出本机,素材和声音不用往云上传
🆓
开源免费、单独可用
五个互不依赖,随便装一个都能单独跑通,不存在"必须凑齐才work"

🧠 五个工具速览

工具 Star 解决什么 关键能力
① HyperFrames
HeyGen 开源
约 39.4K 不想开剪辑软件对轨道 用 HTML/CSS 写视频合成,可实时预览、直接渲染成 MP4;内置 19 个技能,Agent 按需加载;转场、图表、社交样式等效果一条命令加
② Voicebox
MIT
约 48.9K 不想露脸出声、不想付云配音费 本地 AI 语音工作室,几秒素材克隆声音;集成 Qwen3-TTS / Kokoro / Chatterbox / CosyVoice / Fish Speech 等 7 个引擎、23 种语言;仓库自带 MCP 配置,Agent 可直接调用
③ video-use
browser-use 团队 · MIT
约 18.9K 素材录了一堆懒得剪 把原始素材转成带时间戳的文字稿,自动剪掉"嗯/那个"这类口水词与长静音,自动调色、生成并烧入字幕,成片后自行质检、不合格重来
④ OpenMontage
AGPL-3.0
约 45K 想一句话从零出片 号称首个开源 agentic 视频制作系统:12 条制作流水线、100+ 工具、700+ 技能与制作知识文件;联网调研 → 出图 → 写稿配音 → 配乐 → 逐词字幕 → 渲染 → 多点自检
⑤ AiToEarn
MIT
约 24.6K 片子做完没时间一个个平台传 一次上传,多个自媒体平台同步排期发布;标题/简介/标签按平台差异自动适配;支持定时发布与评论自动回复;桌面客户端 + MCP 两种用法
💡
Star 数取自 2026 年 8 月初,是会一直变的,看趋势就好。选型别只看 Star——下面每个工具都写了"什么情况下才值得装"。

🖥️ 环境要求

工具运行环境硬件 / 其他要求
HyperFrames Node.js 18+、FFmpeg 普通笔记本即可;渲染吃 CPU,长片建议 8 核以上。需要一个支持 skills 的编程 Agent(Codex / Claude Code / Cursor / Gemini CLI)
Voicebox Python 3.11+、Bun、Rust、Tauri 依赖;macOS 还需 Xcode 纯 CPU 能跑但慢;有 NVIDIA 显卡可用 CUDA 版本、Apple 芯片走 MLX 加速。建议 16GB 内存起
video-use Python、FFmpeg 硬件要求低,主要吃磁盘和转码时间。旁白环节需要一个 TTS 服务的 API Key(也可换成本地方案,见常见问题)
OpenMontage Python 3.10+、Node.js 18+、FFmpeg、make 渲染基于 Remotion,吃 CPU 和内存,建议 16GB 起;AI 出图/配音可选本地或云端服务
AiToEarn 桌面客户端(Electron)或直接用网页端;MCP 用法需要能编辑 Agent 配置文件 无特殊硬件要求;需先完成各平台账号授权,部分平台要开启中转服务
操作系统 五个都支持 Windows / macOS / Linux。Windows 上跑 Voicebox 与 OpenMontage 建议用 WSL2,能少踩一半依赖坑

🚀 如何使用

💡
最省事的路径:先只装 ④ OpenMontage,用一句话跑一条完整片子,感受一下"端到端"是什么样; 等你发现哪个环节不满意,再针对性地补 ①②③;最后片子攒多了,才装 ⑤ 解决发布问题。
0

先把公共依赖装好

五个项目里有四个都要 FFmpeg,三个要 Node.js,两个要 Python。先一次装齐,后面能省很多事。

bash # 检查是否已具备(有版本号输出就算过) node --version # 需要 18 及以上 python3 --version # 需要 3.10 及以上 ffmpeg -version # macOS 一次装齐 brew install node python ffmpeg # Ubuntu / WSL2 sudo apt update && sudo apt install -y nodejs npm python3 python3-venv ffmpeg
1

① HyperFrames:让 Codex 写 HTML 直接出片

它不是剪辑软件,而是"用代码描述视频"的渲染框架。安装其实是给 Agent 装一组技能,装完在对话里直接说要什么片子。

bash # 给编程 Agent 装 HyperFrames 技能(推荐加 --full-depth 拿最新版) npx skills add heygen-com/hyperframes --full-depth # 非交互环境(脚本 / CI)用这条,只装核心技能集 npx hyperframes skills update

装好后,在 Codex 里直接下指令,例如:

prompt 用 /hyperframes 做一条 10 秒的产品介绍视频: 标题淡入 + 背景视频 + 轻量背景音乐,最后一帧留出二维码位置。

也可以自己起项目、预览、渲染:

bash npx hyperframes init my-video # 新建一个视频工程 npx hyperframes preview # 浏览器里实时预览,改代码即刷新 npx hyperframes render # 渲染导出 MP4 # 按需追加现成效果 npx hyperframes add flash-through-white # 白闪转场 npx hyperframes add data-chart # 数据图表

关键命令说明:

命令作用
init生成一个 HTML 视频工程骨架
preview起本地预览服务,可拖动时间轴逐帧看,改代码即时生效
render把 HTML 合成渲染成 MP4
add <效果名>装官方现成的转场 / 图表 / 社交样式组件
skills update只装核心技能集,适合脚本或 Agent 自动执行
⚠️
不加 --full-depth 时,skills add 拿的是技能仓库的缓存快照,可能比主干落后几小时,容易装到旧版技能。
2

② Voicebox:几秒克隆你自己的声音

一整套跑在本机的 AI 语音工作室:克隆音色、文字转语音、语音输入三件事都能干,还自带 MCP 配置文件,Agent 能直接调。

bash # 先装命令运行器 just brew install just # macOS # 或者:cargo install just # 在 GitHub 搜索 jamiepine/voicebox,克隆到本地 git clone <voicebox 仓库地址> cd voicebox just setup # 建 Python 虚拟环境、装齐所有依赖 just dev # 同时起后端 + 桌面应用 just --list # 想看还有哪些命令就跑这个

想编译成独立应用长期用:

bash just build # 编译 CPU 版服务端 + 桌面应用 just build-local # Windows:同时编译 CPU 与 CUDA 版

克隆音色的做法:在应用里录一段自己的说话(几秒到几十秒都行,越干净越准),存成一个音色; 之后任何文字都能用这个音色念出来,还能调语速和情绪强度。

接进 Codex:仓库根目录预置了 MCP 配置,桌面应用跑起来后,在这个目录里启动 Agent 就能自动识别到 Voicebox 的工具,直接让它"把这段稿子用我的声音配好音"。

⚠️
克隆声音只用在你自己有权使用的音色上。拿别人的声音做内容存在法律风险,平台也会处理。
3

③ video-use:让 Agent 动手剪你的素材

它的安装方式很特别——不用你自己配环境,而是把一段"安装提示词"丢给 Agent,让它自己 clone、装依赖、注册技能。

prompt 帮我安装 GitHub 上的 browser-use/video-use。 先读它的 install.md 完成安装,配好 ffmpeg,把技能注册到你当前所在的 Agent 里, 需要 TTS 的 API Key 时问我要。装完先读 SKILL.md 了解日常用法, 再读 helpers/ 目录(剪辑脚本都在那儿)。装完不要自己开始转写, 告诉我准备好了,等我把素材放进目录。

装好之后,把素材丢进一个目录,在该目录里启动 Agent 下指令:

bash cd /你的/素材目录 codex # 或 claude,用你顺手的那个
prompt 把这个目录里的素材剪成一条 90 秒成片: 先转文字稿,剪掉口水词和超过 1 秒的静音, 自动调色走电影感,字幕烧进画面,最后导出 final.mp4。

它自动做的几件事:

环节做了什么
转写把素材转成带时间戳的文字稿,后面所有剪辑都基于这份稿子定位
剪口水词识别并剪掉"嗯""那个"这类填充词、重启的废句,以及镜头之间的长静音
调色逐段自动调色,支持电影感、中性增强,或你自定义的处理参数
字幕生成并烧入字幕,可指定样式与位置
自检成片后自己回看输出,发现跳帧、爆音、字幕异常会重跑
4

④ OpenMontage:一句话从调研到成片

这个最"重",但也最省心:把编程 Agent 直接变成一间视频制作公司,内置 12 条制作流水线、100 多个工具、700 多个技能与制作知识文件。

bash # 在 GitHub 搜索 calesthio/OpenMontage,克隆到本地 git clone <OpenMontage 仓库地址> cd OpenMontage make setup

机器上没有 make 的话,手动等价步骤:

bash python3 -m venv .venv source .venv/bin/activate python -m pip install -r requirements.txt cd remotion-composer && npm install && cd .. python -m pip install piper-tts cp .env.example .env # 再按注释填要用的服务密钥

然后用你的编程 Agent 打开这个项目目录,直接说要什么片子:

prompt # 全 AI 生成画面的路子 做一条 60 秒的科普动画,讲清楚神经网络是怎么学习的。 # 用真实素材的路子 做一条 75 秒的城市雨天纪录片式混剪,只用真实素材、不要旁白, 基调偏挽歌,配上音乐。

接到指令后它会自己联网调研选题、生成画面、写稿并按情绪指导配音、自动找可商用的背景音乐、烧入逐词字幕,最后渲染。 出片前还会跑一轮多点自检:用 ffprobe 校验文件、抽帧看画面、分析音量、核对"是否真的做到了你要求的东西"、检查字幕。 每个环节选用哪个服务,它会按 7 个维度打分并留下可追溯的决策记录,重要的创作决定都会先问你。

5

⑤ AiToEarn:成片自动发到多个平台

片子做好了,最后这段重复劳动交给它:一次上传,多个自媒体平台同步排期发布,标题、简介、标签按各平台差异自动适配。

用法 A(最简单):装桌面客户端或直接开网页端 → 注册登录 → 授权你要发布的平台账号 → 勾选平台、上传成片 → 一次提交。

用法 B(接进 Codex):它提供统一 MCP 接口,在 Agent 配置里加一段就能让 Codex 直接调用发布工具。以 Codex 的 config.toml 为例:

toml [mcp_servers.aitoearn] url = "官方站点的统一 MCP 接口地址" [mcp_servers.aitoearn.http_headers] x-api-key = "你在后台申请到的 API-Key"

配好后在 Codex 里直接说人话即可:

prompt 把 out/final.mp4 发布出去,标题用「Codex 一人做完短视频」, 带上开源工具相关话题标签,定在今晚 8 点发。
⚠️
首次发布前必须先完成各平台账号授权(走官方 OAuth,不用把密码交给第三方),部分平台还要在设置里开启中转服务。 发布前务必逐条核对各平台的内容规范:该勾的 AI 生成声明要勾,标题标签别用违规词——自动化只帮你省时间,不会帮你规避规则。
五个串起来之后,你的工作就只剩两件:决定这条片子讲什么,以及发布前审一遍。中间的活儿都能交出去。

🎯 典型应用场景

📊
数据/知识类口播
HyperFrames 写图表动画 + Voicebox 配自己的声音,不出镜也能稳定更新
🎙️
长录音变短视频
一段随手录的口述,video-use 转稿、剪废话、烧字幕,直接出可发的成片
📚
科普动画
OpenMontage 一句话出片,联网查资料、生成画面、配音配乐一条龙
🛍️
批量产品短片
HyperFrames 模板化,换文案换素材重渲即可,一套模板出几十条
🌍
多语言版本
Voicebox 支持 23 种语言,同一条稿子换语言重配音,出海版本一次做齐
📤
多平台同步更新
AiToEarn 一次上传、多平台排期,评论自动回复,一个人也能稳定日更

📈 怎么选、先装哪个

你的情况先装理由
不想开剪辑软件、要的是可复用模板① HyperFrames视频变成代码,改文案改配色就是改代码,一句话重出一版
不想露脸出声,也不想付云配音费② Voicebox全本地跑,克隆一次自己的声音后长期复用,边际成本为零
已经录了一堆素材,就是懒得剪③ video-use它专治"有素材没成片",转稿、剪废话、烧字幕全自动
手上什么都没有,想一句话出片④ OpenMontage唯一真正端到端的,从调研到渲染一条流水线走完
片子攒了一堆,卡在"没时间发"⑤ AiToEarn把最枯燥的重复上传和排期接走,还能定时和自动回评论
纯新手,只想先感受一下④ 再 ⑤先用端到端那个跑通一条完整片子,再解决发布,最省心
🧠
这套组合能成立的底层原因是"技能化":这些项目不再做自己的界面和账号体系, 而是把能力写成编程 Agent 能读懂的技能文件和 MCP 工具。于是同一个 Codex 会话里, 调研、写稿、配音、剪辑、发布可以串成一条链,中间不需要人来搬运文件——这才是"一个人顶一个团队"的真正来源。

常见问题

Q: 五个必须全装吗?会不会互相冲突?

不用全装,而且它们互不依赖,随便装一个都能单独跑通。技术上也不冲突:HyperFrames 是 Agent 技能,Voicebox 和 AiToEarn 走 MCP,video-use 和 OpenMontage 各自独立的项目目录。唯一要注意的是都要 FFmpeg,装一份大家共用即可。

Q: 我用的不是 Codex,Claude Code / Cursor 能装吗?

能。这五个项目对接的都是"支持技能或 MCP 的编程 Agent"这一类,官方明确列出的兼容对象包括 Codex、Claude Code、Cursor、Gemini CLI、Copilot、Windsurf 等。命令完全一样,区别只在 MCP 配置文件写在哪个位置。

Q: 全都免费吗?会不会有隐形收费?

五个项目本身都是开源免费的。但要注意两笔可能的外部开销:一是 video-use 的旁白环节默认接第三方 TTS 服务,用它就要那家的 API Key;二是 OpenMontage 的出图/配音如果选云端服务商,会按那家的价格计费。两者都能换成本地方案,见下一条。

Q: 不想给境外服务充钱,能全本地跑吗?

可以,但要自己接一下。配音把 video-use 和 OpenMontage 的 TTS 指向本地 Voicebox(OpenMontage 本身就预装了本地语音方案 piper-tts);出图换成本地模型。这样除了 AiToEarn 的发布环节必须联网,其余都能不出本机。

Q: 显卡不行 / 没有独显,还能用吗?

能。HyperFrames、video-use、AiToEarn 基本不吃显卡,主要吃 CPU 和转码时间。Voicebox 纯 CPU 能跑,只是克隆和合成会慢一些,有 NVIDIA 卡可以用 CUDA 版本、Apple 芯片走 MLX 加速。OpenMontage 若选云端出图,本地压力也不大。

Q: Windows 上装总报依赖错误怎么办?

Voicebox 和 OpenMontage 的依赖链比较长(Rust、Tauri、Python 原生扩展),Windows 原生环境容易卡住。强烈建议用 WSL2,按 Ubuntu 的步骤走能少一半问题。HyperFrames 和 AiToEarn 在 Windows 原生跑没什么障碍。

Q: HyperFrames 和 OpenMontage 都能出片,有什么区别?

定位完全不同。HyperFrames 是渲染框架——你(或 Agent)要写清楚每一帧长什么样,换来的是完全可控和可复用,适合做模板化、需要精确排版的片子。OpenMontage 是制作系统——你只给一句话,它自己决定怎么拍怎么剪,省心但可控性低。做系列片用前者,做单条内容用后者。

Q: video-use 和常见的自动剪辑软件差在哪?

差在"谁做决策"。普通工具是你点按钮、它执行固定流程;video-use 是把剪辑脚本交给编程 Agent,你用自然语言描述要什么风格、剪多长、字幕什么样,它自己组合脚本去实现,改需求不用重新学界面。而且它成片后会自己回看质检,不合格自动重来。

Q: AiToEarn 需要把平台账号密码交给它吗?

不需要。它走各平台的官方 OAuth 授权,你在平台自己的登录页确认授权,授权一次长期可用。部分平台受接口限制还要在设置里开启中转服务,按客户端里的提示操作即可。

Q: 自动发布会不会违规、会不会被限流?

工具本身只是替你完成上传动作,内容合规责任仍然在你。三条务必自己守住:AI 生成的内容该勾的声明一定要勾;标题标签避开各平台的敏感表述;同一条内容在多平台发布时按平台习惯做差异化,别一字不改地群发。自动化只省时间,不替你规避规则。

Q: 可以商用吗?

Voicebox、video-use、AiToEarn 是 MIT 协议,商用限制很少。OpenMontage 是 AGPL-3.0,如果你把它改造成对外提供的网络服务,按协议需要开源你的修改,商业项目里用之前先看清楚。另外别忘了:素材、音乐、音色的版权是另一码事,工具协议管不到那一层。