1.1万星开源影视解说 · 本机打开就能把视频丢进去
⭐ 约 1.1 万 StarNarratoAI 是 GitHub 用户 linyqh 开源的一站式影视解说工具,仓库约 1.1 万 Star。 它把「看片 → 写解说文案 → 配音 → 上字幕 → 自动剪辑」串成一条本机流水线,专门给电影、纪录片、短剧做解说,不是通用文生视频。
工作原理很直白:视觉模型抽帧理解画面,大模型按片种写解说稿,TTS 出声,再自动对齐字幕并按高光裁切。 当前主线版本到 0.8.6(2026 年 7 月),Web 界面用 Streamlit,本机浏览器打开就能拖视频。 显卡不是必须的——算力主要花在你配置的大模型和语音接口上。
它不是 Codex 插件,装不上 Skill 市场。和 Codex 的配合方式是:让 Codex 当操作员,帮你克隆仓库、装依赖、改配置、启动界面。 片源丢进去之后,文案、配音、字幕由它自己排。本教程只讲本机开源版;成片效果取决于你自己的模型和接口额度,没有额度就跑不出片。
linyqh/NarratoAI 也能找到。
NarratoAI、runtime、tools 目录。
| 项目 | 说明 |
|---|---|
| 输入 | 本机视频文件;WebUI 默认允许单文件最大约 2048MB(启动参数 --server.maxUploadSize=2048) |
| 适用类型 | 电影解说、纪录片逐帧分析、短剧解说 / 短剧混剪 |
| 输出 | 解说文案 + 配音 + 字幕 + 自动剪辑成片;可选导出剪映草稿 |
| 语言 / 兼容 | 中文界面;Windows 10/11、macOS 11+;大模型走 OpenAI 兼容接口 |
| 规格 / 容量 | 界面 Streamlit;可选 TwelveLabs 做整段画面理解;Sonilo AI 配乐当前最长约 6 分钟 |
| 环境 | 建议配置 |
|---|---|
| 操作系统 | Windows 10/11,或 macOS 11.0 以上(Apple Silicon 用 arm64 整合包) |
| 运行环境 | 源码安装需要 Python 3.12+ + uv;整合包自带运行时,不用另装 Python |
| 硬件 | 官方建议最低 4 核 CPU、8GB 内存;显卡非必须 |
| 低配 / 无卡方案 | 无卡也能开界面。文案和配音走云端 API,没额度就只能停在配置页,出不了成片 |
| 关键依赖 | config.toml 里的大模型 Key、TTS Key;源码装法另需 uv sync 拉齐依赖 |
uv。整合包用户跳过本步。源码安装请先装好 Python 3.12+,再装包管理器 uv。不要用 3.10 / 3.11 硬上,0.8.5 之后官方流程按 3.12 写。
python --version
# 应显示 3.12.x 或更高
pip install uv
uv --version
整合包(推荐):到仓库 README「快速启动 → 方式一」下载对应系统包,完整解压。Windows 先双击 update-windows.bat,完成后再双击 start.bat,保持窗口不要关,浏览器打开本机 8501 端口。
源码:在 GitHub 搜索 linyqh/NarratoAI,复制仓库地址后执行:
git clone 粘贴仓库地址
cd NarratoAI
uv sync
cp config.example.toml config.toml
macOS 也可用 Docker:进目录后执行 docker compose up -d,同样打开本机 8501。
用编辑器打开 config.toml,至少填一组大模型 Key 和一组 TTS Key。保存后启动:
uv run streamlit run webui.py --server.maxUploadSize=2048
浏览器打开本机 8501。左边填模型 / 配音,右边把视频拖进去,再选片种(电影解说 / 短剧解说等),点生成。文案、配音、字幕会按任务往下排。接口没余额时,界面能开、视频能拖,但成片任务会失败——先确认额度再跑。
启动与配置要点:
| 项 | 作用 |
|---|---|
config.toml | 大模型、视觉模型、TTS、路径等总配置,从 example 复制后再改 |
--server.maxUploadSize=2048 | 把上传上限放到约 2GB,电影原片才拖得进去 |
| 本机 8501 | Streamlit 默认端口,整合包和源码都走这里 |
vision_llm_provider | 视觉后端;需要整段画面理解时可改为 twelvelabs |
| 背景音乐 · Sonilo | 0.8.6 可选 AI 配乐,默认关;最长约 6 分钟,失败会回退随机 BGM |
界面里还能做短剧解说 / 混剪、一键合并素材、Fun-ASR 一键转录字幕,以及导出剪映草稿再精修。语音克隆走 IndexTTS(macOS 有 MLX 包)。这些都是本机功能,不需要再装第二套软件。
# 源码装法更新到最新版后重装依赖
git pull
uv sync
# 整合包用户:再跑一次 update-windows.bat / update-macos.command
它不是 Skill,也没有官方 MCP。正确用法是把仓库丢给 Codex,让它按 README 执行:克隆、uv sync、复制并改 config.toml、启动 WebUI、对照报错补 Key。你负责提供片源和接口额度;它负责把安装和启动跑通。
| 对比项 | NarratoAI | 通用文生视频 / 剪辑助手 |
|---|---|---|
| 定位 | 影视解说一条龙(文案+配音+字幕+裁切) | 出画面或辅助剪辑,不专做解说 |
| 画面从哪来 | 你自己的片源,它负责理解和剪 | 多数要重新生成画面 |
| 上手 | 本机 WebUI,拖文件即可;要自己备 Key | 有的更轻,有的要写提示词出片 |
| 成本 | 软件开源;钱花在模型和 TTS 额度上 | 按生成秒数或订阅计费更常见 |
| 和 Codex | Codex 当安装/运维操作员,不是插件 | 部分可做成 Skill / MCP |
剪辑软件要你自己写稿、对口型、切镜头。文生视频是重新生成画面。NarratoAI 吃的是你已有的电影/短剧文件,输出的是解说文案、配音、字幕和裁切后的成片。
Windows 10/11、macOS 11+。输入是本机视频;启动时加上 --server.maxUploadSize=2048 可上传约 2GB 的片子。Linux 可用 Docker,官方整合包目前写的是 Windows 和 Apple Silicon。
先看 config.toml 的 Key 是否填对、对应平台是否还有额度。没余额时界面照样能开、视频也能拖,生成任务会失败。再看启动窗口报错:依赖没装齐就重新 uv sync,端口被占用就关掉旧窗口。
能。官方写明显卡非必须。理解画面和写稿走云端大模型,配音走 TTS 接口。本机只负责界面、裁切和拼接。内存建议 8GB 以上。
只想用:整合包。macOS 想隔离环境:Docker。要让 Codex 改配置、跟版本:源码 + uv。三种最后都是打开本机 8501。
不要找 NarratoAI Skill。把仓库地址发给 Codex,让它按 README 克隆、装依赖、复制 config.toml、把 Key 填进对应字段、启动 WebUI。你提供片子和额度即可。
开源仓库叫 NarratoAI。网上有改名售卖和名称相近的项目,仓库 Wiki 有对照说明,别买二手改名包。作者另有托管版入口,本教程只覆盖本机开源版,不涉及云端套餐和邀请码。
GitHub 上的 LICENSE 文件是 MIT。仓库说明里也曾写过仅供学习研究、不得商用。商用前以仓库当前 LICENSE / README 为准,必要时联系作者。用别人的电影、短剧做解说,还要单独处理片源版权,和软件协议是两件事。
本机裁切留在本地。你填的大模型、TTS、以及可选的 Sonilo 配乐,会按各家接口上传对应内容。启用第三方配乐前先看对方条款;官方也提醒生成音乐会把尚未加 BGM 的成片传到该服务。