作者:莫潇羽 | 来源:源码七号站(www.fuyuan7.com)| 转载请注明出处
快速摘要
OpenMontage 是目前首个完整开源、以智能体(Agent)为核心驱动的端到端视频生产系统。它把 Claude Code、Cursor、Copilot、Windsurf、Codex 这类 AI 编程助手直接改造成"视频工作室",用自然语言下达需求,智能体自动完成选题调研、脚本撰写、素材生成、剪辑合成的全流程。
核心要点只看这一段就够:一是"零 API Key 也能出片",依赖 Piper 离线 TTS、Pexels/Pixabay 免费素材和 Remotion 程序化合成,本机跑通无需任何付费接口;二是"真实实拍素材路线",智能体会从 Archive.org、NASA、Wikimedia 等开放档案检索运动镜头,组合成纪录片式蒙太奇,而不是简单让图片抖两下;三是"从参考视频逆向工程",粘贴一条 YouTube Short 或 TikTok 链接,智能体会拆解节奏、钩子和结构,反向生成同风格不同主题的成片。项目地址:https://github.com/calesthio/OpenMontage ,采用 AGPL-3.0 许可证。 莫潇羽@源码七号站 整理。
下面是完整的技术拆解、安装实操与使用手册,想动手跑起来的读者建议通读全文再开干。
一、为什么 OpenMontage 值得单独拿出来讲
过去两年里,市面上冒出过大量"AI 一键生成视频"的产品。它们大多数都遵循同一条路径:输入一段文本,模型返回一段 5 到 10 秒的短视频片段。这种方式对于发发朋友圈、做做社交媒体小动图足够了,但只要你稍微较真一点——想要一段有旁白、有 BGM、有节奏感、镜头之间有逻辑关联的完整成片——你就会发现这些工具几乎全都卡在"单镜头生成器"的层级上。
OpenMontage 想解决的,不是"如何用 AI 生成一个镜头",而是"如何用 AI 编排一整套视频制作的工业流程"。
在传统影视工业里,一条哪怕 60 秒的成片,背后至少需要经过以下几个环节:资料调研、立意概念、脚本撰写、分镜规划、素材采集、音画剪辑、字幕配音、质量审查。每一环都由不同工种协作完成。OpenMontage 做的事情是:把这一整条流水线拆解成模块化的"管线"(Pipeline),每个管线由若干"阶段"(Stage)串联,每个阶段配一份 Markdown 格式的"导演技能书"(Director Skill)告诉智能体该怎么干。然后把读取这套技能书、调用工具、自审自检、人机确认的控制权——完整地交给你的 AI 编程助手。
换句话说,OpenMontage 本身并不是一个"引擎",它是一套"剧本"。真正执行剧本的是你已经在用的 Claude Code 或 Cursor。这个架构设计挺聪明:AI 编程助手天然具备"读文件、写文件、执行命令、调试报错"的能力,只要给它一份足够详尽的操作手册和一组称手的工具,它就能像一个新人剪辑师那样,按章办事把片子交出来。
二、它到底能做什么:12 条管线的应用全景
按照 GitHub 主仓库当前的公开信息,OpenMontage 官方目前已经沉淀了 12 条生产管线、52 个生产工具和 500 多份智能体技能文档(不同版本数量略有差异,早期版本为 11 条管线、49 个工具、400+ 技能)。这些管线覆盖的场景非常宽:
- Animated Explainer(动画解说):最经典的"知识博主式"视频。针对一个话题做调研、写脚本、配旁白、生成配图、加字幕加音乐。典型案例就是"量子计算是什么""黑洞是怎么形成的"这种类型。
- Animation(动态图形):kinetic typography 动态字体、motion graphics 动态图形、抽象概念可视化。适合做短视频口播、产品广告开场。
- Avatar Spokesperson(数字人播报):基于 SadTalker、MuseTalk、Wav2Lip 这类开源方案,让一张静态头像"开口说话"。适合公司公告、培训视频、虚拟主播这类需要"有人出镜"但又不方便真人出镜的场景。
- Cinematic(电影级预告):带调色、带气氛音乐、带运镜的广告级短片。文档中演示的 "SIGNAL FROM TOMORROW"(未来信号)就是这条管线产出的科幻预告片。
- Clip Factory(切片工厂):把一段长视频(比如两小时的播客或直播回放)切成十几条甚至几十条短视频。对做二创、做账号分发的创作者来说,价值巨大。
- Hybrid(混合素材):实拍加 AI 生成的补充画面。适合你自己已经有一批素材、但想让它更丰富更好看的场景。
- Localization & Dub(多语言配音):把一条原始视频翻译成十几种语言并配上对应语音。跨境出海内容的标配。
- Podcast Repurpose(播客二次包装):播客音频配可视化动效、配字幕、配封面,变成可以放进抖音、视频号、B 站的"Audiogram"式视频。
- Screen Demo(屏幕演示):软件操作、产品演示。接入系统屏幕录制后,自动加旁白、加标注、加转场。
- Talking Head(人物口播):真人或数字人主讲。自动识别卡壳、口误、冗余停顿,做节奏优化。
- Documentary Montage(纪录片蒙太奇):这是零 Key 路线下最有代表性的玩法。全程使用真实档案镜头,不用 AI 生成任何画面。
- Product Launch / Commercial(产品宣传):品牌 Teaser、电商短广告、新品发布预热片。
你可以把这些管线理解为一组"制片模板"。你跟智能体说"帮我做一个 60 秒关于神经网络如何学习的动画讲解视频",它会自动匹配到 Animated Explainer 管线;你说"做一个 75 秒关于雨天城市生活的纪录片蒙太奇",它会切到 Documentary Montage 管线。不同管线调用的工具链不一样,但顶层的"七段式"工作流完全一致。
2.1 为什么是"12 条管线"而不是"一个万能生成器"
很多读者读到这会有个疑问:既然都是 AI 驱动,为什么不做一个"万能管线",用户说啥就出啥?OpenMontage 给出的答案其实挺实在的——因为不同类型的视频,工业流程本来就不一样。
一条科普动画解说和一条产品广告片,底层需要的"手艺"完全是两回事。前者要的是清晰的逻辑递进、友好的旁白节奏、恰到好处的视觉比喻;后者要的是强烈的情绪钩子、精美的视觉呈现、直击痛点的卖点表达。你把这两个塞进同一条管线,就会遇到"什么都想做结果什么都做不好"的窘境。OpenMontage 的做法是把每一种典型场景都抽象成一条独立管线,每条管线都有自己的调研策略、脚本模板、素材策略、剪辑节奏。这种设计哲学其实很像实体制片厂——纪录片组、广告组、动画组是分开的,工具共享但流程不共享。
这也是为什么你会看到文档里反复强调"Pipeline Director Skill"(管线导演技能)这个概念。每条管线背后都有一位"数字导演",它不是万能选手,而是在自己这条赛道上受过专门训练的专业人士。
三、七段式工作流:一条视频是怎么被造出来的
OpenMontage 所有管线都遵循同一条流水线,只是每一段的具体实现不同:
research → proposal → script → scene_plan → assets → edit → compose
(调研) (立意) (脚本) (分镜) (素材) (剪辑) (合成)
这条流水线里最值得单独拿出来说的是 research 阶段。和市面上大多数 AI 视频工具"上来就写脚本"的做法不同,OpenMontage 把"联网做功课"设定为第一等公民。官方文档里明确写道:智能体在动笔写第一个字之前,会跨 YouTube、Reddit、Hacker News、新闻站点、学术来源跑 15 到 25 次以上的网络搜索,收集数据、观众关心的问题、当前的流行角度、可视化的参考案例,然后把所有信息整理成一份结构化的调研简报,并在引用处注明来源。这一步直接决定了后续脚本是"凭空想象"还是"有据可查"——也是为什么用它做出来的科普片不容易出现"一本正经说错常识"的核心原因。
走完调研之后是 proposal 阶段。智能体会给你 2 到 3 个差异化的创意方向,比如同一个"神经网络"主题,可以是"走厨师类比风格的轻松风",也可以是"走硬核数学风",还可以是"走人物传记故事线"。每个方向会附上预计时长、可行的工具路径、估算成本。你确认一个方向之后,进入 script 阶段——写完整台本,包含旁白、口播节奏、情绪指示、视觉提示。再进入 scene_plan 阶段——把台本拆成一个个分镜,每个分镜明确画面内容、持续时长、转场方式。
到了 assets 阶段,智能体才真正开始"动手":调用 TTS 合成旁白,调用图片或视频生成接口做画面,去素材库检索片段,找免费版权音乐做背景。edit 阶段把这些素材按分镜组合起来,对齐时间码,处理音画同步。最后是 compose 阶段,用 Remotion 或 FFmpeg 完成最终合成:烧录字幕、加入转场、调色、压制,输出指定平台规格的成片。
在这套流水线跑完之后,OpenMontage 还内置了一套 self-review(自审)机制:它会用 ffprobe 校验输出文件的码率、分辨率、时长是否符合预期,用帧采样工具抽取若干关键帧做视觉检查,用音频电平分析查看是否有爆音或静默段,用 Whisper 反向转录旁白看是否有口齿不清的段落。发现问题就回到上一个阶段重做。整个过程里会在几个关键创意决策点停下来等你点头——你始终保留最终控制权。
四、零 API Key 路线:真正免费的那条路怎么走通
这是很多人关注 OpenMontage 的头号理由。让我们把这条路线彻底拆开讲清楚。
4.1 零 Key 模式下的工具链
在你执行完 make setup 之后,即使完全不填任何 API Key,你也可以直接开始做视频。这套开箱即用的免费工具链包含以下几块:
- 旁白合成:Piper TTS。这是一个 C++ 写的高质量离线文本转语音引擎,源自 Rhasspy 项目,支持中英日法等数十种语言,MOS 评分在开源 TTS 里属于第一梯队。完全跑在本机 CPU 上,不联网、不上传、无配额。
- 画面素材:Pexels 和 Pixabay。两家都是全球知名的免费商用素材站,API Key 可以免费申请(注意是"免费申请",不是"付费 Key")。Pexels 覆盖大量人物、风景、城市、职场类短镜头;Pixabay 则在卡通、图形、矢量素材方面更强。两个加起来足以覆盖绝大多数通用场景。
- 档案素材:Archive.org 互联网档案馆、NASA 公开图库、Wikimedia Commons。这三家是"真实素材纪录片路线"的主力。Archive.org 藏着海量公共领域老电影、纪录片、新闻影像;NASA 图库里有所有公开的太空、行星、地球科学影像;Wikimedia Commons 里则是自然、动物、建筑、历史文物的金矿。三家全部是公共领域或开放许可,合规使用无压力。
- 视频合成引擎:Remotion。这是基于 React 的"程序化视频"框架,也是 OpenMontage 最核心的底座之一。它能把一堆静态图片"动起来":加弹簧物理动画、做画面切换、叠加排版精致的字幕、做 TikTok 风格的逐词高亮字幕、加入 Google Fonts 的字体、处理音频淡入淡出曲线。关键在于它所有效果都是 React 代码写出来的——也就是说,AI 编程助手对它的驾驭能力几乎是天生的。
- 后期处理:FFmpeg。视频工业的瑞士军刀。编码、切片、字幕烧录、音轨混合、调色、变速、转码、抽帧,全能搞定。命令行工具,本机免费。
- 字幕生成:内置 WhisperX 集成。做自动逐词时间轴字幕,精度达到"每个词单独高亮"的级别,直接支持 SRT 和 VTT 两种格式。
4.2 零 Key 的两条创作路线
把这些工具组合起来,OpenMontage 在零 Key 模式下给出两条完全跑得通的成片路线:
第一条:图片驱动路线(Piper 旁白 + 图片素材 + Remotion 动画)
这条路线的核心思路是:画面不用实拍,也不用 AI 生成运动镜头,而是用高质量静态图片加上程序化动画来"伪装成动视频"。智能体会按照脚本分镜,从 Pexels/Pixabay 拉一组高质量静图,然后交给 Remotion 做缓动、平移、缩放、转场。配上 Piper 旁白和免费 BGM,叠上逐词字幕,就能产出一条观感相当专业的科普向短片。这条路线最大的优势是速度快、成本零、失败率低,缺点是画面节奏略偏"图文型",不适合做动作感强的叙事片。
第二条:真实素材纪录片路线(Archive/NASA/Wikimedia + Pexels + Piper)
这条就有意思多了。智能体会先按照脚本里的关键词,到 Archive.org、NASA、Wikimedia 以及 Pexels 的视频板块做语义检索,把命中的真实运动镜头抓回来。然后做语义排序,把最贴合分镜描述的镜头优先使用,剪成一条真正有"运动感"的蒙太奇时间线。最后用 Remotion 加上标题卡、过渡效果、字幕。这种出片的质感,跟那种"让图片晃两下当视频"的方案有本质差别。
要走第二条路线,你在提交需求的时候要明确说:"documentary montage"(纪录片蒙太奇)或者 "use real footage only"(只用真实素材)。智能体识别到这两个关键词之后会自动切换到对应的管线。
4.3 零 Key 路线的实战 Prompt 示范
以下这些 Prompt 在 make setup 之后无需任何付费接口即可直接跑通(由 莫潇羽@源码七号站 实测整理):
- "做一个 45 秒的动画讲解视频,主题是天空为什么是蓝色的,带旁白、配字幕、配 BGM"
- "做一条 60 秒的互联网发展史视频,时间线式推进,带逐词字幕"
- "做一条数据驱动的短片,关于全世界咖啡消费情况,要图表动画"
- "做一个 90 秒的纪录片蒙太奇,主题是凌晨四点的城市,只用真实素材,不要旁白,哀伤优雅的语气,配钢琴配乐"
- "把我这段 3000 字的技术博客改编成 2 分钟的科普视频,风格要轻松一点"
五、从参考视频反向工程:OpenMontage 最被低估的功能
很多人第一次用 AI 视频工具会卡在"我到底要写什么 Prompt"这个门槛上。OpenMontage 针对这个痛点做了一个非常聪明的功能:从参考视频起步。
你不需要凭空想 Prompt,只需要扔给它一条你喜欢的 YouTube 视频、YouTube Short、Instagram Reel、TikTok 或者本地视频文件。智能体会完整拉取这条视频的字幕(如果是 YouTube 可以直连官方字幕接口),分析节奏、钩子样式(hook)、场景结构、关键帧视觉风格、语气情绪,然后返回一个 grounded production plan(有据可依的制作方案)。
这份方案里包含几件东西:
- 它会保留什么:节奏(比如"前 3 秒一个钩子")、钩子样式(比如"反问开场")、结构(比如"问题—冲突—解法"三段式)、语气(比如"高能激昂"还是"克制内敛")。
- 它会改变什么:主题(你指定的新主题)、视觉呈现(AI 生成还是实拍、卡通还是写实)、切入角度(比如同一个"咖啡"主题,原片从文化切入,你想从健康切入)、旁白方式(女声还是男声,快节奏还是慢节奏)。
- 预估成本:根据你目标时长和当前配置的 API Key,算出这条片子大概会消耗多少美元。
- 当前工具配置下的最终效果预览:智能体会明确告诉你,"用你现在这套工具做出来,画面水平大概是什么样"。
典型用法长这样:
"这是一条我很喜欢的 YouTube Short(附上链接)。帮我做一条类似的,但主题改成量子计算。"
你会得到结构清晰的输出,而不是一堆含混的 Prompt 堆砌。这种"看着别人的作品学做自己的作品"的工作方式,几乎是所有视频创作者最自然的起点。
六、安装实操:从零到跑出第一条片子
接下来进入真正动手的环节。莫潇羽@源码七号站 把这一段写得尽量细,零基础读者按步骤照做就行。
6.1 开始之前:几个需要提前想清楚的问题
在把命令敲进终端之前,建议你先花 5 分钟自问自答下面这几个问题,能帮你少走很多弯路。
你想做的是哪一类视频? 如果是"纯图文科普解说",零 Key 路线完全够用;如果是"真实运镜的纪录片感",需要零 Key + 档案素材策略;如果是"AI 生成的运动镜头" 那种"让场景真的动起来"的片子,那必须接入至少一个云端视频生成 API(fal.ai 的 FAL_KEY 性价比最高);如果是"虚拟数字人口播",建议配合 ElevenLabs 做旁白 + SadTalker 做数字人。
你的产出频率大概是多少? 如果是一周一条深度长片,零 Key 路线完全可以胜任;如果是一天几十条短视频的矩阵分发,建议上云端 API 保证速度,但同时要把预算上限设得保守一点。
你有多少配置折腾的耐心? OpenMontage 本身安装并不复杂,但要把它用出花,需要读一些 Markdown 格式的"智能体技能文档",根据自己的需求改改默认的风格 playbook、改改默认的字幕样式、甚至 fork 一份做自己的定制管线。如果你完全不想碰这些,建议直接用它的开箱即用默认值,能做出来的东西也足够打九十分了。
你的网络环境稳定吗? 首次安装时需要从 PyPI、npm、HuggingFace、GitHub 等多个源拉依赖。国内用户建议先把 pip 源、npm 源都切换到国内镜像,或者用一次稳定的代理。这一步不做好,后面会卡在各种"安装超时"上折腾半天。
想清楚这几个问题再往下走,事半功倍。
6.2 系统环境要求
OpenMontage 支持 macOS、Linux、Windows 三大主流平台。硬件层面对 CPU 和内存没有特殊要求(8GB 内存起步即可),但如果你想用"本地 GPU 跑开源视频模型"这条进阶路线,那需要一块显存 8GB 以上的 NVIDIA 显卡(WAN 2.1 1.3B 模型的最低门槛);如果想跑 14B 的大模型,建议 24GB 显存起步。
软件层面需要准备三样东西:
- Python 3.10 或更高版本。官方下载地址 https://www.python.org/downloads/ 。建议装 3.10、3.11 或 3.12,不要装过新的 3.13,部分依赖还没完全跟进。
- FFmpeg。这是整个项目的"瑞士军刀"。macOS 用户直接
brew install ffmpeg,Ubuntu/Debian 用户sudo apt install ffmpeg,Windows 用户去 https://ffmpeg.org/download.html 下载 zip 包,解压后把 bin 目录加进 PATH。 - Node.js 18 或更高版本。Remotion 合成引擎跑在 Node.js 上。下载地址 https://nodejs.org/ ,LTS 版本即可。
最后是"一个能读文件和执行代码的 AI 编程助手"。官方明确支持 Claude Code、Cursor、GitHub Copilot、Windsurf、Codex,其实任意具备文件读写与 shell 执行能力的编程智能体都能跑。
6.3 三行命令把它装起来
打开终端,依次敲入:
git clone https://github.com/calesthio/OpenMontage.git
cd OpenMontage
make setup
make setup 会自动做几件事:创建 Python 虚拟环境、安装 requirements.txt 里的所有依赖、进到 remotion-composer 目录跑 npm install 装前端依赖、安装 Piper TTS、复制 .env.example 为 .env。整个过程首次执行大约需要 5 到 15 分钟,具体取决于网速。
如果你的系统没有 make 命令(典型的是 Windows 原生环境),可以手动执行等效命令:
pip install -r requirements.txt
cd remotion-composer
npm install
cd ..
pip install piper-tts
cp .env.example .env
Windows 用户常见坑:如果 npm install 报 ERR_INVALID_ARG_TYPE,改用 npx --yes npm install 即可绕过。
安装完成后,可以跑一下 make demo 或者 make test-contracts,前者会用零 Key 路线渲染一条演示片,后者跑合同测试确认环境健康。
6.4 .env 配置与渐进式解锁
打开 .env 文件,你会看到一串注释掉的 API Key 配置。OpenMontage 设计哲学里最人性化的一点是:所有 Key 都是可选的,填多少解锁多少。你可以从零 Key 起步,用着觉得缺哪个能力再补哪个。
从性价比角度看,最值得第一个添加的 Key 是 FAL_KEY。fal.ai 是一个 AI 模型网关服务,一个 Key 能同时解锁 FLUX 图像、Google Veo 视频、Kling 视频、MiniMax 视频、Recraft 图像这 5 个工具。也就是说,加一个 Key 你的素材生成能力从"只能用免费图"一下跳到"可以出真正的 AI 运动镜头"。
其他常用 Key 的用途如下(所有 Key 都是填了才启用,不填就自动跳过,不会报错):
- PEXELS_API_KEY:免费申请,解锁 Pexels 素材的正式 API(不填也能用网页端抓取,但并发和稳定性不如 API)。
- PIXABAY_API_KEY:同上,免费。
- SUNO_API_KEY:解锁 Suno AI,用于生成完整带人声的歌曲、纯乐器 BGM,支持任意风格,单曲最长 8 分钟。
- ELEVENLABS_API_KEY:解锁 ElevenLabs,包含顶级 TTS、AI 音乐、音效生成。适合对配音质感有高要求的场景。
- OPENAI_API_KEY:解锁 OpenAI TTS 和 DALL-E 3。如果你已经有 OpenAI 账号,这个 Key 的综合性价比相当高。
- GOOGLE_API_KEY:解锁 Google Imagen 图像、Google TTS(700 多个嗓音,支持 50+ 语言,是做多语言本地化的最佳选择)。
- HEYGEN_API_KEY:一个 Key 同时调用 VEO、Sora、Runway、Kling 多家视频模型。
- RUNWAY_API_KEY:Runway Gen-4 视频生成,以电影级质感见长。
6.5 有 GPU 的玩家的额外福利
如果你的电脑上有一块足够强的 NVIDIA 显卡,可以执行:
make install-gpu
然后在 .env 里加上:
VIDEO_GEN_LOCAL_ENABLED=true
VIDEO_GEN_LOCAL_MODEL=wan2.1-1.3b
VIDEO_GEN_LOCAL_MODEL 的可选值包括:
- wan2.1-1.3b:显存 8GB 左右即可跑,画质可用。
- wan2.1-14b:需要 24GB 显存,画质接近云端主流模型。
- hunyuan-1.5:腾讯混元视频的开源小版本,语义理解比较好。
- ltx2-local:轻量级但速度快的选项。
- cogvideo-5b:智谱 CogVideo 的开源版本。
开启 GPU 路径之后,OpenMontage 会优先在本地生成视频镜头。这意味着:零 Key + 本地 GPU = 真正意义上的完全免费全流程视频生产。这一点在官方文档里也被反复强调。
七、Remotion 到底是什么,为什么它能"把图变成视频"
在继续往下讲之前,单独拿出来介绍一下 Remotion。因为这个组件是 OpenMontage 零 Key 路线能跑通的最关键砝码,而很多中文读者对它还比较陌生。
Remotion 是德国开发者做的一个开源项目,官方定位是 "make videos programmatically with React"(用 React 写视频)。它的基本思路和 Figma、Framer Motion 这些前端工具有点像——都是用声明式的组件化方式描述视觉,然后通过一个运行时把这些描述"渲染"出来。只不过 Remotion 渲染出来的不是网页,而是视频文件。
具体来说,Remotion 把一段视频抽象成一个 React 组件树。整条视频的时间轴由 <Sequence> 组件组合而成,每个 Sequence 定义它在什么时间出现、持续多久。画面元素由普通的 React 组件构成,比如一张图、一段文字、一个图标。动画通过 useCurrentFrame() 这个 Hook 实现——你可以在组件里根据当前帧数计算任何属性,比如位移、缩放、透明度、颜色、曲线。
以一段"图片从左滑入并淡入"的镜头为例,用 Remotion 写出来大概是这个样子(伪代码):
const frame = useCurrentFrame();
const translateX = interpolate(frame, [0, 15], [-200, 0], {
extrapolateRight: 'clamp',
});
const opacity = interpolate(frame, [0, 15], [0, 1]);
return (
<img
src={src}
style={{
transform: `translateX(${translateX}px)`,
opacity,
}}
/>
);
这短短几行代码,就能得到一段"图片在 15 帧内从左侧滑入,同时淡入"的动画镜头。因为是程序化的,你可以用完全相同的代码模板处理几十张不同的图片,输出一条由几十个镜头组成的长视频。
这就是"零 Key 出视频"在底层到底发生了什么:OpenMontage 让智能体根据脚本的分镜要求,从免费素材库里抓一堆静态图片,然后生成一份 Remotion 组件树,调用 Remotion 的渲染器一口气输出成最终视频文件。中间不需要任何"图片转视频"的 AI 模型,全靠确定性的数学动画。结果就是——稳定、快速、免费、可控。
Remotion 还内置了对一系列实用能力的支持:
- Google Fonts 全字体库。需要什么字体直接按需加载,不用担心版权问题。
- TikTok 风格逐词高亮字幕。每个单词单独淡入、放大、高亮,这种在抖音/YouTube Shorts 上极其流行的字幕样式,Remotion 原生支持。
- Spring 弹簧物理动画。任意属性都可以用物理曲线运动,比手写缓动函数自然得多。
- 音频淡入淡出曲线。可以精确控制多段音频的混合。
- 章节标题卡、Hero 卡片、数据展示卡。这些视频模板里常见的"功能组件"都有现成实现。
- 转场动画。淡入淡出、滑动、擦除、翻转几种常见切换都是一行代码的事。
换个角度看,Remotion 的作用相当于给 OpenMontage 的"视觉输出"这个环节,配了一个"确定性的兜底方案"。即使云端视频生成模型全部不可用,哪怕你一个 Key 都不填,只要有图、有文字、有音频,Remotion 就能把它们组装成一条观感合格的成片。
八、技术架构三层图:为什么这套东西真的能跑通
要真正理解 OpenMontage 的可扩展性,必须看懂它的"三层知识架构"。
第一层 tools/ + pipeline_defs/ "有什么" 可执行能力 + 编排蓝图
第二层 skills/ "怎么用" OpenMontage 约定与质量标准
第三层 .agents/skills/ "怎么回事" 外部技术知识包(47 份)
第一层是"手"。tools 目录下是 Python 写的工具实现,当前版本有 52 个左右。按功能分成视频(12 家提供商 + 合成、拼接、裁剪)、音频(4 家 TTS 加 Suno、ElevenLabs 音乐、混音、增强)、图像(8 家图像生成 + 图表、代码高亮、数学动画)、增强(超分、抠图、脸部修复、调色)、分析(转录、场景检测、抽帧)、虚拟人(SadTalker、MuseTalk、Wav2Lip)、字幕(SRT/VTT 生成)。每个工具都继承自 BaseTool 基类,通过工具注册器自动发现,不需要手工注册。pipeline_defs 目录下是 YAML 写的管线清单,相当于"剧本大纲",告诉智能体"这条管线要走哪些阶段、每个阶段用哪些工具、阶段之间怎么串"。
第二层是"脑"。skills 目录下是 124 份 Markdown 写的技能文档,分 pipelines(每条管线每个阶段的导演技能)、creative(创意技法技能)、core(核心工具使用技能)、meta(审查、检查点协议)。这些文件其实就是写给智能体看的"操作指南",用自然语言告诉它"在这个阶段要关注什么、质量底线在哪、什么时候需要找人类确认"。
第三层是"库"。.agents/skills 目录下是 47 份外部技术知识包。每个工具都会声明它依赖哪些第三层技能。举个例子,FFmpeg 工具会指向一份详细的 FFmpeg 参数用法技能书;WhisperX 工具会指向 ASR 调参与错误处理技能书。这种设计让智能体在遇到"我不太懂这个命令行参数是什么意思"的时候,能够动态读取对应知识包补足上下文。
除此之外还有:
- schemas/:15 份 JSON Schema,做契约验证,保证每一阶段的输入输出都结构正确。
- styles/:视觉风格剧本(YAML),控制版式、字体、配色、运动风格、音频调性。目前内置了 Clean Professional(干净专业风)、Flat Motion Graphics(扁平动态图形)、Minimalist Diagram(极简图示)三套。
- remotion-composer/:React + Remotion 的合成引擎,负责最后一步的画面叠加、字幕烧录、程序化动画。
- lib/:基础设施,处理配置、检查点、管线加载。
这一层架构决定了 OpenMontage 的"可扩展性"与"可审计性":所有创意逻辑、质量标准、审查规则都写在可读的纯文本文件里,你可以打开、可以修改、可以叉一份出来做你自己的风格。Python 只负责"工具和存档"这两件事,真正的"编剧和导演"是你的智能体。
九、完整的服务商地图:从免费到专业级
OpenMontage 支持的外部服务商阵容相当全。我把它整理成几张表,方便你快速选型(莫潇羽@源码七号站 实测整理)。
9.1 视频生成(12 家)
|
提供商 |
类型 |
说明 |
|
Kling(可灵) |
云 API |
高画质、速度快 |
|
Runway Gen-4 |
云 API |
电影级画面 |
|
Google Veo 3 |
云 API |
长镜头、电影级,通过 fal.ai 或 HeyGen 接入 |
|
MiniMax |
云 API |
性价比高 |
|
HeyGen |
云 API |
多模型聚合网关 |
|
WAN 2.1 |
本地 GPU |
免费,提供 1.3B 与 14B 两种参数量 |
|
Hunyuan |
本地 GPU |
腾讯开源,免费 |
|
CogVideo |
本地 GPU |
智谱开源,免费,2B/5B 两版 |
|
LTX-Video |
本地 GPU / Modal 自托管 |
本地免费或自托管云 |
|
Pexels |
免费素材 |
真实运动镜头 |
|
Pixabay |
免费素材 |
真实运动镜头 |
9.2 图像生成(8 家)
|
提供商 |
类型 |
说明 |
|
FLUX |
云 API |
目前开源系图像模型里的画质天花板 |
|
Google Imagen 4 |
云 API |
高画质,多比例支持 |
|
DALL-E 3 |
云 API |
OpenAI 自家图像模型 |
|
Recraft |
云 API |
设计向,擅长平面 |
|
Local Diffusion |
本地 GPU |
Stable Diffusion 系列,免费 |
|
Pexels / Pixabay |
免费素材 |
摄影图库 |
|
ManimCE |
本地 |
数学动画(3Blue1Brown 同款底层) |
9.3 文本转语音(4 家)
|
提供商 |
类型 |
说明 |
|
ElevenLabs |
云 API |
顶级质感,适合有调性要求的内容 |
|
Google TTS |
云 API |
700+ 嗓音,50+ 语言,本地化首选 |
|
OpenAI TTS |
云 API |
速度快,价格实惠 |
|
Piper |
本地 |
完全免费、离线、实时 |
9.4 音乐、音效、后期
音乐类:
- Suno AI:全曲生成(含人声、歌词、任意风格),单曲最长 8 分钟。
- ElevenLabs Music:AI 音乐生成,偏 BGM。
- ElevenLabs SFX:环境音、撞击声、脚步声、转场效果等音效生成。
后期类(全部本地免费):
- FFmpeg:视频合成、编码、字幕烧录、音轨混合。
- Video Stitch:多片段拼接、交叉淡入淡出、画中画、空间布局。
- Video Trimmer:精确剪切与抽取。
- Audio Mixer:多轨混音、ducking(人声占用时 BGM 自动压低)、淡入淡出。
- Audio Enhance:降噪、响度归一化。
- Color Grade:基于 LUT 的调色。
- Subtitle Gen:从时间戳生成 SRT/VTT。
增强类:
- Upscale:Real-ESRGAN 图像与视频超分。
- Background Remove:rembg / U2Net 抠图。
- Face Enhance / Face Restore:CodeFormer / GFPGAN 人脸修复。
分析类:
- Transcriber:WhisperX 语音转文字,带逐词时间戳。
- Scene Detect:自动场景边界检测。
- Frame Sampler:智能抽帧。
- Video Understand:CLIP / BLIP-2 视觉语言理解。
数字人 / 口型同步类:
- Talking Head:SadTalker / MuseTalk 驱动虚拟人说话。
- Lip Sync:Wav2Lip 做音画口型同步。
合成与渲染:
- Remotion:本地 Node.js 环境运行的 React 程序化视频引擎,负责图片成画、统计数据展示、章节标题卡、Hero 卡片、TikTok 逐词字幕、场景转场(淡入 / 滑动 / 擦除 / 翻转)、Google 字体、带淡入曲线的音频处理。当你没配任何视频生成服务时,智能体会生成静态图片然后交给 Remotion 把它们动画化——这就是"零 Key 也能出视频"的底层魔法。
- FFmpeg:底层的视频编排、编码、字幕烧录、音轨混合、调色。
十、WhisperX、场景检测、BLIP-2:那些藏在幕后的分析利器
OpenMontage 的"自审机制"之所以能跑起来,离不开一组专业级的分析