本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
读完这篇文章你会得到什么?——一份可实操的 AI 视频自动化工作流手册。2026 年,AI 视频生成已经跨过了一个关键拐点:你不再需要自己在各个工具之间来回搬运素材、手写提示词、逐段拼接视频。借助 GPT-5.6 系列模型和 OpenAI Codex 这个 AI Agent 平台,再通过 MCP 协议或 CLI 命令行打通 Higgsfield、即梦(Seedance 2.0)等视频生成平台,你可以让 AI 自己完成"理解需求→写剧本→生成角色图→产出一段段分镜→自动拼接成片"的全链路。本文会手把手拆解两套主流方案:一套是 Codex + Higgsfield MCP 的云端自动化路线,另一套是 Codex + 即梦 CLI 的多工具联动路线。每套方案都有具体的配置步骤、提示词策略和踩坑经验。想看完整拆解,往下翻。
一、当 AI Agent 学会自己拍视频:2026 年的一个周末实验
先说一个我最近的体验。
某个周六下午,我给 Codex 发了一段话,大意是:"帮我做一个一分钟的短片,废土风格,男女主角在废弃工厂里对决,要有紧张的打斗和对话,最后自动拼成成品。"然后我就去泡了杯咖啡。大概四十分钟后回来,桌面上已经躺着一个完整的 MP4 文件——从剧本、角色设定、分镜脚本,到每一段视频的生成和拼接,全是 AI 自己干的。
说真的,不是炫技。我自己折腾 AI 视频创作快两年了,从最早的 Midjourney 出图再手动导入剪辑软件,到后来用 Runway 一段一段地生成,再到今年年初试着用各种 MCP 连接器做半自动——这次的感觉完全不一样。当 Agent 真的能自己拿主意的时候,创作者的角色在发生变化:你不再是一个"操作员",更像是一个"导演"或者"制片人",只需要把创意方向讲清楚,其他的交给 AI 去执行。
这篇文章就是要把我踩过的坑、跑通的流程、总结出来的方法论,完整地摊开来跟你聊。
莫潇羽@源码七号站,这几年一直在折腾 AI 创作工具链的自动化。下面的内容,全是基于我个人的实操体验整理而成,没有玄学,只有能跑通的步骤。
这篇文章会覆盖两条主流的技术路线:
- 路线 A:GPT-5.6 + Codex + Higgsfield MCP。走云端多模型路线,Higgsfield 本身聚合了 Seedance 2.0、Veo 3.1、Kling 3.0 等十几个视频模型,通过 MCP 协议让 Codex 直接调用,不用在多个平台之间切换。
- 路线 B:GPT-5.6 + Codex + 即梦 CLI。走字节跳动 Seedance 2.0 的原生路线,通过即梦的命令行接口让 Codex 操控浏览器自动完成图片和视频的生成与拼接。
两条路各有优劣,后面会详细对比。另外,本文演示中使用的角色名称(林夕、凯恩)和故事设定均为虚构,仅用于说明技术流程。你在实际操作时完全可以替换成自己的创意。
先不管走哪条路,有几样基础的东西得先搞明白。往下看。
二、先搞懂三样东西:GPT-5.6、Codex 和 MCP 协议
在动手之前,有三样东西必须讲清楚。它们是这个工作流能够运转的底层支撑,理解之后你才不会被各种"连不上""报错""不知道发生了什么"的情况卡住。
2.1 GPT-5.6:三个"段位",各有所长
2026 年 6 月,OpenAI 正式发布了 GPT-5.6 系列模型。这次的命名方式挺有意思,用了太阳、地球和月亮来区分三个层级:
|
模型名称 |
定位 |
核心特点 |
适合场景 |
|
GPT-5.6 Sol(太阳) |
旗舰 |
最强推理能力,Agent 任务首选 |
复杂自动化工作流、长剧本创作、多步骤决策 |
|
GPT-5.6 Terra(地球) |
平衡 |
性能比肩前代 GPT-5.5,成本减半 |
日常视频生成、常规提示词撰写、中等复杂度任务 |
|
GPT-5.6 Luna(月亮) |
轻量 |
极低成本,快速响应 |
批量生成简单短视频、快速测试 Prompt |
对于咱们要做的视频自动化工作流来说,Sol 是首选。因为从写剧本到生成分镜提示词再到判断视频质量,每一步都对模型的推理深度有要求。Terra 适合在已经把工作流跑顺之后做日常批量任务。Luna 的话,处理一些简单的短视频脚本生成绰绰有余。
跟上一代比起来,GPT-5.6 系列最大的提升在于"Agent 原生能力"——它不是简单地把对话能力增强了,而是从底层就为"自主代理工作"做了优化。上下文窗口拉到了 105 万 token,最大输出 12.8 万 token。这意味着它可以在一轮对话里处理一整部短片的全部素材和提示词,不会因为上下文不够而"失忆"。
2.2 Codex:它不只是个写代码的
很多人对 Codex 的印象还停留在"GPT 的编程助手",这其实已经是老黄历了。
2026 年的 Codex,准确地说,是一个 AI Agent 操作系统。它能做的事情包括但不限于:
- 读写你电脑上的文件(项目文件夹级别的操作)
- 在终端里执行命令(安装依赖、运行脚本)
- 操控浏览器(自动登录网站、填写表单、点击按钮)
- 调用外部 API 和 MCP 服务
- 跨应用协作(Slack、邮件、GitHub 等 90+ 集成)
对于我们做视频自动化这件事,Codex 最核心的价值在于:它能把"在网页上点点点"这个动作变成自动化的。以前你得自己打开即梦网页、粘贴提示词、点击生成、等待、下载、再上传到剪辑软件……现在 Codex 可以替你完成这些机械操作,你只管确认质量和方向。
Codex 目前有 macOS 和 Windows 桌面版,也支持 iOS 和 Android。桌面版的体验最完整,因为它可以直接访问本地文件系统和终端。
2.3 MCP 协议:AI 世界的"万能转接头"
MCP 全称 Model Context Protocol(模型上下文协议),最早由 Anthropic 在 2024 年底推出,到了 2026 年已经成了 AI Agent 连接外部工具的行业标准。
你可以把 MCP 理解成 AI 的 USB-C 接口。在没有 MCP 之前,如果你想让 GPT 操作 Higgsfield 生成视频,开发者需要专门为 Higgsfield 写一套集成代码。换了即梦又得再写一套。有了 MCP 之后,Higgsfield 提供一个 MCP Server,GPT(作为 MCP Client)直接通过标准协议发现和调用它的全部功能,不需要任何定制开发。
用一个简单对比来说清楚:
|
没有 MCP 的时代 |
有 MCP 的现在 |
|
每个工具单独写集成代码 |
工具提供标准 MCP Server,一次配置 |
|
切换工具=重新开发 |
换工具=换一个 MCP 连接地址 |
|
AI 不知道工具有哪些能力 |
MCP Server 自动告知 AI 可用的全部功能 |
|
人工手动在工具间搬运数据 |
Agent 通过 MCP 自动完成数据流转 |
对我们做视频自动化的场景来说,MCP 的妙处在于:你告诉 Codex"帮我用 Higgsfield 生成一段十秒的废土风格视频",Codex 会通过 MCP 自动了解到 Higgsfield 支持哪些模型、需要什么参数、积分怎么扣,然后自己决定用哪个模型、写什么提示词、怎么提交生成任务——全程不需要你教它每一步怎么做。
好了,基础概念就到这里。下面来认识一下我们要联动的那两个视频生成平台。
三、工具链总览:AI 视频生成平台怎么选
目前市面上能打的 AI 视频平台不少,但能和 Codex 通过 MCP 或 CLI 做深度联动的,主要有两个方向。我先帮你梳理清楚,再做选择。
3.1 Higgsfield AI:多模型聚合的"创意操作系统"
Higgsfield 这家公司 2023 年由前 Google Brain 工程师创立。2026 年初,Higgsfield 宣布完成 8000 万美元的 A 轮扩展融资,使 A 轮融资总额达到 1.3 亿美元,估值达到约 13 亿美元,投资方包括 Accel、Menlo Ventures 和 GFT Ventures 等知名机构。它最大的特点是不自己训练视频模型,而是聚合了市面上几乎所有主流模型:
|
模型名称 |
出品方 |
擅长方向 |
Higgsfield 集成方式 |
|
Seedance 2.0 |
字节跳动 |
文生视频、图生视频、首尾帧控制 |
MCP / CLI / 网页端 |
|
Veo 3.1 |
|
高真实感视频 |
MCP / CLI / 网页端 |
|
Kling 3.0 |
快手 |
人物动作流畅度 |
MCP / CLI / 网页端 |
|
Sora 2 |
OpenAI |
复杂场景理解 |
MCP / CLI / 网页端 |
|
WAN 2.6 |
阿里 |
中文语义理解 |
MCP / CLI / 网页端 |
|
Hailuo |
MiniMax |
快速生成 |
MCP / CLI / 网页端 |
对于创作者来说,Higgsfield 的核心优势一句话就能概括:在一个地方用同一个积分体系调用所有模型。你不用在即梦充一笔、在 Runway 充一笔、在 Kling 充一笔——Higgsfield 帮你统一了入口和计费。
Higgsfield 于 2026 年 4 月 30 日正式发布了官方 MCP Server。这里有一个需要澄清的背景:Higgsfield MCP Server 最初是面向 Anthropic 的 Claude Code 设计的,发布时的官方教程和社区案例也大都围绕 Claude Code 展开。但由于 MCP 本身是一个开放标准协议,任何支持 MCP Client 的 AI Agent 平台——包括 OpenAI 的 Codex、ChatGPT、Antigravity、Gemini CLI 等——都可以通过同一个 MCP 端点连接 Higgsfield。换句话说,Higgsfield MCP 不挑"宿主",只要你的 AI 工具支持 MCP,就能接上去用。
连接成功后,Codex 能看到 Higgsfield 上所有可用的模型和参数,你可以直接用自然语言说"用 Seedance 2.0 生成一段十秒的好莱坞运镜视频",Codex 会自行选择正确的模型和参数来完成。
Higgsfield 的订阅从每月 15 美元(Starter)到 129 美元(Ultra)不等,不同套餐对应不同的月积分额度。积分价格变动很快,上面是写稿时的近似行情,请以官方定价页面的实时数据为准。
3.2 即梦 / Seedance 2.0:字节跳动的原生武器
即梦是字节跳动旗下的 AI 内容创作平台,底层模型是 Seedance 系列。2026 年 2 月发布的 Seedance 2.0 在 Artificial Analysis 的盲测榜上以 Elo 1269 分登顶,击败了 Veo 3 和 Sora 2,这在当时是相当炸裂的消息。
Seedance 2.0 的核心能力:
- 文生视频:根据文字描述直接生成视频
- 图生视频:上传参考图,让画面动起来
- 首尾帧控制:指定开头和结尾画面,AI 自动补足中间过渡(这个功能做转场特别好用)
- 运镜控制:推拉摇移等专业镜头语言
- 口型同步:配合音频实现人物说话效果
Seedance 2.0 还有一个"极速版"(Fast),牺牲一点画质换取更快的生成速度,适合做快速原型和批量内容。
在国内使用即梦,登录需