本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
一句话结论:让 AI 视频模型"看图说话"远比"听文字描述"靠谱,所以先用图像模型生成一张包含 9/16/24 个分镜的"宫格图",再把整张图喂给视频模型让它转成动态,是目前性价比最高的连贯运镜方案。这套思路核心做了两件事:一是把抽象的镜头描述变成具象的画面参考,二是把"动作连贯性"这种 AI 难以理解的概念,用空间排布的静态帧"翻译"出来。实测下来,相同算力预算下,分镜法的成片率比纯文生视频高 1 倍以上,角色穿模、动作跳帧的情况显著减少。
我把这套工作流拆成了"图像端选型 → 分镜提示词写作 → 视频端转换 → 后期修补"四个核心环节,后面会逐一拆解,包括 GPT-Image-2、Nano Banana Pro、即梦、可灵、Seedance 2.0、清影 CogVideoX 这些主流模型怎么搭配,提示词怎么写才不会"抽卡爆雷",一致性差怎么救。想看完整拆解,往下翻。
一、AI 视频总是翻车的根源:为什么"分镜思维"这么重要
折腾过 AI 视频的朋友大概都有过这种体验:在提示词里写了"一个剑客在竹林中和敌人打斗,先对峙再交手最后腾空翻转",生成出来的视频要么人物站着不动两秒钟就完了,要么动作糊成一团,要么前一秒是甲后一秒变乙。我自己第一次尝试也被这种"听话不办事"的情况折磨过很久,后来才慢慢摸清问题出在哪。
1.1 文生视频的根本短板
视频模型本质上是在做一件极其困难的事——它要同时理解"画面里有什么"和"这些东西怎么动"。前者属于空间理解,后者属于时间理解,两个维度叠加在一起,任何一头的描述含糊,出来的结果就崩。文字描述天生就是"线性""低带宽"的,你写一千字也很难精确表达一个 8 秒视频里 200 帧画面的所有空间关系。这就像你打电话给朋友描述一幅画,讲半小时可能还不如发张照片让对方看一眼。
我自己折腾下来的体会是,AI 视频模型不缺生成能力,缺的是足够强的"参考信号"。当你只给它一段文字描述,它会基于自己的训练数据"脑补"出无数种可能,然后随机挑一种生成,这就是为什么同一个提示词跑十次会得到十个不同效果。但如果你给它一张图,它就有了一个强约束——这个人物长这样、衣服是这个颜色、动作起势是这样的。所有可能性被一张图压缩到了一个很小的范围里,自然就稳了。
1.2 单图生视频也有天花板
那是不是用一张图配一段提示词就够了呢?早期我也是这么想的。直到做了一段武打镜头才发现问题——一张图只能锁住"起点",锁不住"过程"。AI 知道你这个剑客一开始持剑站着,但它不知道接下来这一刀该往左劈还是往右撩;它也不知道你想要的是"快速三连击"还是"一招制敌";更不知道镜头是该跟着主角动还是固定不动。
结果就是 AI 会按自己理解的"合理动作"自由发挥,出来的视频可能技术上没毛病,但完全不是你想要的那个故事。这一点在拍复杂动作(武打、追逐、舞蹈、运动)和连续叙事(短剧、广告、VLOG)的时候特别明显。莫潇羽@源码七号站之前做过一组功夫短片测试,纯单图生视频的成片可用率不到 30%,大部分要么动作平庸,要么干脆不动。
1.3 分镜思维如何破局
回到电影行业怎么解决这个问题。一部正经电影开拍前,导演会跟分镜师一起把每一个镜头都画出来,这个过程叫"画 storyboard"。一段三秒的打斗可能被拆成 5 到 10 个分镜,每个分镜都明确标注景别、机位、人物动作、镜头运动。演员、摄影、灯光、武指都看着这些图来执行。
多宫格分镜本质上就是把这套电影工业的成熟方法搬到了 AI 视频里。你先用图像模型画出一张包含 N 个分镜的"宫格图",每一格都是一个明确的视觉锚点——告诉 AI"第一秒画面长这样,第二秒变这样,第五秒来到这样"。然后把整张宫格图丢给视频模型,它的工作就从"凭空发挥"变成了"在已知关键帧之间补全过渡",难度直接降一个量级。
这里有个反直觉的点值得说一下:一张静态的宫格图,实际上比一段长视频提示词承载的信息量大得多。一张 1024×1024 的图片,理论上包含的视觉信息相当于几万个文字 token,而且这些信息是 AI 最擅长处理的"图像语言"。这就是为什么同样描述一段 8 秒动作,你在提示词里写到喉咙冒烟,AI 可能还是听不太明白;但你给它看一张 9 宫格的分镜图,它扫一眼就懂了。
1.4 这套方法到底适合什么场景
并不是所有视频都需要用分镜法。我的经验是,画面变化越剧烈、动作越复杂、镜头切换越多的内容,越值得花心思做分镜。具体来说:
- 武侠、武打、动作戏:这种场景几乎离不开分镜,纯文生视频几乎做不出连贯打斗
- 追逐、赛车、运动:需要明确的镜头切换和速度感
- 短剧、剧情类:有起承转合,需要叙事节奏控制
- 产品展示、广告:需要多角度、多视角的精准呈现
- VLOG、生活记录:需要场景切换和情绪铺垫
反过来,如果只是想拍一段"风吹麦浪""猫咪打呵欠""人物站在窗边喝咖啡"这种情绪类、氛围类的短视频,直接文生视频或单图生视频就够了,搞分镜反而是杀鸡用牛刀。
二、多宫格分镜的底层逻辑:静态关键帧到动态序列
理解了为什么要做分镜,接下来聊聊技术原理。这部分有点干,但搞清楚了后面写提示词、选工具会顺很多。
2.1 视频在 AI 眼里到底是什么
很多人以为 AI 生成视频是"一帧一帧画出来",其实不是。当前主流的视频生成模型(包括 CogVideoX、Seedance、可灵)用的都是Diffusion Transformer(扩散 Transformer)架构,它把视频看作一个时空连续体:水平方向是宽度,垂直方向是高度,深度方向是时间。模型在这个三维"立方体"里同时建模空间和时间的关系。
这个机制有个很重要的特点——它特别擅长在已知锚点之间做插值。打个粗糙的比方,如果你只给它一个起点和一个终点,它会找出最"合理"(在它的训练数据分布里出现概率最高)的过渡路径。但如果你给它多个中间锚点,它就会乖乖按照你指定的路线走。
这就是分镜法的物理基础——每多一个明确的中间帧,AI 偏离你预期的可能性就少一分。9 宫格相当于给了 9 个锚点,16 宫格给了 16 个锚点。锚点越密,AI 越没有自由发挥的空间,成片越接近你的想法。
2.2 为什么"一整张图"比"多张图"更好用
有人会问:那我直接生成 9 张独立的分镜图,然后逐张做图生视频再剪辑不行吗?当然行,但这样做有三个明显劣势。
第一,一致性会崩。9 张图独立生成,即使你写得再细,人物的脸型、发色、衣服褶皱、武器细节都很难百分百一致。AI 每次生成都会有随机性,这种随机性在静态分镜里看可能不明显,但拼接成视频后就会出现"前一秒是这张脸,后一秒变了一张脸"。
第二,成本翻倍。9 张图独立生成等于 9 次调用,9 段视频独立生成又是 9 次调用,加起来 18 次。而一整张 9 宫格图只需要 1 次图像生成 + 1 次视频生成,共 2 次调用,成本能压到原来的 1/9 到 1/5。
第三,过渡会断。每段视频独立生成,首尾衔接处不可避免会有不连贯。即使用"上一段末帧作为下一段首帧"这种续写技巧,过渡还是会有"接头痕迹"。而一整张宫格图喂给视频模型时,模型把它当成一个连续的画面序列来理解,过渡是模型自己内部补全的,自然得多。
我在源码七号站做过一组对比测试,同样制作 8 秒的连续动作:
|
方法 |
总调用次数 |
平均耗时 |
一致性评分 |
流畅度评分 |
|
纯文生视频 |
3-5 次抽卡 |
15 分钟 |
5/10 |
6/10 |
|
9 张独立图+续写 |
18+ 次 |
60 分钟 |
6/10 |
7/10 |
|
整张 9 宫格图 |
5-7 次 |
25 分钟 |
8/10 |
8.5/10 |
数据是手头几个项目的平均值,可能会有偏差,但整张宫格图方案在三个维度上都明显占优这点是稳定的。
2.3 视频模型怎么"读懂"宫格图
可能你会好奇,视频模型看到一张被切成 9 格的图,它怎么知道要按"从左到右、从上到下"的顺序播放?这里其实有两层机制在起作用。
第一层是视觉语义。当前主流视频模型在训练阶段都看过大量的连环画、漫画、电影 storyboard、教学步骤图,它已经"内化"了"网格状画面 = 时序排列"这个先验知识。给它一张 9 宫格图,它会自然而然地把它理解成 9 个时间步。
第二层是文字辅助。如果你在每个分镜下方标注了"第 1 镜""第 2 镜"或者英文的"Shot 1""Shot 2",模型会进一步确认顺序。GPT-Image-2 在 2026 年的版本里中文字符渲染已经很稳了,这些数字标注基本能直接生成出来,不需要后期 PS。
第三层是提示词补充。你在视频生成阶段写提示词时,可以直接告诉模型"按图中分镜顺序生成连贯动作",模型会进一步确认你的意图。莫潇羽@源码七号站的项目实践表明,这三层信号叠加起来,模型对宫格图的"解读准确率"能达到 90% 以上。
2.4 几个常见误区
刚开始玩分镜法的朋友容易踩几个坑,提前打个预防针:
误区一:格子越多越好。理论上格子多锚点多,实际上格子超过 16 个之后,单格画面太小,AI 反而看不清细节,生成质量会下降。我的经验是 9 宫格适合简单叙事,16 宫格适合中等复杂度,25 宫格只在快速切换镜头(打架/追逐)时用,平时 9 或 16 就够了。
误区二:必须有文字标注。其实不一定。如果你的画面本身已经有明确的时序线索(比如人物从左走到右、动作从起势到收势),AI 也能正确理解顺序。文字标注是锦上添花,不是必需品。
误区三:宫格图越精美越好。其实是反直觉的——给视频模型用的宫格图,反而要画面"信息密度适中"。太精美、细节太多的宫格图,视频模型反而抓不住重点。每格有明确的主体、清晰的动作,比塞满细节更重要。
三、工具组合的搭配思路:图像端与视频端
工具选型这一块,2026 年的现状是百花齐放,光视频模型就有十来款主流的,图像模型也有四五款顶尖的。直接列一堆"哪个最好"没有意义,关键是理解每款工具的特长,组合起来用。
3.1 图像端的选型考量
生成宫格分镜图,核心要看四个能力:多主体一致性、中文文字渲染、长提示词理解、单次输出的可控性。下面是我手头常用的几款:
GPT-Image-2:OpenAI 在 2026 年 4 月正式推出的新一代图像模型,相比上一代 GPT-Image-1 在中文渲染、复杂指令理解上有明显提升。它最大的优势是对自然语言的理解能力——你可以像跟人说话一样描述你要的画面,它能精准抓取关键信息。生成 9 宫格、16 宫格分镜时,中文标注基本能正确生成,这点对国内用户友好。访问入口是 ChatGPT 网页版,免费用户每天有次数限制。
Nano Banana Pro:Google 出的图像模型,在 2025 年下半年到 2026 年初这段时间被很多 AI 创作者奉为"分镜神器"。它最强的一点是多模态理解——你可以输入"根据这个想法,生成 9 宫格连续分镜",它能自己规划每一格的内容并保证视觉连贯。我个人觉得它在做 VLOG 类、生活类分镜时比 GPT-Image-2 更顺手,因为它对"连续动作"的内部建模更好。
即梦 AI 生图 4.5:字节出品,主打中文场景。它有个杀手锏是系列组图功能,可以一次生成多张保持角色一致的图,虽然不是严格意义的"宫格图",但通过组图拼接也能实现类似效果。中文提示词理解非常到位,做剧本类、叙事类分镜很合适。
Midjourney V7:画质和审美依然是天花板,但中文支持一般,长提示词理解也不如 GPT-Image-2。适合做风格化、艺术化的分镜,不太适合做精准叙事。
Stable Diffusion + ComfyUI 工作流:开源方案,完全可控,可以用 LoRA 锁定角色风格,也可以用 ControlNet 精确控制每格的构图。学习成本最高,但天花板也最高,适合愿意折腾的技术型用户。
我自己的搭配习惯:做正经叙事内容用 GPT-Image-2 或 Nano Banana Pro,做艺术类作品用 Midjourney,做需要极致一致性的商业项目用 ComfyUI 工作流。
3.2 视频端的选型考量
视频模型这边,核心看五个能力:画质、镜头连贯性、动作合理性、音画同步、成本。
Seedance 2.0:字节在 2026 年初推出的视频模型,被业内称为"导演级"工具。最大特点是多镜头叙事能力——它能从一张分镜图里自动理解全景、中景、特写的切换关系,并保持角色一致性。还支持原生音画同步,生成的视频自带环境音和角色对白(口型对得上),后期工作量大幅减少。缺点是排队严重,Seedance 2.0 上线后高峰期排队人数曾突破 10 万,后来出了 Seedance 2.0 fast 版本缓解。
可灵 2.x:快手出品,长视频支持最强,可以生成最长 2 分钟的连贯视频。运镜控制是它的招牌——推拉摇移这些经典镜头运动都有预设,适合需要复杂运镜的场景。价格方面,黄金会员每月 66 元起,单条视频成本 1.25-1.5 元。最新的 Kling 2.6 还推出了 MotionControl 功能,可以用一段参考视频"驱动"静态图片做相同动作,适合做轻量级动作捕捉。
即梦 Seedance:字节自家平台,集成了 Seedance 2.0 和 Seedance 2.0 fast 两个模型。基础会员每月 69 元起,标准会员 199 元,高级会员 499 元。性价比在主流付费产品里属于中上。
CogVideoX(智谱清影):智谱 AI 开源的视频模型,最新版本 CogVideoX 1.5 支持任意尺寸比例的图生视频,5-10 秒,768P 分辨率。最大优势是完全开源、可商用(Apache 2.0 协议),适合开发者本地部署或二次开发。在线版叫"清影",标准价格每次 0.5 元起。技术细节上,它用的是 3D VAE + 3D RoPE 架构,在内容连贯性和训练效率方面做了大量优化。
Vidu:生数科技和清华联合开发,Vidu 2.0 把单秒视频成本压到了 4 美分(约 0.3 元人民币),性价比拉满。支持多主体一致性和风格一致性,适合做漫画风、动漫风的分镜动画。Vidu Q2 月度会员 59 元 800 积分,8 秒视频 20 积分,算下来每条约 1.5 元。
海螺 AI(MiniMax):综合表现均衡,中文提示词理解到位,适合预算有限但又想要稳定质量的用户。
下面这张表是我手头几款常用工具的对比,数据基于 2026 年 4 月的实测:
|
模型 |
画质 |
镜头连贯 |
运镜灵活 |
音画同步 |
起步价格 |
推荐场景 |
|
Seedance 2.0 |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
较高 |
短剧、广告、叙事类 |
|
可灵 2.x |
⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐ |
中等 |
长视频、复杂运镜 |
|
CogVideoX 1.5 |
⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐ |
⭐⭐⭐ |
低(0.5 元起) |
开源开发、性价比 |
|
Vidu 2.0 |
⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐ |
⭐⭐⭐ |
极低(0.3 元/秒) |
漫画风、动漫风 |
|
海螺 AI |
⭐⭐⭐⭐ |
⭐⭐⭐ |
⭐⭐⭐ |
⭐⭐⭐ |
中等 |
综合性能均衡 |
|
即梦 Seedance |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
中等 |
字节生态、国内直连 |
3.3 几套常用的组合方案
把图像端和视频端的工具搭配起来,有几套常见组合:
入门组合:GPT-Image-2(免费版) + 智谱清影(0.5 元/次)
- 总成本极低,适合刚入门尝鲜
- 画质和连贯性都过得去,出片速度尚可
- 适合个人创作者、自媒体新手
性价比组合:Nano Banana Pro + Vidu 2.0
- 单秒成本控制在 0.3 元左右
- 适合需要批量产出短视频的场景
- 风格偏二次元、动漫的项目尤其合适
高质量组合:GPT-Image-2 + Seedance 2.0(即梦)
- 当前可拿到的天花板级效果
- 适合商业项目、对外发布
- 缺点是要做好排队和高成本的心理准备
专业组合:ComfyUI + 可灵 2.6 MotionControl
- 完全可控的工作流,角色一致性可以锁死
- 学习曲线陡,但上手后效率极高
- 适合工作室、专业团队
国内合规组合:即梦生图 4.5 + 即梦 Seedance
- 全程国内直连,体验流畅
- 中文支持最好
- 适合制作中文内容、面向国内平台
莫潇羽在源码七号站做项目时通常会同时跑两套组合做对比,然后选效果好的那个,因为不同模型对不同题材的"理解偏好"是有差异的——同一段提示词,在 Seedance 上拍出来是写实风,在可灵上可能就偏戏剧风。
3.4 怎么选最适合自己的组合
如果你是新手,我的建议是先从最低成本的组合开始:GPT-Image-2 + 智谱清影。把整套流程跑通了,理解每个环节的逻辑,再根据项目需要往上升级。一上来就用最贵的工具,反而容易因为"舍不得抽卡"而放弃尝试。
如果你已经入门,建议根据项目类型固定 2-3 套组合。比如做短剧用一套、做产品广告用一套、做艺术风短片用一套。固定下来之后建立自己的提示词模板库,出片速度会快很多。
四、从 0 开始做一张 16 宫格分镜图的完整步骤
理论说了不少,接下来直接上实操。我用一个具体场景——"古风刺客夜袭"——演示一遍完整流程,从画面规划到最终成图。
4.1 第一步:画面规划(纸笔阶段)
不要急着打开 AI 工具,先用纸笔(或者备忘录)把整段视频的骨架想清楚。规划阶段考虑的核心问题:
总时长:这段视频准备做几秒?这决定了你需要多少格。一般来说,5-6 秒视频对应 9 宫格,8-10 秒对应 16 宫格,12-15 秒对应 25 宫格(但 25 宫格难度较高)。
叙事弧线:开场怎么交代背景?中段冲突如何展开?结尾如何收束?即使只有 10 秒,也要有"起承转合"的节奏,否则就是一段平铺直叙的流水账。
镜头节奏:开场放慢、中段紧凑、结尾留韵。这是经典的"慢-快-慢"三段式,适用于绝大多数动作类、叙事类视频。
视觉风格:写实还是动画?暖色调还是冷色调?日景还是夜景?这些要素决定了后面所有提示词的基调。
以"古风刺客夜袭"为例,我的规划如下:
- 总时长:8 秒,对应 16 宫格(4×4)
- 叙事弧:刺客潜入(镜 1-4)→ 接近目标(镜 5-8)→ 出手交锋(镜 9-12)→ 全身而退(镜 13-16)
- 节奏:1-4 慢、5-8 中、9-12 快、13-16 中慢
- 风格:写实电影感,夜景为主,冷色调+暖色光源对比
4.2 第二步:逐格设计
接下来把每一格的具体内容写出来。每格只需要简短描述,但要包含三个核心要素:景别 + 运镜 + 主要动作。
镜1:全景-空镜推进-月夜下的高墙大院,屋脊飞檐
镜2:中景-跟拍-黑衣刺客飞身上墙,身形如猫
镜3:近景-侧拍-刺客蹲在屋脊上观察院内
镜4:特写-面部-刺客眼神锐利,夜风吹动头巾
镜5:中景-跟拍-刺客无声跃下,落地无声
镜6:近景-低角度-脚步穿过院中石板路
镜7:中景-侧拍-刺客闪到柱后,身形隐入阴影
镜8:特写-手部-腰间短刀微微出鞘
镜9:中景-推镜-室内灯光透出,目标人物背影
镜10:近景-快切-刺客破窗而入,短刀前刺
镜11:特写-高速-刀光与桌面油灯交错
镜12:全景-环绕-目标人物倒地,刺客已转身
镜13:中景-跟拍-刺客飞身退向窗外
镜14:全景-拉镜-院中惊起鸡鸣狗叫
镜15:中景-仰拍-黑影掠过屋脊
镜16:远景-定镜-月夜恢复宁静,只余风声
这个阶段就是"导演工作"。写得越细,后面 AI 越听话。我的经验是,每格不要超过 20 个字,但每个字都要"有用"——景别、运镜、主体、动作四要素齐全。
4.3 第三步:撰写完整提示词
把上面的分镜规划组装成 AI 可以理解的完整提示词。结构上分五层(我管这套结构叫"分层描述法"):
【整体定位】
生成一张 4×4 共 16 宫格的电影分镜图,展示古风刺客夜袭的连续动作。
【画面规格】
整体比例 16:9 横版宽银幕。每个小格内画面完整、构图清晰,
格子下方用中文标注【镜 X】+ 景别 + 运镜方式 + 动作描述。
【角色设定】
主角:黑衣夜行刺客,蒙面只露双眼,腰间短刀,身形矫健灵活。
身高约 175cm,身形修长但有力量感。
在 16 个镜头中保持外观、服饰完全一致。
【场景设定】
古代深宅大院,青砖灰瓦,飞檐斗拱。
时间:深夜,月光皎洁。
环境:院内有石灯笼、回廊、几丛竹影。
室内场景有油灯、八仙桌、屏风。
【16 个分镜具体内容】
(这里把 4.2 节的分镜内容贴进来)
【视觉风格】
写实主义电影感,色调冷蓝为主,光源用暖黄(月光+灯光)做对比。
画面有适度的动态模糊以表现动作,光影对比强烈,
营造紧张悬疑的氛围。借鉴东方武侠片的视觉语言。
【技术要求】
- 人物面部、服饰在 16 个镜头中保持一致
- 中文标注字体清晰工整
- 每格画面构图独立完整,不互相串色
- 整体画面锐利、纹理细腻
4.4 第四步:实际生成与微调
把上面的完整提示词复制进 GPT-Image-2(或者 Nano Ban