本文由 莫潇羽@源码七号站(www.fuyuan7.com) 撰写,转载请注明出处。
快速摘要
做 AI 视频创作,真正决定一条片子能不能用、能不能交付的,从来不是大模型多酷炫,而是"主体一致性"——产品瓶身、动画角色、真人演员,在跨镜头、跨景别、跨运镜的所有画面里,必须像同一个东西。这一条吃透了,AI 视频流水线才算真正搭起来。
这篇长文把我自己折腾下来的三条典型产线一次性讲清楚:商业广告短片用即梦 + 星流锁住产品造型/材质/颜色/Logo;动画短片用 Vidu 主体库锁住角色和车辆的双主体;真人短剧用即梦 3.0 + 可灵对口型搞定角色 + 场景双重一致性。我把每条产线的工具组合、提示词模板、参考图玩法、运镜思路、后期合成的细节,全部按"原理 → 操作 → 避坑"三段式重写过一遍。新手照着抄就能跑通整套流程,老玩家也能拿到几个不太常见的小技巧(比如尾帧当首帧的衔接法、双人对口型的蒙版拼接法、Vidu 主体库的裁剪逻辑)。
想看完整拆解,往下翻。
一、为什么"主体一致性"是 AI 视频创作的核心命门
AI 视频这两年从"看个乐子"变成"能交付活儿",分水岭其实就一条:能不能让画面里的主体,在镜头切换之间稳住不变形。
1.1 一致性不达标的代价
我自己折腾下来的体感是,AI 视频出片的失败率,至少 70% 都卡在一致性上。具体表现有四种:
- 产品瓶身的字体崩了。 第一个镜头瓶子上写的是"YourBrand",第二个镜头变成了一串糊掉的乱码,第三个镜头又冒出几行小字。
- 角色的脸漂了。 闪回画面里的女主和现实画面里的女主,乍一看像同一个人,仔细看眉眼根本对不上,发饰也悄悄换了。
- 场景的色调跳了。 同一个院落,前一帧灰蓝色调下着雪,后一帧突然变得偏暖,雪没了。
- 服饰的细节飘了。 这一帧腰带是红色的,下一帧变成蓝色;这一帧穿着肩甲,下一帧肩甲突然消失。
只要这四种里出现任何一种,整支片子就立刻失去"专业感",观众看一眼就出戏。
1.2 三种典型场景的一致性需求各不相同
商业广告、动画短片、真人短剧虽然都叫 AI 视频,但它们对一致性的需求侧重并不一样。我把核心差异列在下面这张表里:
|
场景 |
一致性最难的点 |
容错率 |
主控手段 |
|
商业广告短片 |
产品造型/材质/Logo 字体 |
极低(字体崩了就废) |
主体参考 + 线稿参考 + 智能参考 |
|
动画短片 |
角色形象 + 道具(如车辆)双主体 |
中等(拟人化风格本就有发挥空间) |
主体库 + 三视图 + 描述词锁定 |
|
真人短剧 |
角色脸 + 服饰 + 场景色调 |
中等偏低(电影感要求高) |
形象参考 + 场景四要素 + 后期调色 |
广告片对产品造型的还原度要求最苛刻,连 Logo 的字体不一样都得重抽;动画片对角色与车辆同框时的双主体控制要求高;真人短剧则得同时锁住角色和场景两条线,加上服饰、化妆、道具一堆细节。
1.3 一致性控制的通用框架
虽然侧重点不同,但解决一致性问题的底层框架其实是相通的,可以用一张流程图概括:
graph LR
A[文字脚本] --> B[主体形象生成]
B --> C[主体库/参考图]
C --> D[多镜头运镜生成]
D --> E[剪辑合成]
B --> F[场景描述模板]
F --> D
E --> G[最终成片]
整个链路里,主体形象生成是地基,主体库/参考图是钢筋,场景描述模板是水泥。地基没打好,后面所有运镜都是在沙堆上盖楼。
后面三章我会按"广告 → 动画 → 短剧"由浅入深地讲,每一章都按这个框架展开。先看工具组合。
二、工具栈拆解:六款工具搭出一条完整流水线
不夸张地说,AI 视频创作就是工具搭积木的过程。我自己常用的组合是六款,分工很清晰:
文字脚本 → 主体生成 → 视频运镜 → 后期合成
DeepSeek/ 即梦AI 即梦视频3.0 剪映
豆包/Kimi 星流AI Vidu/可灵
2.1 文字脚本层:大语言模型梯队
写分镜脚本、想品牌名、生成提示词,这一层我常用三款大语言模型:
- DeepSeek:擅长深度思考,写出来的分镜脚本逻辑严密,描述细致,适合需要"导演式"思考的复杂创意。
- 豆包:字节家的,调性偏简洁明快,分镜脚本写得清爽,跟即梦的衔接最顺。
- Kimi:长文本理解强,适合你把一大段需求扔进去让它一次性输出完整脚本。
我的习惯是三个软件并行投喂同一段提示词,分别让它们出脚本,然后取长补短。比如 DeepSeek 的镜头逻辑 + 豆包的画面描述词 + Kimi 的旁白,拼出一版自己满意的脚本。
2.2 主体生成层:即梦 vs 星流的差异
主体形象的图片生成,主力是这两款:
|
维度 |
即梦 AI |
星流 AI |
|
出品方 |
字节跳动旗下 |
LiblibAI 旗下 |
|
核心模型 |
Seedream 3.0 |
Star-3 Alpha |
|
文字渲染 |
中文字体支持极好 |
中文字体一般 |
|
主体一致 |
"智能参考"功能强,1.0 直接锁主体 |
"主体参考 + 线稿参考"双控更精准 |
|
风格增强模型 |
主模型为主,外挂少 |
内置十万级 LoRA 模型库,可叠加 |
|
价格 |
出图便宜,抽卡成本低 |
同样平价 |
|
适合做什么 |
角色 + 文字密集的画面 |
产品 + 风格化 + 字体高保真 |
简单一句话总结:做品牌字体保真度要求高的产品图,星流 AI 的"主体参考 + 线稿参考"组合最稳;做角色形象、做镜头叙事,即梦 3.0 更省心。
2.3 视频运镜层:即梦视频 3.0、Vidu、可灵
视频生成这一层有点百花齐放,我把三款主力工具的差异说清楚:
即梦视频3.0 → 性价比高,多镜头叙事能力强,单视频内支持多次镜头切换
Vidu 2.0 → 主体库功能成熟,多图参考稳定,最多支持7张主体图
可灵 2.0 → 画面美学好,动态质量高,多模态(文字+图+视频)输入
具体到三条产线的搭配,我自己的选择是:
- 广告短片:Vidu 为主(产品转动的精细控制好),即梦视频做辅助。
- 动画短片:Vidu 的主体库是杀手锏,角色 + 车辆双主体直接拖进去就行。
- 真人短剧:即梦视频 3.0 做镜头,可灵做对口型——这一组合是目前我试下来最稳的。
2.4 剪辑合成层:剪映就够
后期剪辑全程剪映搞定。剪映看着是个 C 端剪辑工具,其实把转场、蒙版、变速、调色、音效、画面特效、对口型辅助全都整合好了,AI 视频后期需要的功能基本都在里面。后面三章会反复用到剪映的同一组功能,把它的"工业感"挖出来。
2.5 一张图看清完整流水线
把六款工具的协作流程画成一张图,整个 AI 视频创作链路就一清二楚了:
flowchart TD
A[需求/创意] --> B[DeepSeek/豆包/Kimi 写脚本]
B --> C{是哪种产线?}
C -->|广告| D1[即梦/星流出产品主形象]
C -->|动画| D2[即梦出角色+车辆形象]
C -->|短剧| D3[即梦出角色+服化道]
D1 --> E1[星流氛围图 + Vidu 运镜]
D2 --> E2[Vidu 主体库 + 运镜]
D3 --> E3[即梦视频3.0 + 可灵对口型]
E1 --> F[剪映合成]
E2 --> F
E3 --> F
F --> G[成片导出]
工具讲完了,下面进入正题——三条产线的具体打法。
三、商业广告短片:产品主体一致性的极致打磨
商业广告对"产品看起来必须是同一个产品"这件事的要求非常苛刻。莫潇羽@源码七号站的实战体感是:只要瓶身字体一花,整支广告等于报废。所以这一章我把"四要素法 + 参考图组合 + 抽卡心法"全部串起来。
3.1 广告短片的基本结构
先理清思路。广告片本质上是用最短的时长把"产品 + 品牌"塞进观众脑子里,所以结构其实非常程式化:
场景空间 → 氛围营造 → 产品展示 → 特征展示 → Logo 展示
(铺垫) (情绪) (主体) (局部) (品牌沉淀)
我自己做广告片喜欢遵循一个比例:产品展示的画面要占整片的 50% 以上。普通短片每 1~2 个镜头就要切回产品的主体或局部展示,让观众的视觉中心始终落在产品上。
如果硬要套传统广告的叙事模板(故事型、三幕式、视觉冲击型、生活共鸣型……),新手反而容易把产品淡化掉。记住一句话:广告短片是产品的舞台,不是故事的舞台。
3.2 用大语言模型搭分镜脚本
分镜脚本怎么写?我用的提示词模板是这样的:
你是一位导演,需要拍摄一支 [产品类型] 的商业广告短片。
- 时长:45 秒
- 品牌名称:[XXX]
- 产品受众:[年轻女性 / 都市白领 / ...]
- 产品风格:[极简轻奢 / 自然清新 / 科技未来 / ...]
要求生成:
1. 场景空间描述
2. 氛围与情绪基调
3. 产品展示镜头(重点,占比 50% 以上)
4. 品牌 Logo 沉淀镜头
5. 每个镜头的提示词 + 旁白(旁白可选)
输出格式:分镜头脚本表格,包含 [镜号 / 时长 / 景别 / 画面内容 / 镜头提示词]
把这段话喂给 DeepSeek、豆包、Kimi 三个工具分别跑一遍,挑出来逻辑最顺、画面感最强、最贴合自己想法的一版。注意控制时长,做太长难度指数级上升。45 秒是新手最舒适的区间。
3.3 产品主形象生成:四要素法
产品主形