本文由 莫潇羽@源码七号站(www.fuyuan7.com) 撰写,转载请注明出处。
快速摘要
这篇文章把我自己折腾 AI 动画短视频这段时间趟过的坑,整理成了一套可直接照着干的工作流。核心结论先放在最前面:
- 三大工具固定搭配:即梦做图像和说话类视频,可灵补充非对话动作镜头,剪映完成串联、字幕和成片导出,豆包用来薅免费图像生成额度。
- 模型按"任务难度"分级使用:动作类用便宜模型(即梦 1.0 Fast、可灵 2.1);对话类强制用即梦 Seedance 2.0 或可灵 3.0;高一致性长片段才考虑全能参考建模,新手不建议一上来就碰。
- 提示词遵循"场景→主体→动作→镜头→台词"的五段式,对话一律用中文双引号包裹,并在角色前标注性别、年龄、声线,能显著降低声音错乱概率。
- 多镜头串联靠"导出尾帧":上一段视频的最后一帧导出成图,作为下一段的首帧图,故事线立刻就接上了。
- 合规这一关比技术更重要:人物服装、场景、对话只要稍作改写,就能避开同质化;同时坚守不夸大、不引导承诺、不出现敏感行业关键词的底线。
想看完整拆解、提示词模板、踩坑清单和剪辑节奏的全套打法,往下翻。
一、为什么动画短视频是 AI 视频里最容易出片的赛道
我自己在莫潇羽@源码七号站折腾 AI 视频的过程中,发现了一个挺反常识的事:真人风格的 AI 视频对模型要求极高,反倒是动画风格、卡通角色的短剧,是当前 AI 视频里最容易出片、也最容易跑出流量的方向。
原因不复杂。AI 视频模型在生成"真人"的时候,观众的容忍度极低——脸型变化、手指畸形、眼神不连贯,任何一个穿帮都会立刻被注意到。但换成 3D 渲染的卡通熊猫、橘猫、老虎,观众对"细节真实"的预期天然就低,AI 偶尔抖一下脸、嘴型偏一帧,根本不影响观感。
所以你刷短视频平台时会发现一个规律:橘猫开车、熊猫摆摊、动物角色围坐烧烤摊唠嗑这一类的小短剧,剧情很简单,但播放量普遍都不差。原因就是——门槛低、容错高、共情强。
也正因如此,这个赛道适合新手第一站练手。把工作流跑顺,后面再升级到更复杂的真人风格或写实短剧,会自然很多。
1.1 这条工作流要解决的核心问题
整条工作流要做的事,说穿了就三件:
- 稳定地生成"我想要的画面"——图像生成。
- 让画面里的角色按我设计的剧本动起来、说出对应的台词——视频生成。
- 把多段视频无缝拼成一个能完整讲故事的成片——剪辑串联。
每一步都有自己的坑。下面一步一步拆。
二、工具栈:三大核心平台的定位差异
写在前面:工具不是越多越好,固定就用三个,工作流才稳定。
我自己常驻用的就是即梦、可灵、剪映三个,外加豆包当免费薅图额度的备用方案。手机端和电脑端的能力略有差异,但整体逻辑完全一致。
2.1 即梦:图像生成 + 说话类视频的主力
即梦(Dreamina)是字节系的 AI 创作平台,剪映团队和醒图团队合作出的产品。它在我的工作流里承担两个角色:
- 图像生成的首选。即梦的图像生成对中文提示词理解明显更友好,3D 渲染、卡通风格、动物拟人这一类的风格几乎是"开箱即用"。
- 说话类视频的首选。对话场景对模型理解力要求非常高,需要模型既能听懂提示词里的台词,又能控制嘴型和声线。即梦的 Seedance 2.0 系列在中文对话视频上目前确实是国内第一梯队。
电脑端走网页版(dreamina.capcut.com / jimeng.jianying.com),手机端要在应用市场下载即梦 App。两端登录态保持一致,账号互通。
2.2 可灵:动作类视频的性价比补充
可灵(Kling)是快手系的视频生成模型。它的强项在于:
- 动作类、运镜类视频的画面质感非常稳,物理引擎对手部、转头、走动等动作的还原度高。
- 2.1 版本的性价比比较合适,相比早期 2.0 价格下降明显,适合做大量动作类小镜头。
- 3.0 模型可以生成对话视频,但目前我的体感是,对话场景下即梦 Seedance 2.0 仍然更稳,所以可灵主要用来做不说话、纯动作的镜头补片。
2.3 剪映:所有素材的最终归宿
剪映(CapCut 国内版)承担"把所有素材拼成一条完整视频"的工作。我用它做四件事:
- 串联多段 AI 视频片段,做删减、调速、转场。
- 用智能字幕给整段对话自动打字幕,再统一调字体、字号、位置。
- 添加音效库的开门、关门、敲门、哭声等环境音,让画面更有真实感。
- 通过"导出当前画面"抽尾帧,作为下一段视频的首帧图。
2.4 豆包:薅免费额度的备用方案
豆包是字节系的另一款产品,自带 AI 图像生成功能,新用户每天有免费额度。我把它当成"图像生成的备用渠道"——主图用即梦生成,但有时候即梦风格不太对,会丢到豆包再试一次找灵感。
豆包的视频生成功能也开放了一部分免费额度,但我个人不太用,因为风格控制不如即梦稳。
2.5 工具搭配总结
flowchart LR
A[剧本/分镜] --> B[即梦/豆包<br/>图像生成]
B --> C{是否需要对话?}
C -->|需要对话| D[即梦 Seedance 2.0<br/>说话视频]
C -->|纯动作| E[可灵 2.1<br/>或即梦 1.0 Fast]
D --> F[剪映<br/>串联/字幕/音效]
E --> F
F --> G[导出尾帧]
G --> B
F --> H[成片]
整条流是个闭环:剧本拆分镜,分镜出图,出图变视频,视频在剪映里拼,需要新镜头时通过"导出尾帧"反哺到图像生成那一步,循环往复直到成片。
三、模型选型:在不同任务里挑对模型
工具选完,下一个关键决策是——任务进来,到底用哪个模型?
模型选错的代价是直接花钱,而且越贵的模型生成时间反而越长(因为算力排队)。下面是我整理的一张选型对照表,照着挑就行。
3.1 即梦视频模型对照表
|
模型代号 |
主要用途 |
是否支持对话 |
相对成本 |
适用场景 |
|
1.0 / 1.0 Fast |
简单动作 |
否 |
最低 |
角色走动、转头、拿放物品 |
|
2.0 Fast |
中等复杂动作 |
部分支持 |
中 |
多人物互动、镜头小幅度运动 |
|
1.5 Pro 首尾帧 |
镜头衔接 |
否 |
中 |
用两张图生成过渡 |
|
Seedance 2.0 (画质) |
高质量出片 |
是 |
高 |
关键对话、关键转场 |
|
Seedance 2.0 (VIP) |
顶配模式 |
是 |
最高 |
重点镜头、必须一遍过的场景 |
注:模型代号和定价会随平台版本更新而变化,以官方实时显示为准。莫潇羽这里只总结相对档位,不写死价格。
3.2 可灵视频模型对照表
|
模型代号 |
主要用途 |
是否支持对话 |
相对成本 |
适用场景 |
|
1.6 |
老模型,便宜 |
否 |
低 |
测试性出片 |
|
2.1 标准 |
主力动作模型 |
否 |
中 |
走动、互动、运镜镜头 |
|
2.1 高品质 |
1080P 出片 |
否 |
中高 |
准备发布的成片镜头 |
|
3.0 |
最新模型 |
是 |
高 |
对话备份方案 |
3.3 模型选型的三条原则
第一条:说话用顶配,动作用平价。对话类强制走即梦 Seedance 2.0 或可灵 3.0,因为对话错一个字、声音变性别就是废片,省那点钱不划算。动作类用 1.0 Fast 或 2.1 标准就行。
第二条:重要镜头用 VIP/画质,过渡镜头用 Fast。比如剧情高潮的一个特写镜头,宁可贵一些也要用顶配;中间走路、转身、看手机这种过场镜头,用便宜版本就够了。
第三条:4 秒能搞定的别用 6 秒,6 秒能搞定的别用 8 秒。生成时长直接乘进总成本里,多一秒就是多一份费用。每次发起生成前,认真估算一下这段台词加动作到底需要几秒,预留 1 秒缓冲就好,不要无脑选最大值。
3.4 一个真实的成本对比
举个我自己跑过的对比账:同一段 7 秒的对话镜头,分别用即梦 1.5 Pro、2.0 Fast、Seedance 2.0 跑一遍。
- 1.5 Pro:嘴型基本不动,声音偏机械,对话识别度大概 60%。
- 2.0 Fast:嘴型有动,但偶尔会冒出来奇怪的声线,需要重抽几次。
- Seedance 2.0:一遍过的概率显著高,嘴型、语速、断句都比较自然。
结论很简单:关键对话直接用顶配,比抽卡省钱。
四、图像提示词:一套可复用的写作公式
图像是所有视频镜头的起点,图错了,后面所有镜头都白做。所以图像提示词是整条工作流里最值得花时间打磨的部分。
4.1 公式:场景 → 主体 → 服装 → 动作 → 道具 → 镜头
我自己用得最熟的公式是这五段式,按顺序往下写,基本不会出错:
3D 渲染,[时间/天气/地点的场景],
[主体 1:物种 + 性别 + 体型 + 服装 + 姿态],
[主体 2:物种 + 性别 + 体型 + 服装 + 姿态],
[道具 + 摆放位置],
[镜头景别 + 视角]
第一行的"3D 渲染"几乎是必加项,相当于给整张图定一个动画风格的基调。没有这一句,模型