本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
一句话先说结论:做一条 AI 漫剧,本质上就是把"导演的活儿"拆成八个标准动作——写剧本、拆分镜、定角色、固定风格、出关键帧、图生视频、配音、剪辑成片,每一步都用对工具、写对提示词,普通人不会画画、不懂分镜,也能在一两天内独立出一条完整的小动画。 我自己把这套流程从头到尾跑了好几遍,踩过的坑基本都集中在三个地方:提示词没给到位、角色跨镜头"精分"、分镜之间硬切不自然。这篇文章我会用一个《小红帽》的完整案例,把每一步的工具选择、提示词模板、参数设置、翻车补救全部讲透,连最后封面字体怎么让 AI 帮你设计都写进去了。
读这篇你能拿到的东西:一套可以直接抄的文生图/图生视频六要素提示词公式、一份分镜拆解的判断标准、三种镜头衔接手法(三镜头法、首尾帧法、两极镜头),以及一套剪辑补救的实战技巧。
想看完整拆解,往下翻。
一、先把"AI 漫剧"这件事讲清楚
很多人一听"做动画"就头大,脑子里浮现的是建模、绑骨骼、一帧一帧画原画,那是工业流水线干的事。AI 漫剧不一样,它走的是另一条路:不画动画,而是"生成画面 + 让画面动起来 + 拼接成片"。
我自己理解下来,AI 漫剧的底层逻辑可以用一句话概括:先用文字描述出每一个画面(关键帧),再让模型把静态画面补成一段几秒钟的运动,最后像剪普通视频一样把这些片段接起来,配上声音。整个过程里,你扮演的角色不是画师,而是导演 + 编剧 + 剪辑——你负责想清楚"我要什么画面、镜头怎么动、情绪怎么走",具体的"画"和"动"交给模型。
为什么是现在这个时间点普通人能上手?这两年国内的生成式工具更新得特别快。以字节这条线为例,写文案有豆包,出图和生视频有即梦(早年叫"剪映 Dreamina",后来独立成"即梦 AI"),剪辑还有大家最熟的剪映,三个工具基本能闭环。即梦背后用的是 Seedream(出图)、Seedance(生视频)这套自研模型,2025 年下半年还把网页端整体升级成了"AI 片场"的工作流形态,出图能上 4K,生视频甚至能做到音画同步。换句话说,以前需要一个小团队分工的活儿,现在一个人坐在电脑前就能跑完。
但我要先泼一盆冷水:工具好用不等于随便点点就能出片。AI 的随机性很强,你给的指令越模糊,它发挥得越离谱。整条流程里真正决定成片质量的,不是你会不会用某个按钮,而是你会不会"说人话"地把需求讲清楚——也就是提示词。这篇后面所有的实操,核心都在围绕"怎么把话说对"。
那这套东西到底适合谁来做?我观察下来,最容易上手、也最容易出成果的,往往是这么几类人:手里有故事但不会画画的写作者、想给自己内容加视觉表达的知识分享者、需要快速出demo做创意验证的设计者,还有就是纯粹觉得好玩、想把脑子里的画面变出来的爱好者。共同点是——有想法,缺的是把想法落地成画面的那双手,而这双手恰好是 AI 现在最能补上的。
再说几个我自己一开始也犯过、后来发现身边新手几乎都会犯的误区,提前点破能少走不少弯路:
第一个误区是以为出图越多越好。很多人一个镜头反复抽几十张,挑得眼花。其实质量上不去往往不是抽得不够,而是提示词、参考图、风格没固定好,方向错了抽再多也是错的。
第二个误区是把工具当成魔法。觉得点一下就能出大片,结果出来一堆四不像就开始骂工具差。AI 是个执行力极强但理解力有限的助手,你说得含糊,它就发挥得离谱,问题九成在指令而不在工具。
第三个误区是忽略"一致性"这件事。新手前期只顾着把单张图出好看,等到几十个镜头拼一起才发现主角每个镜头都换了张脸,返工成本极高。一致性必须在最开始就用方法锁死,这也是后面我花大篇幅讲角色设计和固定提示词的原因。
把这几个坑记在心里,再往下看每一步,你就知道每个动作到底在为什么服务了。
下面我用一张图把整条流程先摆出来,心里有个全局,后面每一步就不会迷路:
flowchart LR
A[剧本 / 故事] --> B[拆分镜]
B --> C[角色设计<br/>白底图+三视图]
C --> D[固定风格<br/>风格/光影/质量]
D --> E[关键帧出图<br/>六要素公式]
E --> F[图生视频<br/>运镜+动作+情绪]
F --> G[分镜衔接<br/>三镜头/首尾帧]
G --> H[配音 / 数字人]
H --> I[剪映成片<br/>转场+音效+封面]
整条链路就八个动作,看着多,其实每一步都有固定套路。接下来我一个一个拆。
二、第一步:让 AI 先把"剧本 + 脚本"一次写到位
无论你想做 AI 电影、AI 广告,还是一条几分钟的 AI 漫剧,第一步永远绕不开两样东西:一个好剧本,一个好脚本。
这里先把两个词分清楚,很多新手一上来就把它们当一回事。剧本讲的是故事——谁、在哪、发生了什么、说了什么台词;脚本讲的是怎么拍——这个画面用什么景别、什么构图、镜头从哪个角度看过去、光影什么调子、配什么音效。剧本是"内容",脚本是"拍法"。做漫剧两样都要,而且脚本往往比剧本更关键,因为它直接决定了你后面每一张图怎么出。
问题来了:我们大多数人不是科班出身,没当过编剧也没干过导演,让自己从零写剧本、再一帧一帧拆画面,难度大、还特别费时间。好在 AI 既然能写文章写小说,让它来帮我们写剧本、顺便把脚本也搭出来,完全没问题。能写脚本的工具市面上一大把,我个人用得最顺手的是豆包,界面干净,提示词也不挑,用自然语言跟它聊就行。
2.1 新手最容易踩的坑:直接让 AI"写个剧本"
我见过太多人第一次用 AI 写剧本,张口就是一句:
帮我生成一个关于小红帽的剧本。
发过去,AI 确实会给你一份东西回来,结构通常是"人物设定 + 场景设定 + 剧本正文"三块。前两块一般没毛病,人物列得清清楚楚,场景也交代了。但你翻到"剧本正文"会发现不对劲——它写的全是画面和台词,比如"小红帽望着背影,大声喊道……",本质上就是一篇有对话的小说。
这玩意儿离"能拍"差得远。作为导演,我们要的是分镜信息:这个画面是远景还是特写?镜头怎么摆?人物在画面里站哪?光从哪打?这些它一个字都没提。所以问题不在 AI 不行,而在你问的方式不对。
2.2 给 AI 戴上"导演"的身份
我自己折腾下来,让 AI 输出专业脚本的第一个开关,是先给它一个角色设定。你不指定身份,它默认就用"会写字的助手"那套来回应你;你把它设定成专业的 AI 动画导演,它的输出立刻就往专业方向靠。
提示词第一句先下身份指令,再说清楚你要什么、要它包含哪些脚本要素。完整写法长这样:
假设你现在是一位专业的 AI 动画导演。
我想用 AI 做一个关于《小红帽》的故事,请帮我写出完整的剧本和脚本。
脚本部分请包含以下要素:
- 景别(远景/全景/中景/近景/特写)
- 运镜(镜头怎么动)
- 构图(人物在画面里的位置关系)
- 视角(从哪个角度看)
- 光影(光线方向、明暗调子)
- 画面音效(环境音、动作音)
发出去之后,豆包就会按你列的要素一条条填。这次它给的"动画脚本"部分跟上一种问法就完全不是一个东西了——景别、构图、视角这些硬性信息全都带上了。
这里我想强调一个观念:向 AI 提问,问法本身就是一门手艺。同样一个《小红帽》,换个问法,产出质量差出十条街。后面所有环节你都会反复体会到这一点。
2.3 脚本要素到底该写哪些
为了让你照着抄,我把一份"能直接拿去拆分镜"的脚本,应该覆盖的要素整理成一张表:
|
要素 |
作用 |
举例 |
|
景别 |
决定画面里主体占多大 |
远景交代环境、特写强调情绪 |
|
构图 |
主体在画面里的位置与关系 |
两人面对面、过肩、居中 |
|
视角 |
镜头从哪个方向看 |
平视、俯视、仰视、第一人称 |
|
运镜 |
镜头如何运动 |
推、拉、摇、移、跟随、环绕 |
|
光影 |
光线方向与明暗 |
暖光顺光、逆光剪影 |
|
画面音效 |
声音氛围 |
鸟鸣、脚步声、关门声 |
|
台词/旁白 |
推动剧情 |
角色对白或解说 |
写脚本的时候不用每一项都死磕,但景别、构图、视角这三样几乎