本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
漫剧不是真人短剧的简化版,而是 AI 视频生成时代催生出的一种新形态:一个人就能从写故事、画人物、拆分镜到出成片全程走完。 这一篇是我把整套工作流从头到尾拆解一遍的实操记录,所有步骤都围绕 2026 年 2 月正式发布的字节系新一代视频模型 即梦 Seedance 2.0 展开,配合通用的剧本拆解工具与剪映,把"小说原文 → 剧本 → 人物三视图 → 场景图 → 分镜提示词 → 视频片段 → 成片"这一整条链路串起来。核心结论是三件事:第一,角色一致性靠"三视图 + @ 引用"锁死,不要寄希望于碰运气;第二,分镜提示词要少而精,一次最多塞两到三个画面进去,塞多了模型会替你压缩;第三,剪映里真正花时间的不是切镜头,而是处理音画错位、补音效、做转场和氛围。 想看完整拆解,往下翻。
一、漫剧到底是个什么东西,值不值得花精力做
很多人对"漫剧"这个词的理解其实是模糊的。它既不是传统意义上的动画番剧,也不是真人拍摄的竖屏短剧,而是借助 AI 视频生成模型,用一帧帧拼起来的、带配音和口型的动态画面剧。形态上更接近一种"会动的漫画",但叙事节奏完全沿用了短剧那一套——一分钟必须埋一个钩子,三分钟之内要给一个反转,每集结尾留悬念让人想点下一集。
1.1 这波热度是从哪儿冒出来的
2026 年 2 月,字节跳动旗下的即梦平台上线了 Seedance 2.0,从那时起整个 AI 视频圈基本上就变天了。我自己测试下来的感受是,前几代模型还在解决"画面别糊""人物别变形"的问题,Seedance 2.0 已经把镜头语言、动作节奏、音画同步这几件事一起打包做了。同一段提示词,以前能出一个动起来的画面就算成功,现在出来的是一个带配乐、带口型、带情绪、镜头还能切的小片段。这个跃迁是质变。
也正是因为这个跃迁,漫剧这个题材一下子有了商业化的土壤。红果短剧、抖音、快手都在加码漫剧赛道,平台侧的扶持政策和创作激励都在跟进。但我想先泼一盆冷水:别把这件事想成轻松产出。 工具变好了不等于产出门槛低了,它只是把"无法做"变成了"可以做",真正决定能不能做出来的,还是你对故事节奏的判断、对镜头语言的理解,以及对工具脾气的熟悉度。
1.2 漫剧适合什么样的人下手
我自己折腾了几个月,大概能把适合做漫剧的几类人画出像:
- 有故事感,但不会画画也不会拍片;
- 会写一点剧本,但找不到拍摄团队;
- 做过自媒体,熟悉短视频节奏,但被传统的真人短剧成本卡住了;
- 对一致性、提示词工程这些有耐心折腾的;
- 愿意把"成片"当作一个工程项目而不是一时兴起的人。
如果你属于其中至少两类,那这套流程对你来说就是值得啃下来的。莫潇羽@源码七号站 这一年观察下来的结论很直接:漫剧的爆款逻辑和真人短剧高度相似,谁能稳定地把故事节奏控制好,谁就能跑出来。
二、整套工作流的全景图,先看懂它再动手
在动手之前,先把流程图刻在脑子里,后面每一步你才知道自己处在哪个位置。下面这张图是我自己梳理的全流程脉络,基本可以涵盖从 0 到 1 出一集漫剧需要走的所有环节。
flowchart TD
A[选题与人设定位] --> B[原创剧本/授权剧本]
B --> C[小说转剧本]
C --> D[人物体系搭建<br/>三视图锁脸]
C --> E[场景体系搭建<br/>批量出图]
D --> F[剧本转分镜<br/>提示词生成]
E --> F
F --> G[即梦 Seedance 跑视频]
G --> H[音色与口型固定]
H --> I[剪映精修<br/>音画对齐+音效]
I --> J[成片导出]
J --> K[发布与数据复盘]
2.1 八步拆解的核心思路
把这张图揉碎了讲,可以拆成八步,每一步都有它必须解决的核心问题:
- 选题与人设——你要做什么类型,主角是谁,故事的钩子在哪里;
- 剧本生成——把脑子里的故事变成一份可拍摄的文字稿;
- 小说转剧本——把叙事文字翻译成镜头语言,标好台词与旁白;
- 角色锁定——保证主角全程长一张脸,不能集集变脸;
- 场景建库——保证同一空间在不同集里看起来还是同一个空间;
- 分镜拆解——把每一段戏拆成可生成的视频画面提示词;
- 视频生成——在即梦里跑出每一个分镜的成品片段;
- 后期成片——在剪映里把零碎片段拼接、对齐、加音效。
2.2 一个常见的认知误区
很多新手会把"视频生成"当成核心环节,把大量时间花在调即梦的提示词上。我自己踩了一段时间才明白,前面五步才是真正决定成片质量的关键,后面三步只是把前面的努力呈现出来。前期偷懒,后期就要花十倍的力气补。这就跟传统影视的"剧本是根"是同一个道理,只是 AI 时代把剧本之外的角色定型、场景定型也变成了你必须自己负责的环节。
三、工具栈三件套,先把家伙事儿摆清楚
整套流程下来,真正高频使用的工具其实只有三件。其他周边的辅助工具(比如豆包用来想点子、剪映里的素材库)都是附属品,主线就是这三个。
3.1 即梦 Seedance 2.0:视频生成主力
这是整条线最关键的引擎。Seedance 2.0 的几个关键特性,直接决定了你怎么写提示词:
|
特性 |
含义 |
对漫剧的影响 |
|
多模态输入 |
同时支持文字、图片、视频、音频参考 |
可以用三视图喂角色一致性 |
|
音画同步 |
自带配乐、音效、口型对齐 |
省掉了大量配音对嘴的工作 |
|
镜头语言可控 |
推拉摇移、景别切换可由提示词控制 |
真正能"导演"一段视频 |
|
最长 15 秒 |
单段视频上限 |
分镜要按照 5/10/15 秒切 |
|
多角色 @ 引用 |
支持参考多张角色图 |
多人对手戏不会变脸 |
这里多说一句:用即梦的时候,模型档位通常有几个选项,从轻量到高规格都有。轻量档跑得快、稳定性一般,适合用来试效果;高规格档画质和一致性更稳,适合最终成片。我自己的做法是第一轮用轻量档试节奏,效果跑通了再切高规格出最终版,这样不至于把好资源浪费在试错上。
3.2 剧本拆解工具:小说转剧本的中转站
这一类工具的核心能力是"把一段长文翻译成画面 + 台词 + 旁白 + 时间长度"。市面上能干这件事的工具不止一个,我会在后面统一用"剧本拆解 AI 助手"来指代,你可以理解成一个专门做小说转剧本、剧本转分镜、人物提取、场景提取的 AI 中转站。它的好处是把"翻译"这件事流程化了,你不用每次都重新写一遍提示词。
但用这类工具有一条铁律:单次喂的文字不能超过 5000 字。 超过这个量,工具会无声无息地"吞"掉一部分内容,你也不知道丢了什么,等到生成视频才发现剧情对不上号,那时候已经很难倒推了。
3.3 剪映:成片合成的最后一公里
剪映这边没什么需要展开的,关键能力有四个:剪辑、变速、字幕识别、音效叠加。后面会单独有一章细讲。这里只说一个最常被忽略的点:你以为剪映是用来"剪"的,实际上你 70% 的时间会用在对齐音画和补氛围音效上,真正的"剪"反而只占 30%。
源码七号站这边总结的经验是,如果你前面把分镜节奏控制好了,剪映这一步会非常顺;反过来,前面节奏乱了,剪映再多功能也救不回来。
四、第 0 步:在动笔之前,先把题材和人设定下来
很多新手最容易栽的不是工具,而是没想清楚要做什么就上来开搞,做到一半发现自己也不知道这个故事往哪走,只能弃掉。所以第 0 步永远是定题材、定人设、定调性。
4.1 题材方向怎么选
漫剧的题材选择和真人短剧高度重合,我用一张表把主流题材的特点列出来,你可以对照看一下自己适合哪个:
|
题材 |
核心情绪 |
钩子密度 |
上手难度 |
|
重生复仇 |
爽 + 解气 |
高 |
中等 |
|
替身/换嫁 |
委屈 + 反转 |
高 |
中等 |
|
古言宅斗 |
隐忍 + 谋略 |
中 |
偏高 |
|
年代亲情 |
治愈 + 共情 |
中 |
中等 |
|
玄幻修仙 |
爽 + 升级 |
中 |
偏高 |
|
都市情感 |
现实 + 共鸣 |
低 |
偏低 |
新手我建议从重生复仇或替身换嫁入手,原因有两个:钩子密度高,前三十秒就能抓人;情绪点足够强烈,即梦的口型同步和情绪匹配能力刚好能托住。等熟练了再去碰玄幻和古言这种对场景一致性要求很高的方向。
4.2 人设怎么立才不容易翻车
人设这件事讲究"少而准"。新手最常见的错误是给主角堆一堆形容词:温柔、坚强、聪慧、善良、独立、勇敢——这种描述送到即梦里,模型根本没法转化成画面。真正能落地的人设描述,是可视化的、有具体指代的。 比如:
错误示范:温柔坚强的女主,内心善良但表面冷淡
正确示范:25 岁,鹅蛋脸,黑色齐肩短发微