本文由 莫潇羽@源码七号站(www.fuyuan7.com) 撰写,转载请注明出处。
快速摘要
这是一篇把 AI 短剧整条生产链拆开讲的长文。 围绕 2026 年主流模型(字节系即梦 Seedance 2.0、可灵 O 系、Vidu Q 系、海螺、Nano Banana 等)的当下状态,把"选题—剧本—角色—场景—分镜—视频—声音—剪辑"八个环节逐个落到具体操作上。核心结论是:AI 短剧不是抽卡运气活,而是一条可以工业化的流水线。决定成片质量的不是你买了多少积分,而是你能不能在每一个环节上拿到稳定的控制力——剧本写给算法、提示词遵循结构、角色用三视图锁死、分镜对齐情绪曲线、视频选对生成模式、声音分三层铺垫、剪辑用三遍法过。文中给到了通用提示词公式、风格 DNA 提取法、镜头语言写法、运镜口诀、分镜情绪曲线模板、视频四种生成方式的取舍逻辑,以及配音和剪辑的卡点技巧。想看完整拆解,往下翻。
一、动手之前先想清楚:AI 短剧到底是不是适合你的事
1.1 短剧这股风为什么吹起来了
短剧这一波热度起得很猛。从 2020 年前后真人竖屏短剧在国内冒头,到 2024 年整体收益规模超过院线电影票房,2025 年继续放大,2026 年海外短剧市场也进入了快速扩张期,业内公开数据预计全年规模会突破 60 亿美元,AI 漫剧赛道上单是国内入局的主体就已经超过十万家。这些数字背后的逻辑其实很朴素:观众的观看习惯变了。两个小时的院线电影,一旦节奏拖一点观众就在里面打哈欠;切到短剧上,刷一分钟不爽就划走,刷到爽点就追下去,决策成本被压到了趋近于零。
真正值得普通人关注的点不在"风口",而在"准入门槛"。 真人短剧虽然热,但它需要演员、片场、灯光、化妆、场地,一部 100 集的真人剧成本动辄上百万。AI 短剧不一样,工具链成熟之后,个人创作者用一年几百到几千块的工具开销,就能把一整集做出来。莫潇羽个人这两个月折腾下来的体感是:门槛已经从"组个剧组"降到了"一个人加一台电脑"。
1.2 我对成本的两个口径
聊成本,建议把它分成硬成本和时间成本两块来看,混在一起很容易算糊涂。
硬成本主要是几个 AI 平台的会员费。即梦的基础会员一年六百多块,月卡七八十;可灵、海螺这些按积分计费,自己控制好节奏,一年综合下来千把块完全打得住。如果连充值都不想做,多注册几个账号、每天领免费积分凑算力,也能跑通一集几分钟的体量——这是我自己实测过的路子,不算高效,但确实可行。
时间成本要单独说。Seedance 2.0 出来之后,音画同步直接做到了可用的水平,过去要在 AE 或剪映里手动对口型的活儿被压缩了一大截,行业里有公开数据提到单集生产时间能压到一个小时左右,单人单日产出 20 分钟成品已经被不少团队跑通。但新手第一集千万别上来就奔着工业化,先用一周时间把一集 1 到 2 分钟的片子完整跑一遍,跑通了再谈效率。
1.3 最小化测试,是普通人的底盘
莫潇羽@源码七号站这边特别想强调一句:不要一上来就规划 30 集 100 集,先做第一集。第一集做完了,发到抖音、B 站、视频号或者红果上去测数据。数据出来了,知道这个题材、这个人设、这个节奏跑得通,再考虑往下做第二集。这个动作叫最小化测试,它解决的不是制作问题,是"不亏"的问题。AI 工具再省钱,你也消耗了时间,时间是你最大的成本,必须用数据来背书。
二、2026 年主流工具链梳理:手里有什么牌
工具这件事,门外人看着五花八门,门里人其实就那么几张牌。把工具链梳理清楚,后面写提示词、做分镜才知道自己手里能调什么资源。
2.1 视频模型:当下的几张主力牌
把视频生成模型列开来对比,2026 年这个时间点上能用的主力大致是这样几款:
|
模型 |
出品方 |
关键能力 |
适用场景 |
|
即梦 Seedance 2.0 |
字节跳动 |
多模态参考(图/视频/音频/文字),音画同步,最长 15 秒 |
主力出片,对话戏首选 |
|
即梦 3.5 Pro / 3.0 Pro |
字节跳动 |
高清画质,首尾帧 |
高画质过场,没有对白的镜头 |
|
即梦 3.0 智能多帧 |
字节跳动 |
多帧串联,最长可拼一分钟 |
漫游运镜,长镜头 |
|
可灵 O 系列 |
快手 |
1080P,15 秒,音画同步 |
Seedance 排队卡顿时的备用 |
|
Vidu Q 系列 |
生数科技 |
参考图绑定 |
风格化镜头 |
|
海螺(MiniMax) |
MiniMax |
写实画面 |
备用方案 |
|
万相 2.6 |
阿里 |
工业化流水线常调用 |
工作流集成 |
主力建议放在即梦 Seedance 2.0 上——这是字节跳动 2026 年 2 月放出来的新一代多模态模型,它的特别之处不是画质,而是"全模态参考":你可以同时丢图片、视频、音频和文字进去,AI 把这些素材揉成一个新视频。对短剧来讲,最值钱的是它的音画同步能力,对白角色嘴型对得上、情绪能跟上。
但有一点要注意:Seedance 2.0 因为太火,经常排队,遇到生成失败或者审核问题时,要有备用方案。莫潇羽自己折腾下来的常用组合是:主用即梦 Seedance 2.0 + Fast 版本做对白镜头,3.0 Pro 智能多帧补过场,可灵兜底,遇到风格化镜头切 Vidu。
2.2 图像生成:分镜图与角色定妆
视频之外,图像模型也是吃饭家伙。当下的常见组合是:
- Nano Banana Pro(Google):写实人像和角色一致性表现非常强,做角色定妆照、三视图很好用;
- 即梦 4.5:中文理解能力强,做分镜图的多宫格非常顺手;
- MidJourney V7 / Flux Kontext:偏艺术风格,做意境镜头;
- 豆包(字节系):免费额度大,反复迭代角色形象不心疼算力。
我自己跑分镜的工作流是这样的:先在豆包里反复改角色,免费额度跑透了再把方案搬到即梦放大到 4K,最后用 Nano Banana 系做最终定妆。这样做的好处是把贵的算力花在刀刃上。
2.3 大语言模型:剧本与提示词的总枢纽
大语言模型在 AI 短剧里干的活其实最重,不是简单的"写剧本"。具体场景包括:
- DeepSeek 用来写剧本、做剧本拆分、生成分镜脚本;
- 豆包用来反推提示词、做风格分析、给定妆迭代;
- ChatGPT / Gemini 用来提取风格 DNA、做 JSON 化格式封装;
- Claude / 通义千问 做剧本结构审校。
记一个原则:所有需要"结构化输出"的活儿都交给大模型。比如让它把你给的故事拆成 12 个分镜并标注情绪曲线、把一段提示词转成 JSON 格式、把多张参考图的共性归纳出来,这些事情大模型做得比人手快得多。
2.4 剪辑与图像后期
剪映是事实上的标配,它的好处不在于功能强大,而在于音效库、转场库、字幕能力都自带,省掉很多外部素材的麻烦。需要做声音分离、声音克隆时,剪映本身的会员功能够用了;做不到的细节用专门的克隆配音平台兜底。Photoshop(或在线版的 Photopea)用来去水印、修补瑕疵,是必备的辅助。
工作流层面,ComfyUI 这种工具值得花时间学一下,它的图片放大、模特微调、多视图生成模块对资源化制作帮助极大。
三、选题与剧本:决定生死的第一关
剧本这一关如果踏空,后面所有的工具效率再高都救不回来。莫潇羽过去几个月跑下来最大的体会就是:短剧剧本是写给算法看的,不是写给观众看的。
3.1 平台算法的口味画像
短剧主要分发平台无非抖音、快手、视频号、红果、B 站、小红书这几家。每家算法对内容的偏好不同:
- 抖音、快手:3 秒内出钩子,10 秒内立场景,节奏快,爽点和虐点要扎实;
- B 站:观众停留时间长一些,可以做世界观铺垫和情绪铺垫;
- 小红书:女性视角、情绪带入、生活感强的内容更容易跑出来;
- 红果短剧:垂类短剧的主战场,对题材的工业化标签敏感;
- 视频号:年龄段偏中年,对家庭、伦理、反转主题接受度高。
写之前先想清楚发哪几个平台,不同平台同一个故事的剪辑节奏甚至能差出一倍。
3.2 三种快速选题方法
选题没必要硬编,已经被市场验证过的方向永远比凭感觉编的要稳。我常用的三种打法:
第一种是爬榜单看趋势。抖音热榜短剧类目、红果短剧热度榜、番茄小说原选榜单(小说题材是短剧的最大素材池),这些是公开的风向标。看到末世、西游、重生、玄幻、甜宠、复仇这些标签反复出现,跟着做八成不会跑偏。
第二种是找对标拆解。选 5 部跑得好的对标作品就够了,针对性拆它的题材、人设、开头、结尾、节拍。拆这件事自己做太慢,交给 DeepSeek,丢进去要求"拆解短剧结构,输出题材标签、人设公式、节拍表",几分钟就能出一份分析报告。
第三种是蹭经典 IP。从《哪吒》到《黑神话:悟空》,从《斩仙台》到《长安的荔枝》,最近几年跑得最猛的都是老 IP 的新做法。这个逻辑很简单:观众对老 I