本文由 莫潇羽@源码七号站(www.fuyuan7.com) 撰写,转载请注明出处。
快速摘要
这篇长文把我自己折腾 AI 短视频和口播短剧的整套打法,从头到尾梳理了一遍。核心结论先放在最前面:做 AI 短视频不是"输几个字就出片"那么简单,真正能跑出完播率的作品,背后都是"提示词万能公式 + 题材定位 + 人物模型选择 + 分镜切法 + 角色一致性 + 视频工具 + 剪辑后期"七层组合拳。文生图阶段记住"主体、风格、构图、光影、画质、负面"六要素;分镜阶段熟悉五种主流的"开镜"切法,从八镜头/15 秒到三镜头/15 秒各有适用题材;角色一致性靠的是定身照,做不好同一个人后面就会变脸;真人短剧目前国内最稳的是即梦、可灵、通义万相、海螺这一档工具;最后所有视频片段拉进剪映,简单配口播或字幕、压一压背景音乐就能出片。完播率比流量更值得盯,80% 完播的小流量作品,系统迟早会推。
想看完整拆解,往下翻。
一、为什么这套打法值得花时间摸透
短视频这几年最大的变化,不是平台变了,是创作者的"门槛"被 AI 工具重新洗了一遍牌。以前要拍一段像样的口播,得有相机、灯光、收音、剪辑,门槛卡在那里,大部分人就劝退了。现在不一样,文生图、文生视频、AI 配音、智能剪辑这几样工具拼起来,普通人在家里一台电脑就能开工。
我自己一开始也是用最笨的方法去试,模仿别人的爆款一帧一帧扒,扒完发现学不会——别人的提示词看着乱七八糟一长串,自己抄过去出图就崩。后来才慢慢悟出来:那些看上去"长得吓人"的提示词,本质上是一套结构化的公式,只要把公式拆开,任何人都能照着写,而且写得越熟越短。这套手册就是把我踩过的坑、对比过的工具、试过的题材,一次整理清楚。
读这篇文章之前,先说几句实话。
第一,AI 短视频不是"零基础三天出爆款"。出片是真的快,但要让作品被人愿意看完,核心还是题材选得对、画面有信息密度、节奏不拖沓。工具只是放大器,你脑子里有什么样的故事,它就放大成什么样的视频。
第二,这一行的工具迭代非常凶。我这次写的版本是基于 2026 年中能稳定使用的方案,不排除半年后某个工具改版甚至下线。所以理解原理比记功能按钮重要,后面每讲一个工具,我都会先讲它为什么这样设计,再讲操作步骤。
第三,口播视频和短剧虽然形式不一样,但底层逻辑高度共用。文生图公式、分镜切法、角色一致性、剪辑后期这几个模块,口播和短剧只是组合不同。把通用模块吃透,你想做哪一种都行。
下面我们从最底层的文生图公式开始,一层一层往上搭。
二、文生图万能公式:六要素拆解
文生图是整个 AI 视频流程的"地基"。绝大多数短视频生成工具底层逻辑都是先出图再出视频,所以提示词写不好,后面所有环节都会被拖累。
我自己用的提示词万能公式很简单,六个要素,顺序可以微调,但一个都不能少:
主体 + 风格 + 构图 + 光影色彩 + 画质细节 + 负面提示词
下面逐个拆开来讲。
2.1 主体:核心对象 + 特征 + 环境
主体是画面里的核心元素,也是 AI 第一个要锁定的东西。一个完整的主体描述包含三件事:
|
维度 |
包含内容 |
举例 |
|
核心对象 |
人/物/动物/场景 |
少女、机车、猫、咖啡馆 |
|
特征 |
年龄、性别、服饰、动作、表情、材质 |
二十岁、白色亚麻裙、捧着鲜花微笑 |
|
环境 |
室内室外、城市海边、白天黑夜 |
窗边、午后、樱花飘落 |
举一个我自己常用的写法:"二十岁的日系少女,长发微卷,身穿浅色连衣裙,坐在窗边捧着鲜花,神情柔和"。注意这一句话里同时把"对象+特征+环境"全部塞进去了,AI 拿到这一句就能稳稳锁定主体。
很多新手写提示词的毛病是只写主体,不写特征和环境,比如只写"一个少女",这样 AI 会随机给你一张脸、随机给你一身衣服、随机一个背景,结果就是"图是出了,但根本不是我想要的"。
2.2 风格:决定整张图的"调"
主体描述完,接下来要告诉 AI "用什么风格去画"。风格大致分成几类,各家工具的命名可能略有差异,但基本上跑不出下面这几种。
常见风格分类:
├─ 写实类:摄影写实、电影写实、高级写真
├─ 二次元类:日系动漫、插画、漫画分镜
├─ 国风类:水墨、工笔、古风仙侠
├─ 艺术家风格:宫崎骏风格、新海诚风格、赛博朋克
├─ 现代潮流:迪士尼皮克斯、3D 渲染、潮玩手办
└─ 复古怀旧:港风胶片、八十年代海报、复古油画
写法上,在主体后面直接加一句"风格关键词"就行。比如刚才那个少女,加上"宫崎骏动画风格,日系手绘",出来的画面气质瞬间就变了——光线柔和、色彩饱和度提高、人物轮廓也更卡通化。
我自己有个小习惯:不熟悉的风格不要乱写。比如你不知道"赛博朋克"长什么样,贸然写进去,AI 给你一张霓虹灯加机械臂的图,跟你原本想要的"夜景少女"完全不是一回事。先在搜索引擎里看一眼这种风格的代表作,心里有底了再用。
2.3 构图:决定画面"怎么看"
构图这一层很多人都不写,直接交给 AI 随机,出来的图就经常很奇怪——主体在角落、背景占太多、人脸被裁掉一半。其实构图也是一组关键词,加上就立刻不一样。
构图包含三个子项:
- 视角:正面、侧面、俯视、仰视、平视
- 景别:大远景、远景、全景、中景、近景、特写
- 构图法则:居中构图、对称构图、留白构图、三分法、单点透视
我最常用的一组组合是 "半身特写,居中构图,背景虚化"。这套关键词加进去,出图基本上就是一张"主体清晰、背景有氛围"的成片图。如果你拍口播,这一套也直接能用,因为口播视频本身就需要人物在正中、表情清晰、背景不抢戏。
2.4 光影色彩:决定画面的"温度"
光影色彩这块,新手最容易忽略,但它对成片质感的影响是最直接的。同一个主体、同一个构图,换一种光,氛围就完全不同。
|
光线类型 |
适用场景 |
关键词写法 |
|
自然光 |
日常、户外、纪实 |
"自然光,柔和阳光从窗外斜射进来" |
|
黄金时刻光 |
浪漫、温暖、回忆 |
"黄昏暖光,逆光剪影,镜头光晕" |
|
电影感光 |
戏剧、紧张、神秘 |
"电影感打光,主光侧顺,阴影深邃" |
|
霓虹光 |
赛博、夜景、潮流 |
"霓虹灯光,紫粉色调,夜间街景" |
|
柔光环境 |
美妆、产品、人物特写 |
"柔光箱打光,均匀无阴影" |
色彩这一块直接配合光线写,比如"暖色调、复古胶片色、低饱和高级灰、克莱因蓝主色"等等。我个人偏好暖色,因为暖色出片更容易让人停留多看几秒,完播率会好看一点。
2.5 画质细节:决定"清不清楚"
画质细节关键词的作用,是逼着 AI 把分辨率拉满、把材质细节渲染出来。这一块基本上是套路,记几个关键词就能用一辈子:
8K, 超高清, 电影质感, 大师级作品, 最佳质量,
细节丰富, 锐利对焦, 真实材质, 皮肤纹理清晰
把这一长串直接抄进提示词的末尾,出图清晰度肉眼可见地往上提一档。
2.6 负面提示词:告诉 AI "别画什么"
负面提示词是新手最容易漏的,但它决定"翻车率"。AI 出图经常画错手、画多手指、面部畸形、镜面反射出诡异图案,这些都是负面提示词没写好。
我常用的负面提示词模板,基本上能挡掉 80% 的翻车情况:
低质量, 模糊, 畸形, 多余的手指, 多手, 错乱的肢体,
面部畸形, 比例错误, 多人脸, 水印, 文字, 杂乱背景
直接复制粘贴到工具的"负面提示词"输入框里就行。即梦、豆包、通义这类工具都有专门的负面提示词输入位,不要把它写进正向提示词里。
2.7 完整提示词长这样
把上面六要素拼起来,一条完整的提示词长这样(以"日系少女"为例):
正向提示词:
二十岁日系少女,长发微卷,白色亚麻连衣裙,坐在窗边捧着鲜花,
神情柔和;宫崎骏动画风格,日系手绘;半身特写,居中构图,背景虚化;
午后柔和阳光从窗外斜射进来,暖色调,镜头光晕;
8K,超高清,电影质感,大师级作品,细节丰富,皮肤纹理清晰
负面提示词:
低质量,模糊,畸形,多余的手指,多手,错乱的肢体,
面部畸形,比例错误,多人脸,水印,文字,杂乱背景
把这一段贴进即梦或者豆包,出图基本上就是你想要的样子。莫潇羽@源码七号站测试过几十遍,只要主体描述清晰,这套公式的稳定度非常高。
2.8 主流文生图工具简评
国内目前常用的几个文生图入口,我都跑过测试,简单说一下各自特点:
- 即梦:字节跳动旗下,综合最稳,接入 DeepSeek 之后还能直接对话生成提示词,新手友好度第一。
- 豆包:也是字节系,文生图能力跟即梦同源,但界面更轻,适合手机端临时用。
- 通义万相:阿里巴巴出品,在文字渲染和主体一致性上做得很好,适合需要"图里带字"的设计型场景。
- 网易系图像工具:偏二次元和插画,日漫风格强。
我自己用得最多的是即梦,因为它把"文生图—文生视频—图生视频—对口型—运镜控制"这一