本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
如果你只有三分钟,先把这里读完。
核心结论: 借助即梦 AI 平台(Seedance 2.0 模型),任何人都可以从零开始制作以 AI 萌娃为主角的短视频内容,整套流程高度标准化,分为「角色创建→人脸处理→提示词写作→视频生成→剪映剪辑→平台发布」六个环节。其中,提示词质量是决定视频呈现效果的核心变量,角色一致性是撑起系列内容的根基。
关键信息一览:
- 核心工具:即梦 AI(https://jimeng.jianying.com)+ 剪映 PC 专业版,前者负责图像与视频生成,后者负责字幕与配乐
- 核心模型:Seedance 2.0,2026 年 2 月由字节跳动正式发布,支持图像、视频、音频、文本四种模态混合输入,在 Artificial Analysis Video Arena 评测中综合排名全球第一
- 三大核心难点:①如何跨镜头保持角色形象一致;②如何规避即梦的真人人脸检测机制;③如何写出让 AI 精准还原剧情的提示词
- 平台发布:抖音与快手均要求在发布时主动声明「AI 创作」,漏标可能被限流
→ 往下翻有每个环节详细的操作拆解与经过验证的真实提示词案例。
一、AI 萌娃短视频,为什么现在是入局窗口期
说实话,我最初接触「AI 萌娃」这个内容方向的时候,第一反应是:这种题材真的有人看吗?等我把第一条测试视频发出去,数据给了我一个很直接的回答——有人看,而且不少人看完还会去翻账号的其他内容。
这背后有很清晰的内容逻辑。萌娃题材本身天然契合短视频用户的情感偏好:画面可爱、剧情接地气、轻喜剧风格老少皆宜。与此同时,用真实婴儿拍视频要面对的现实问题太多了——隐私保护的法律风险、拍摄过程中的不可控因素、孩子状态好不好完全看运气。AI 生成的方式恰好绕过了所有这些麻烦:创作者可以自由设定角色外形和服装,随意编排剧情,不必担心「演员状态不佳」,角色也可以被无限复用。
从流量数据来看,这个赛道目前仍处于相对早期阶段。头部账号已经验证了爆款可行性,单条视频数百万播放量已是常见案例,但跟进创作者的数量和内容同质化程度远未达到饱和。这意味着,有差异化内容创意的新创作者,现在仍然有相当大的成长空间。
我观察过多个做这个方向的创作者,发现一个有意思的现象:做得好的,未必是最会用工具的人,而是最能把日常生活中的「共鸣感」提炼出来放进剧情里的人。真正的壁垒从来不在于工具本身——工具人人都能学会,但能不能持续产出让观众愿意完播、愿意点赞、愿意转发的内容,才是拉开距离的地方。
工具只是放大器,放大的是你对生活的观察力和对剧情节奏的把握能力。这句话我后面还会再提。
二、核心工具深度解析:即梦 AI 与 Seedance 2.0
即梦 AI 是什么,能干什么
即梦 AI(英文名 Dreamina)是字节跳动旗下专注于 AIGC 创作的平台,官网地址是 https://jimeng.jianying.com。它支持图片生成、视频生成、AI 画布等多种功能,目前国内与抖音、剪映整合最紧密的 AI 创作平台就是它。
有一点值得特别说一下:即梦的网页端和手机 APP 版在功能上差距相当大,手机 APP 做了较多精简,且界面逻辑和网页版不一样。我自己折腾下来,强烈建议用电脑或平板的网页端操作,这不是说说而已,很多关键功能(比如多图参考、全能参考模式)在手机端根本找不到或者操作起来极度别扭。如果实在只有手机,可以用浏览器打开网页版,在设置里切到「桌面版」模式,勉强能用。
即梦的计费方式是积分制。免费用户每天有一定额度,但对于高频创作来说肯定不够用,而且高峰期排队时间相当漫长。平台有多档会员套餐,主要权益是图片生成免积分、视频生成优先排队、更大的积分包。新用户注册一般有优惠活动,根据自己的创作频率按需选择就行。
Seedance 2.0:这次升级到底意味着什么
2026 年 2 月,字节跳动正式发布了 Seedance 2.0。这个模型的发布在创作圈引起了相当大的反响,原因不只是性能参数好看,更重要的是它改变了 AI 视频创作的底层交互逻辑。
在 Seedance 2.0 之前,做 AI 视频本质上是「随机抽卡」——你写一段描述,AI 按自己的理解生成,最终结果好不好要看运气。这种方式的核心问题在于:人物跨镜头会换脸、音画无法同步、复杂动作经常崩坏。做系列内容几乎无从谈起,因为你压根没办法保证「同一个角色」在两段视频里看起来是同一个人。
Seedance 2.0 解决了这几个老大难问题。它采用了多模态音视频联合生成架构,支持文本、图片、视频、音频四种模态同时输入。更关键的是,它在单次生成中同步输出画面与声音,而不是先生成静音视频再叠加音轨——这从根本上解决了口型错位和音画脱节的问题。
在人物一致性方面,Seedance 2.0 引入了角色锚定机制:上传一张角色图作为参考,模型会在整个视频中尽可能锁定这个角色的面部特征和服装细节,即使在运动幅度较大的镜头里也能维持基本稳定。对于想做长期系列内容的创作者来说,这一点是最实用的改进。
在即梦里使用 Seedance 2.0 的路径很简单:进入视频生成功能,在模型选择区域选 Seedance 2.0(分标准版和 FAST 版,FAST 速度更快但效果略弱,我自己通常先用 FAST 测试剧情,确认没问题再用标准版出成品)。除了即梦,字节旗下的豆包和小云雀 APP 也接入了这个模型,新用户在小云雀注册可以获得几次免费体验机会,拿来试手不错。
两个模式的区别:首尾帧 vs 全能参考
这是新手最容易搞混的地方,这里单独说清楚。
即梦的 Seedance 2.0 有两个主要入口:首尾帧入口和全能参考入口。判断用哪个的标准非常简单:如果你只有一张图片加文字描述,走首尾帧;如果你要同时上传多张图片(多个人物角色图、场景图、道具图),或者还有音频参考,走全能参考。
做萌娃系列内容基本上会有至少两个角色,所以全能参考是你的常规选项。全能参考模式支持最多 12 个文件同时上传,涵盖图片、视频、音频,并通过 @ 语法在提示词里指定每个素材的具体用途。关于这个 @ 语法怎么用,我在后面的实操部分会详细讲。
三、整体工作流程一览
正式开始每个环节的详解之前,先把整体流程的主干看清楚,后续理解各个细节会容易很多。AI 萌娃短视频的制作路径是高度线性的,掌握主线之后,每一步的操作都能放进这个框架里理解。
完整制作流程
─────────────────────────────────────
① 生成角色形象图(即梦图片 5.0 模型)
↓ 保存为固定「角色卡」
② 检测并处理人脸问题(转彩色铅笔素描)
↓ 确认能正常排队生成
③ 构思并撰写提示词(风格+场景+剧情+约束)
↓
④ 即梦生成视频片段(Seedance 2.0 全能参考)
↓ 按剧情分段生成,多段合并
⑤ 剪映后期加工(字幕、BGM、音量)
↓
⑥ 发布并声明 AI 创作
─────────────────────────────────────
|
环节 |
核心工具 |
关键注意点 |
|
角色生成 |
即梦图片 5.0 |
纯色背景,全身正面站立照 |
|
人脸处理 |
即梦图生图(彩色铅笔素描) |
每张图至少测试 2-3 次能否正常排队 |
|
提示词写作 |
文本编辑器 |
风格声明+场景设定+剧情内容+约束限制四段结构 |
|
视频生成 |
即梦 Seedance 2.0 全能参考 |
每个人物图用 @ 符号关联,勿省略 |
|
后期剪辑 |
剪映 PC 专业版 |
字幕+BGM 即可,无需复杂特效 |
|
平台发布 |
抖音/快手创作者中心 |
务必勾选「AI 内容声明」 |
四、第一步:创建你的 AI 萌娃角色形象
角色一致性为什么那么重要
这个问题值得在动手之前认真想清楚。AI 生成视频有一个先天缺陷:同一段文字描述每次生成时都有随机性,人物的面部特征、发型、服饰细节都可能出现漂移。单条视频里的细微漂移是可以接受的,但如果你想打造一个拥有固定形象的 IP 角色,观众在前五条视频里认识了你的「主角」,第六条视频里他突然换了张脸,那种割裂感会直接影响账号的识别度和用户黏性。
解决办法是:在视频生成时,始终把同一张角色图片作为「锚点」输入给模型,让模型以这张图为人物外形的参照基准。这张图就是俗称的「角色卡」。它一旦确定,就要长期使用,每次生成视频都要把它带上。
实际操作:用即梦图片 5.0 生成角色
打开即梦 AI,进入图片生成功能,选择图片 5.0 模型(这个模型的写实风格更强,人物细节还原度高)。图片比例建议选竖向,比如 2:3 或 9:16,方便生成全身照。
提示词的写法按以下几个维度展开:
年龄设定,用具体的月龄或年龄描述,不同月龄会影响身体比例——刚出生和一岁大的婴儿在体型上差异很明显。通常做「萌娃」内容的话,6 个月到 1 岁半这个区间在视觉上最讨喜。
表情状态,明确写「笑容状态」「可爱状态」,确保生成的角色不会是哭脸或表情木然的状态,后者在视频里传达的情绪氛围会很别扭。
服装细节,这里要尽量具体,颜色、款式、配件都要写到。比如「头戴带有爱心绒球的大红色针织帽,内穿大红色短袖,外搭大红色针织背带裤」,这种细节程度能让模型比较准确地还原你想要的穿搭风格。
发型,比如「自然黑色短发微卷」或「头顶几缕发丝」,婴儿发量通常不多,这个描述不用太复杂。
姿势和背景,站立状态、全身照、纯白色背景——这三点缺一不可。纯色背景在后续转线稿图的时候非常重要,背景越干净,线稿转换的效果越干净。
一个基础的提示词示例:
帮我生成一个 1 岁大的笑容状态、可爱的中国男婴,
身着大红色针织背带裤、大红色短袖,
头戴带有爱心绒球的红色针织帽,
黑色短发微卷,站立状态,全身照,纯白色背景。
生成之后挑一张满意的图。衡量标准很简单:面部表情是否可爱、服装细节是否清晰、整体感觉是否顺眼。不用过度纠结技术细节,选第一眼就觉得顺眼的那张。
视觉辨识度的核心来自哪里
这里有个容易被忽视的细节:角色的视觉辨识度,与其说靠的是长相,不如说靠的是服装颜色和配件的固定化。观众在几秒钟内识别出「这是同一个角色」,靠的往往不是面部记忆,而是那顶标志性的帽子、那件颜色特别的外套,或者某个固定配饰。
所以在设计角色时,建议给主角设计一套「标志性穿搭」:颜色选饱和度高、对比度强的(大红、橙色、宝蓝都是不错的选择),再搭上一两件有特点的配件(帽子、围巾、书包之类)。这套穿搭在后续每一条视频里保持一致,久而久之,观众看到这个颜色组合就会条件反射地联想到你的账号角色。
对于想做长期系列的创作者,我自己的做法是一次性为主角设计两到三个「换装版本」——日常版、节日版、特殊场景版,分别生成对应的角色图保存好,在不同类型的内容中灵活切换,既维持了角色的核心辨识度,又能给观众一些新鲜感。
要不要考虑动漫风格
如果你从一开始就倾向于做动漫或卡通风格,在提示词里把风格词改为「Q 版卡通风格」「日系动漫风格」「3D 卡通渲染」之类即可。即梦图片 5.0 对这类风格的支持相当稳定。
动漫风格的优势在于:视觉表现力更夸张(大眼睛、小嘴巴、圆润身形),天然契合「萌」这个主题;从一开始就不是写实人脸,几乎完全不存在人脸检测问题;在画面一致性上通常也比写实风格更稳定。劣势是 Seedance 2.0 对动漫风格角色的动作表演细腻度略弱于写实风格,需要在提示词里用更具体的动作描述来弥补。
如果你对美术设计有一定的审美基础,甚至可以自己设计角色的颜色搭配和面部特征,然后用文字描述让即梦帮你生成,最终得到一个完全原创设计的虚拟 IP 形象。
多角色怎么设计
如果你想做主角和配角互动的剧情内容(这类内容通常比单人独白更有可看性),需要准备至少两个角色形象。设计配角时,在主角的基础上做差异化处理:换颜色、换服装风格、换性别(男婴或女婴),让两个角色在画面里一眼就能区分开来。
想做游戏联动内容的话,可以截取对应游戏角色的服饰图,然后在即梦图生图功能里,以萌娃底图和游戏服装图为双重参考,生成穿着游戏风格服饰的萌娃形象。这个方式可以实现跨 IP 的视觉联动效果。
文件管理习惯
建议为每个角色建立专属文件夹,把角色原图、角色线稿图(下一节会提到)、不同场景的变体图分类存放。内容做久了积累的素材量会相当可观,提前建好文件结构能省很多翻找的时间。
五、第二步:处理真人人脸检测
为什么需要处理这一步
即梦平台在某一阶段因为大量用户用真人照片生成视频,引发了不少涉及肖像权的争议,随后平台加强了对「真人人脸」参考图的限制。如果系统检测到上传的图片含有真实人脸,往往直接拒绝生成或者弹错误提示。
这个限制对萌娃内容创作者影响不小,因为即使是 AI 生成的写实风格婴儿图,如果面部特征过于逼真,也可能触发系统的人脸识别。解决办法是:把角色图转换为线稿素描风格,从视觉层面告诉平台「这不是真实人脸」。
操作方法:彩色铅笔素描转换
在即梦的图生图功能里,把刚才生成好的角色图上传,在提示词框里输入:
彩色铅笔素描,线稿
生成完成后会得到一张手绘感很强的铅笔风格人物图——色彩被替换为彩色铅笔质感,细节被线稿化处理。这张图保留了原始角色的轮廓、服装结构和发型特征,但不再呈现写实的皮肤纹理和三维立体感,在绝大多数情况下能够绕过人脸检测。
验证步骤
在大批量生成内容之前,先验证这张线稿图是否真的通过了检测:
- 进入即梦视频生成界面,选择 Seedance 2.0 标准版(测试阶段别用 VIP 版,节省积分)
- 把线稿图作为参考图上传,随便写一段简单的剧情描述,点击生成
- 观察系统反应:页面显示「排队中」说明通过检测,可以正常使用;如果立即弹出「视频生成失败,检测到人脸」或类似提示,需要重新生成线稿图换一张再测
建议每张角色图至少连续测试两到三次,每次都能成功进入排队状态,才算真正确认这张图可用。平台的检测机制会不定期更新,偶尔会出现第一次通过、第二次失败的情况,多测几次能有效降低后续批量制作时