本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
核心结论: 用即梦AI(jimeng.jianying.com)负责图片分镜生成,用海螺AI(hailuoai.video)负责图转动画,两个工具组合起来是目前国内做AI动画短片性价比最高的方案。生成效果好不好,八成取决于提示词写得对不对——本文会拆解一套三段式提示词框架,分别管镜头/场景、人物/动作、光影/风格三块内容,按这个结构写提示词,生成质量会稳定很多。
角色一致性(俗称"卡图")是最多人踩坑的地方,本文介绍三种落地方法:人像写真面部锁定法、详细描述词复用法、参考图一致性生成法。另外还覆盖了故事构建思路、剪辑特效搭配、配音口型同步,以及想做成一个完整短片团队协作的大概流程。
想看完整拆解,往下翻。
为什么现在做AI动画短片是个好时机
说实话,两年前我折腾AI视频,基本处于"看着激动,做出来就废"的状态——生成的角色每换一个场景就换一张脸,动作要么像标本摆着不动,要么动起来形状离谱。那时候做这件事,主要靠的是耐心和运气。
现在不一样了。
即梦AI在2025年连续推出3.0、3.1、4.0版本,人物面部一致性和中文语义理解都有了质的跳跃。海螺AI的Hailuo系列已经迭代到2.3版本,肢体动作的流畅度和物理表现在全球AI视频榜上反复登顶。更关键的是,这两个工具在国内都能正常用,不需要折腾任何额外的上网工具。
另一个变化是——入门门槛真的低了。以前写提示词全靠"玄学抽卡",写了半天不知道为什么出图好,也不知道为什么突然出了好图就再也复现不了。现在只要掌握一套有框架的写法,普通人也能把生图质量提升到80分以上的稳定水平。
我自己这段时间把从零到成片的整个过程折腾了很多遍,踩了不少弯路,也摸出了一些规律。这篇文章,就是把我个人实操体验里真正有用的东西,打包整理出来。
工具选型:即梦AI+海螺AI为何是当下的黄金组合
先把工具选型的逻辑交代清楚,省得后面有人问。
即梦AI 是字节跳动旗下的一站式AI创作平台,底层基于自研的Seedream系列模型。它对中文提示词的理解远优于大多数同类工具,在亚洲人面孔的一致性保持方面也特别出色。积分体系方面,免费用户每天可以获得60积分,付费会员包年659元,平均下来每月不到60块。生图选1K分辨率免费,2K消耗2积分,对个人创作者来说积分压力不大。
即梦目前的主力模型是3.0系列(精准遵循文字描述)和4.0系列(更多用于图片编辑和修改),生成静态分镜推荐用3.0或3.1,4.0更适合在已有图片基础上做局部修改。
海螺AI 是MiniMax旗下的视频生成平台,目前搭载Hailuo系列模型(最新为Hailuo 2.3)。它的核心优势是图转视频的角色一致性——上传一张图片作为首帧,生成的视频在人物外貌和色调上能保持高度连贯。另外海螺对水墨风、动漫插画等特殊风格的支持效果在同类产品里也排得上号,做国风短片的朋友会很有感。
两个工具配合着用,即梦出分镜图,海螺把图片动起来,这套流程我目前测试下来是国内创作者性价比最高的方案,莫潇羽@源码七号站在这里也推荐大家用这个组合作为起点。
这里也顺带说一下两个工具的账号准备。即梦AI需要用抖音账号登录,没有的话注册一个也很快。登录之后建议先用免费的每日积分熟悉界面和功能,等到确认这是你长期会用的工具之后再考虑充值。积分方面新用户会有折扣优惠,但具体活动会随时间调整,建议登录后直接查看当前的优惠状态,不要完全依赖别人描述的旧信息。
海螺AI在国内的访问地址是 hailuoai.video,注册完成后有每日的免费生成额度,5秒视频的成本很低,很适合初期大量练手。
另外有一个实用的效率小技巧:因为AI视频生成有等待时间,每次点击生成后不要一直盯着等,可以利用等待时间准备下一组分镜的提示词,或者整理已经生成好的素材。如果某些任务特别紧,也可以同时用两个账号并行生成,这样整体的制作速度会快很多。
三段式提示词框架详解
这是整篇文章最核心的部分,也是我认为最容易让新手提升生图质量的方法论。
为什么需要一套固定框架
在没有结构的情况下写提示词,最常见的问题是这样的:有些描述词叠在一起,AI搞不清楚你想让哪个元素突出;场景、人物、风格混着写,生出来的东西要么侧重不对,要么在切换镜头时根本就无法保持一致性。一旦你做一个系列分镜,前十张图和后十张图基本是两个世界。
有了固定框架之后,每次写提示词都像填表格——每一段都有明确的信息归属,知道"这个词应该放在第几段",修改起来也更精准。
另外还有一个更实际的好处:框架化的提示词在你交换场景时操作非常简单。想换一个场景?只改第一段。想换一个动作?只改第二段的动作部分。想调整整体色调?只改第三段。这种"模块化修改"在连续做十几个分镜的时候,能省掉非常多的时间,也能避免因为大幅修改提示词导致意外丢失之前稳定输出的视觉效果。
第一段:镜头角度与场景
第一段是整个提示词的"定位",主要包含:
- 镜头类型:中景、全景、特写、大特写、近景、俯拍、仰拍、顶拍、侧拍、背拍
- 构图方式:中心构图、对角线构图、黄金分割、对称构图等
- 场景环境:在哪里,背景是什么
举个具体例子,第一段可以是:
正面中景构图,16比9画幅,古代破旧的东方木屋前,
夜晚,地面有积水,远处竹林隐约可见
为什么场景放第一段?AI生成图片时,会把出现位置靠前的关键词权重看得更高。把镜头和场景放在最前面,等于告诉AI"先确定这个画面拍的是什么样的空间",这样后面的人物描述才会在正确的舞台上呈现。
构图类型决定了整张图的视觉张力。中心构图呈现的是稳定、庄重的感觉,适合正面角色登场;对角线构图更有张力,适合剧情冲突或混乱状态;俯拍有压迫感,适合强调环境和弱势角色。这些构图知识不是AI独有的,传统摄影和影视里早就有成熟的理论,搬过来用就行。
第二段:人物外貌与动作
第二段是"主体描述",这里面要放的内容大概是:
- 人物外貌:年龄区间、发型、发色、肤色、面部特征(如果是第一次生成这个角色)
- 服装描述:材质、颜色、款式
- 当下状态:在做什么,表情是什么
例子:
一位28岁左右的亚洲女性,银白色短发,
穿着深红色飞鱼服,右手握住剑柄,
表情冷峻,眉头微皱,注视着画面右方
动作的描述要尽量具体,不要只写"站立"或"打斗",要写出动作的细节:是抬起左手还是右手,是刚刚拔剑还是已经交锋。越具体,AI的理解误差就越小,你想要的画面出现的概率就越高。
另外有一点很多新手容易忽略:如果这个角色在整套分镜里会出现多次,人物描述中的年龄段、发型、服装的核心元素在每一张图里都要保持一致。人物描述里的变化越小,角色的整体一致性就越稳定。
第三段:光影、色调与风格附加
第三段是整套提示词的"调色表"和"滤镜层",主要包含:
- 整体风格:超写实、国漫风格、3D动画、水墨风、赛璐珞动漫等
- 光影描述:明暗对比强烈、顺光/逆光/侧光、电影质感、体积光
- 色调:暖色调、冷色调、高饱和度、低饱和度
- 材质感:胶片颗粒感、空气粒子感、雨雾氛围
例子:
超写实风格,明暗对比强烈,冷色调为主,
电影级质感,轻微颗粒感,空气中有水雾
这一段是整套系列分镜中最不能变的部分。如果你的第一组图写了"超写实风格",第二组突然改成"动漫风格",整部短片的视觉统一性就毁了。莫潇羽的建议是:在开始做分镜之前,先把第三段的内容确定好,然后把它固定下来,在所有分镜的提示词里复制粘贴使用,绝对不要随意修改。
三段式提示词的完整示例
下面是一个可以直接参考的标准格式:
【第一段·镜头场景】
正面中景,中心构图,清朝风格的庭院,
夜晚月光,地面青石板上有薄薄的积水,
背景是木质回廊和灯笼
【第二段·人物动作】
一位26岁左右的中国男性,短发利落,
穿着深灰色短打武服,腰间别着短刀,
正弯腰低头,双手合十,表情凝重而专注
【第三段·光影风格】
超写实风格,暗色调主导,明暗对比强烈,
侧面冷光源,电影质感,轻微颗粒感,
远景虚焦,焦距落在人物面部
这种写法本身没有什么神秘之处,就是把信息整理清楚,让AI不用猜你的意图。新手第一次写完整的三段式之后,很多人反映"好像一下子就明白该怎么写了",因为写作过程变成了一个有步骤的问答——先问自己拍什么镜头、再问有谁在里面做什么、最后问要什么风格和氛围。
提示词里容易犯的错误
错误一:每一段都太短。 三段式不是三个词,是三段"有细节的描述"。第一次用这个框架的时候,很多人会写成这样:
正面构图/帅哥,吃冰淇淋/超写实
这样的描述缺少足够的定位信息,AI只能靠猜来填补缺失的部分,结果就是生成质量随机程度很高,有时候出来的图很惊喜,更多时候偏离你的预期很远。把每一段写充实,是让生图质量稳定的基础。
错误二:把风格词插在人物描述里。 比如"一个超写实风格的女孩拿着剑",这里的"超写实风格"应该在第三段,而不是夹在人物描述里。风格词放在错误的位置,会导致AI对它的权重处理出现偏差,有时候你以为在说风格,AI理解成了对这个人物的视觉描述,整个提示词就混乱了。
错误三:第三段每次都在变。 这是最常见也是最致命的错误。如果你做一个十张分镜的系列,前五张是"超写实风格,冷色调",后五张忘记了复制改成了"动漫风格,暖色调",这十张图拼在一起的时候,观众直观感受就是"这像两部不同的片子"。一旦确定了风格,第三段就锁死它,不要动。
角色一致性(卡图):三种核心方法
如果你做的是单张图或者单次生成,一致性不是大问题。但如果你要做一部完整的动画短片,每一帧里的主角都要看起来是同一个人——这件事在AI创作里被称为"卡图",也是大部分人最头疼的地方。
下面分三种方法讲,难度从低到高。
方法一:人像写真面部锁定法
这是即梦AI里内置的功能,也是对新手最友好的方法。
具体操作:进入即梦AI的图片生成页面,选择3.0模型,点击上传参考图,然后在「参考模式」里选择"智能参考"中的人像写真或角色特征选项。上传一张你满意的角色正面照之后,AI会扫描这张图的面部五官特征,并在后续的生成中持续锁定这些特征。
关键点:
- 参考图尽量选正面照,要能清楚看到左右脸和五官
- 一旦锁定面部,后续提示词里就不需要再描述五官特征了,AI会自动保持
- 可以自由变换发型、发色、服装、场景,但面孔会保持一致
这种方法的好处是操作简单,五官的还原度很高,适合从真实照片出发构建角色的场景。局限是它不能完整地控制服装和道具,如果你想保持服装一致性,还需要在第二段描述词里加上服装的关键特征。
方法二:详细描述词精准复用法
这个方法不依赖工具特性,完全靠提示词本身。核心思路是:把角色的核心视觉特征写成一段固定描述词,在所有分镜里原封不动地复制粘贴使用。
"核心视觉特征"需要包含以下几类信息:
角色描述词示例(固定不变部分):
- 年龄段:30岁左右的中国男性
- 面部特征:方形脸轮廓,眉毛浓密,眼神深邃
- 发型:黑色短发,发梢略凌乱
- 服装(关键元素):深蓝色棉麻汉服长衫,领口有银色刺绣
可以变动的部分:
- 场景(第一段全部可改)
- 动作(第二段动作部分可改)
- 光影色调(只要风格大类不变,细节参数可微调)
不能变的部分:
- 年龄描述
- 面部特征的核心词
- 服装的颜色和款式关键词
我自己测试下来,3.0模型对"年龄 + 面部关键词 + 服装颜色"这三个维度的遵循程度最高。只要这三项固定,即使换了场景,生成出来的角色在视觉感上也差距不大——可能头发方向、表情会有一点偏差,但整体仍是同一个人的感觉。
31的模型美学多样性更强,但相应地,对描述词的严格遵循度比3.0稍低一点,在追求一致性的时候会更需要多生成几次从里面挑选。
方法三:参考图多次迭代生成法
这是最灵活也最费时间的一种方法,但效果往往最好。
基本逻辑是:先用前两种方法生成一张你最满意的角色基准图,把这张图保存下来,作为后续所有场景变换的"角色卡",然后把这张图连同新的场景描述词一起输入给AI,在「参考图」中上传这张角色卡。
具体步骤:
Step 1:基准图生成
→ 使用方法一或方法二,生成一张角色最正面、最清晰的基准图
Step 2:场景切换生成
→ 进入即梦的图生图功能
→ 上传基准图作为参考
→ 编写新的三段式提示词(第一段换场景,第二段换动作)
→ 第三段保持不变
Step 3:反复筛选
→ 每次生成4张,选与基准图最接近的1-2张
→ 如果3张都不满意,调整参考权重后重新生成
有时候生成出来的图,发型或某个服装细节会有轻微的漂移,可以用PS的液化工具做小幅度修正,或者直接用即梦AI 4.0模型做局部修改(4.0更擅长图像编辑任务)。
实操心得: 三种方法我通常是组合用的——先用方法一确定面孔,然后用方法二的固定描述词保持服装一致,对于特别重要的关键分镜再用方法三做精调。新手建议先从方法二练起,这能训练你对角色描述词的敏感度,对整个AI生图的理解会更深。
关于"抽卡"心态的补充
很多人刚入门的时候有一个错误心态:认为每张图都应该第一次就出满意的结果,不满意就觉得是自己的提示词写得不好。其实并不完全是。
即梦的生成有随机性,即使是完全一样的提示词,每次运行的结果也会有差异。对于同一个提示词,通常要生成至少4~8张,才能找到一张在角色外貌、动作、构图上都让你满意的图。这个过程就是俗称的"抽卡"——用量换质。
所以做分镜的时候,建议把"每个场景至少生成一批(4张)"作为最低标准,别急着看到第一张就停。做一个十个场景的短片,可能需要生成80~120张图,从里面挑出那10张最好