本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
这篇文章要解决的核心问题:为什么有些人用同样的 AI 工具,做出来的画面就是比别人强?
我自己折腾 AI 动画创作这条路走了不少弯路,踩过的坑归结起来,其实就是三类:画面构图太平、提示词乱写导致生成结果不可控、后期剪辑和音效做得太糙。这篇文章就是我把这些弯路整理成的一份系统性操作指南,涵盖从「项目文件夹建立」到「口型同步输出」的完整工作流。
核心结论先写在这里:构图不是工具的事,是脑子的事。你脑子里没有主次意识,AI 给你生成出来的也是一锅乱炖;动画生成的"单帧"和"首尾帧"是两种截然不同的工具逻辑,混用会让你的片子看起来脱节;音效一定要多轨叠加,只用一个碰撞声的打斗场面,听起来会像纸箱子互碰;超分这一步在发布前绝对不能省,1K 画质在高清屏上会非常糊。
莫潇羽@源码七号站,这些是我自己实操下来总结的核心经验,想看完整拆解,往下翻。
这篇文章适合谁读:已经开始用 AI 工具做视频、但总感觉生成出来的东西"不够好"的人;想系统了解 AI 动画制作工作流的人;以及对国风 IP 创作感兴趣、想把 AI 动画做出深度的人。不适合:完全没接触过 AI 工具,想找"一步就能出爆款"秘籍的读者——这篇文章讲的是有系统性的方法论,不是速成捷径。
前言:AI 改变了什么,又没有改变什么
这两年,AI 视频工具的迭代速度快到让人喘不过气。海螺 AI(Hailuo)在 2025 年推出的 Hailuo 02 模型,已经能原生输出 1080p、做到极限物理表现,帮助全球创作者生成了超过 3.7 亿个视频。即梦 AI 的视频 3.0 版本支持首尾帧;可灵在首尾帧连贯性上表现出色;而 PixVerse(也就是国内圈子里常说的"拍我 AI")在 V5.5 版本里甚至实现了分镜+音频一键同步生成……工具军备竞赛打得热火朝天。
但我想说一句扫兴的话:工具的上限再高,也只是你创作能力的放大器。它放大你会的,也放大你不会的。一个不懂构图的人拿着海螺 AI,生成出来的视频依然会平、乱、没有主次。
这不是悲观,而是一个很重要的心态校准:别把时间都花在"用哪个工具"这个问题上,多花时间在"我想说什么故事、我想传递什么情绪"上面。工具会变,但讲故事的能力是你自己的资产,它不会因为某个 AI 工具停服而消失。
所以,这篇文章不是工具测评,而是一套让你真正用好这些工具的思路和操作方法。这套方法论,基于我折腾了相当长时间 AI 动画后的实际积累,也借鉴了许多传统影视制作的基础理论——这两者结合起来,才是做好 AI 动画的正确姿势。
第一章:项目规范——一切从第一个文件夹开始
很多人开始做 AI 动画的方式是:随手新建个文件夹,把生成的图片和视频往里一扔,然后项目做着做着,素材就乱成了一锅粥。我以前也这样,直到有一次接了个多集项目,素材超过两千条,找起来能急死人。
文件夹结构是创作者的基础设施,特别是当你想把 AI 动画往商业方向走的时候,项目规范更是必须从第一天就建立好。
我现在用的项目目录结构大概是这样:
AI项目/
├── 001_项目名称/
│ ├── 01_角色设定/
│ │ ├── 主角_正面.png
│ │ └── 主角_侧面.png
│ ├── 02_分镜图/
│ │ ├── SC001_镜头1_特写.png
│ │ └── SC002_镜头2_全景.png
│ ├── 03_动画素材/
│ │ ├── SC001_take01.mp4
│ │ └── SC001_take02.mp4
│ ├── 04_音频/
│ │ ├── BGM/
│ │ ├── 音效/
│ │ └── 配音/
│ ├── 05_剪辑工程/
│ └── 06_输出成片/
│ ├── DEMO_001.mp4
│ └── FINAL_001.mp4
这里有几个细节值得注意:
- 项目用三位数字编号,比如 001、002、003,这样排序不会乱。分镜图也用
SC001、SC002编号,对应剧本里的场景编号,找起来一目了然。 - DEMO 和 FINAL 要严格区分。很多人交错用,最后自己都不知道哪个是最终版。我的习惯是:给对方看的粗剪叫 DEMO,定稿输出叫 FINAL,两者加上版本号,比如
FINAL_003.mp4表示第三次修改后的终版。 - 音频单独开文件夹,BGM、音效、配音分三个子目录,不要混放。剪辑时会频繁从这里提取素材,结构清晰能省很多时间。
规范是枯燥的,但它是你未来一旦接到商业项目时,能活下来的底层能力。
版本管理的实用技巧
除了文件夹结构,版本管理也是很多初学者没意识到的问题。AI 生成是一个不断试错、不断迭代的过程,你今天觉得满意的分镜图,三天后可能发现更好的替代版本。这时候如果原始素材被你覆盖掉了,找回来就很麻烦。
我的习惯是:永远不要直接覆盖文件,改版本时给文件加版本号后缀,比如 SC001_take01.mp4 生成了更满意的版本后,新文件命名为 SC001_take02.mp4,旧的先不删。等到整个项目收尾输出成片之后,再统一清理不用的素材。
另外,提示词也要记录下来。很多人生成了一张效果很好的分镜图之后,没有保存当时的提示词,下次想重新生成类似风格的时候,怎么都找不回那个感觉。我用的方法是:在每个场景的文件夹里放一个 prompts.txt,把用过的有效提示词按镜头编号存进去,以后修改或者扩充这个场景时可以直接参考。
第二章:构图语言——让你的 AI 画面从"平"到"有料"
为什么你的画面总是平的
我在交流群里看了大量 AI 动画作品,发现一个共同的问题:画面很空,看不出主体,什么都有,什么都不突出。
这不是工具的锅,是构图意识缺失的问题。
导致这个问题有一个很深层的原因:很多人在生成图片的时候,是用"让 AI 帮我想画面"的心态在工作,而不是"我知道我要什么,让 AI 帮我实现"的心态。一旦你自己脑子里没有画面感,AI 给出来的就是它的平均答案,而平均答案,永远是没有个性的。
构图的本质,是"有组织、有目的地安排观众的视线"。你想让观众看哪里,你就把那个区域弄得更亮、更突出、更有引导感。如果整个画面全都是亮的,全都是细节丰富的,观众的眼睛就不知道该往哪里停,这就是"平"的根源。
莫潇羽@源码七号站的理解是:构图是你和观众之间的无声对话,你在用画面告诉他们"看这里"。
要建立构图意识,最有效的方式不是背理论,而是带着问题去看优秀的影视作品。看一部好的武侠片或者动画片时,暂停在你觉得"这个镜头真好看"的地方,问自己:画面里最亮的区域在哪里?最暗的区域在哪里?我的眼睛最先被吸引到哪里?有没有线条把我的视线引向某个方向?
这样带着问题去看,看几十部片子之后,你对"好构图"的感知就会逐渐内化成直觉,写提示词的时候自然而然就会带进去。
闭合构图:用遮挡制造悬念
闭合构图是我个人非常喜欢用的一种技巧,核心逻辑是用画面元素遮挡主体的一部分,让观众的大脑自动补全。
举个例子:一条古道,被两侧的树枝部分遮挡,只能看到路的前段。你的眼睛会自然地沿着路延伸出去,想象那条路通向哪里。这比你把整条路完整地拍出来,要神秘得多、有吸引力得多。
从 AI 创作的角度来说,在提示词里加入"前景遮挡""虚化前景树枝"之类的描述,能有效帮助你生成带有闭合构图感的分镜图。不要一开始就把主角全脸展示出来,适当的遮挡、剪影、侧影,都能让观众产生想继续看的欲望。
光影与色彩对比:告诉观众"该往哪儿看"
视觉的本质是光。人的眼睛天然会被亮度集中的区域吸引,这是人类进化出来的本能反应。
所以,你想突出主体,最简单的办法就是让它比周围亮。背景压暗,主角身上留高光。如果主角身处暗部,那就给他一个轮廓光——从背后打出来的边缘高光,能让他从背景里"浮出来",同时产生一种戏剧性的轮廓感。
互补色的对比也是很常用的手法。蓝色与橙色互为补色,两者放在同一个画面里,视觉张力非常强,国风电影里用得特别多,比如烛火的暖黄与夜色的冷蓝叠在一起,主体就很容易从背景中凸显出来。
在写提示词的时候,建议你主动写明光影方向,比如"逆光轮廓光""侧面暗光""烛火映照脸部",这些描述能帮助 AI 生成更有层次感的画面。
画面平衡:视觉重量的微妙游戏
这一块很多人会忽略,但它直接影响一张图看起来是否舒服。画面里的每个元素都有视觉重量,颜色深的、体积大的、细节复杂的,视觉重量就高。
设计角色时,如果人物的头发主要在左侧堆积,左边就会显得"沉",整个画面就失衡。这时候可以在右侧增加一些元素来平衡,比如武器、飘带、披风,或者让画面右侧有更多明亮区域,用亮度来平衡暗色部分的重量。
一个实用的设计思路是:用不对称来制造张力,用细节来实现平衡。比如角色一边戴耳环、一边握剑,乍看不对称,细看却在视觉重量上相互平衡,这比两边完全一样要有趣得多。
画面平衡还能传递角色状态。人物精神饱满、状态稳定时,构图是平衡的;一旦角色内心产生动荡、陷入混乱,可以刻意打破平衡,用倾斜构图来传递这种情绪。这是构图语言和镜头语言的综合运用。
引导线:横、竖、斜、曲,各有各的戏
引导线是最好用的构图工具之一,用来把观众的视线从画面的一端引导到主体所在的位置。不同方向的线条,传递的情绪是不一样的:
|
线条类型 |
情绪感受 |
适用场景 |
|
水平线 |
稳定、平静 |
旁白叙事、纪录片风格、安静场景 |
|
竖线 |
力量感、高度感 |
城墙、山峰、武将站立 |
|
对角线 |
动感、张力、运动感 |
追逐、打斗、冲刺镜头 |
|
曲线 |
柔和、迷幻、流动感 |
仙境、水面、飘带运动 |
在生成打斗类分镜图时,有意识地在提示词里加入"对角线构图""倾斜画面""强烈透视"等描述,生成出来的画面运动感会强很多。
中心构图:东方美学里的"天子之中"
中心构图在影视作品里被大量使用,西方经典的例子是达芬奇的《最后的晚餐》——耶稣居中,两侧门徒的眼神和手势全都指向中间,构建出一种极强的视觉秩序感。
但中国的中心构图有自己的文化内涵。帝王居中、统御四方,这本身就是东方权力结构的视觉呈现。画面的主次分明、井然有序,折射的是集权文化里对秩序的推崇。所以当你在做国风题材时,中心构图不只是一种技法,它本身就在传递意涵。
更进阶的用法是多种构图叠加:中心构图 + 框架式构图(画面内有门框、屏风、古代建筑廊柱形成的自然框架)+ 纵深透视感(人物站在廊道深处,廊道向远处延伸),三层叠加之后,画面的层次感和故事感会非常丰富。
在写 AI 提示词时,可以这样描述:"中心构图,古代宫殿廊道,人物站于画面中央,廊柱形成两侧框架,纵深透视,远处光源,电影质感"。
脊柱线:打斗场景的灵魂辅助线
这是我觉得最容易被忽视、但对打斗场景帮助最大的一个概念。
脊柱线,简单说就是角色的动态辅助线。人体本身有一条从头到脚的中轴,但如果在角色身上增加了披风、飘带、长辫子、动物尾巴,这条中轴就被"延伸"了——角色运动的时候,这些附属物会随着运动方向甩动,形成一条生动的动态曲线,让整个动作看起来更加流畅、有力。
李小龙在电影里常常脱掉上衣,原因之一就是为了展示脊柱线的曲线美——那条身体运动时产生的动态弧线,视觉冲击力极强。张艺谋在《英雄》里用大量帷幔来组织打斗场景的线条感,帷幔在两个人穿梭其中时不停交错变形,产生出一种无数动态线条同时运动的视觉张力,整体氛围不降反升。
落到实操上:在设计 AI 动画的打斗角色时,要主动为角色增加能产生脊柱线延伸效果的元素:
- 披风或斗篷
- 长辫子或飘逸的头发
- 动物尾巴(如猫尾、狐狸尾)
- 长袖汉服
- 带有飘带的武器(比如鞭子、带流苏的长剑)
有了这些元素之后,AI 在生成动作分镜时,就能自然地捕捉到这些元素的运动轨迹,生成出来的打斗画面会比没有这些元素的版本灵动许多。
第三章:角色与武器设计——差异化才是记忆点
看过大量 AI 动画作品之后,我发现一个让人发愁的现象:打开一百个国风打斗视频,九十个角色拿的都是刀或者剑。这不只是因为刀剑提示词好写,更是因为大家在设计角色的时候,根本没有深入思考过"这个角色应该是什么样的人",只是把人塞进去然后给他一把武器。这当然不是说刀剑不好,但太同质化了,一点辨识度都没有。
中国古代的兵器体系极其丰富,戟、钺、斧、钩、鞭、双节棍、飞镖、流星锤、九节鞭……每一种武器都有自己独特的运动轨迹和视觉语言。九节鞭打起来是弧线运动,视觉张力很强;双板斧给笨重的角色用会有一种力拔千钧的厚重感;奇门武器本身就能产生强烈的记忆点,让观众一眼就能记住这个角色。
武器的选择要和角色的体型、性格相匹配。一个体型笨重、力量型的角色,适合用双板斧或者重锤;一个灵巧型的刺客角色,用暗器、飞刀或者短剑会更合适;一个修仙系的角色,可以考虑拂尘、法器或者法印之类的东西,视觉上的神秘感会比持刀更强。
还有一个容易忽略的细节:武器和角色的服装颜色要有配合意识。比如一个以"寒冰"为设定主题的角色,武器上带点冷色调的光效,服装选蓝银配色,整体视觉语言就统一了;如果武器是暖金色,服装是冷蓝色,这种冷暖对比本身也可以成为设定的一部分,但要有意识地去做,而不是随机拼凑。
提示词里描述角色时,建议把武器的材质、光效特征一起写进去,比如:
"手持哑光黑铁三板斧的壮汉武将,腰间一条银色链条将双斧悬挂,
斧刃边缘残留暗红色战损纹路,整体色调深沉厚重"
这样的描述比"拿着斧子的武将"要具体得多,AI 生成出来的细节丰富度也会高很多。
莫潇羽@源码七号站的角色设计理念是:每一个设计决策都要有理由。角色为什么拿这把武器?这把武器和他的脊柱线延伸元素(披风/尾巴)之间如何配合,让他的动作语言更完整?想清楚这些,你生成出来的角色才不会是随机拼凑的。
第四章:分镜图生成——把脑子里的画面落到屏幕上
工具选型:海螺 AI 与即梦 AI 的差异
目前我用得最多的分镜图生成工具是海螺 AI(Hailuo,官网:hailuoai.com)和即梦 AI(jimeng.jianying.com)。两者各有侧重:
|
对比维度 |
海螺 AI |
即梦 AI |
|
画面风格 |
电影质感强,光影处理细腻 |
风格多样,二次元/国风支持好 |
|
生成速度 |
中等 |
较快 |
|
动漫角色支持 |
Hailuo 2.3 对 |