本文由 莫潇羽@源码七号站(www.fuyuan7.com) 撰写,转载请注明出处。
快速摘要
这篇文章把我自己折腾了大半年的一套 AI 短片工作流整个掀开给你看。核心结论只有一句:别再用「画一帧动一帧」的旧脑子做 AI 动画,真正高效的玩法是「一张源图 + 图像编辑模型 + 图生视频模型 + 轻量剪辑 + AI 配乐」五件套打配合,源图定调、Flux Kontext 衍生场景、Seedance 出动态、剪映拼接、Suno 谱主题曲,全程不画一笔,十分钟就能完成一个具备电影感的二三十秒短片。文中会把每一步的工具选型、Prompt 句式、镜头语言、跳切手法、时长法则、配乐技巧拆到能直接照着做的颗粒度,新手照单点菜,老炮也能从里头扒到几个有意思的小技法。 想看完整拆解,往下翻。
一、为什么AI短片让传统动画思路彻底过时
1.1 旧动画工作流的真实成本
聊新方法之前,得先把旧方法的难处摆出来。传统二维动画一帧一帧画,商业级的 24 帧每秒,做一秒就是 24 张图;就算用电脑做赛璐璐风,一个稍微有点动作的镜头,熟练画手起码也得两三天。三维动画听上去更"自动",可建模、绑骨、贴图、灯光、渲染、合成一路下来,小团队搞一个十秒动画,周期通常按周算。
我自己以前在源码七号站后台看到不少留言,问"想做个搞笑短片在朋友圈和短视频平台上发,有没有简单点的法子"。说实话,2023 年以前我也只能两手一摊——除非你专门学过软件,否则光是 After Effects 的图层、剪映里没有的关键帧、Blender 里那套复杂的着色器界面,任何一个都能把人劝退。
更难受的是连贯性问题。哪怕你硬着头皮把角色画出来了,要让他在不同场景里长得一样、衣服颜色一样、表情风格一样,这事在传统流程里基本只能靠记忆+参考图死磕,稍不留神就翻车。
1.2 AI模型组合带来的新底层逻辑
这一两年发生的变化,是几个底层模型一起把门槛踢下去了。图像生成那边,Black Forest Labs 在 2025 年 5 月放出的 FLUX.1 Kontext,核心能力是上下文感知的图像编辑:你给它一张参考图,它能理解里面的角色、风格、场景,然后按你写的文字指令,在保持人物一致性的前提下,生成新场景、改局部细节,甚至完全换环境。视频生成那边,字节的 Seedance 1.0 同期问世,1080P、10 秒以内、原生支持多镜头叙事,在一段视频里就能切两到三个不同景别的镜头。
把这两件事拼起来,游戏规则就变了:
[一张源图]
↓ Flux Kontext 衍生场景
[N 张保持一致性的静态分镜]
↓ Seedance 图生视频
[N 段 5~10 秒的动态分镜]
↓ 剪映/CapCut 拼接 + Suno AI 主题曲
[一支完整短片]
你看,这套流程里没有"逐帧画"这一步,也没有"建模渲染"这一步。AI 模型把最累的两件事——场景一致性和动作生成——一次性扛了。剩下我们要做的,是用脑子想出有意思的故事、用 Prompt 把脑子里的画面说明白、用剪辑把节奏抓住。
1.3 这套工作流到底解决了什么
我把它的实际收益总结成三条,不是空话,都是我自己踩过坑之后真切体会到的:
第一,把"画功"从必备技能里挪走了。 以前没学过画画就别谈做动画,现在你只要会描述画面就行,这跟写小说没两样。我自己当年画画是中学美术课水平,折腾这套流程依然能产出能看的东西。
第二,把"做一个动画"的周期从周压缩到小时。 我手头一个二十秒左右的短片,从想点子到导出 MP4,熟练之后两三个小时跑完。这意味着你可以用试错的方式做内容,这个点子不行马上换下一个,代价极低。
第三,把"原创角色"和"世界观"的门槛拆掉了。 想做一个戴礼帽、走路一摇一晃的小老头侦探系列,过去得先请人设计角色;现在你只要做好一张源图,后面所有镜头都能保持这个角色的样貌、服饰、神态一致。这等于让一个人就能撑起一整个内容 IP。
graph LR
A[创意点子] --> B[源图]
B --> C[场景库]
C --> D[动态分镜]
D --> E[剪辑成片]
E --> F[配乐成片]
这一节是给做心理建设的:你要相信,过去花一周搞不定的事,现在一下午能解决。心态没换过来,后面的工具学得再熟也用不出花来。下面正式开聊工具。
二、AI短片三件套:工具体系一次摸清
2.1 图像编辑:Flux Kontext 与 Morphic Studio
工具链的第一站是图像编辑。这一环的任务是从一张源图出发,衍生出短片需要的所有静态分镜——同一个角色,在不同场景、不同动作下的样子。
模型这边目前主流选 FLUX.1 Kontext,这是 Black Forest Labs 推出的图像编辑模型套件,2025 年 5 月底发布。它跟传统文生图模型最大的区别在于,它接受文字 + 参考图的组合输入,然后在保持参考图角色、风格、构图特征的前提下,执行你写的编辑指令。官方公布的能力包括局部编辑、跨场景角色一致性、风格迁移,推理速度比同类模型快 8 倍左右。
平台这边我个人用得比较顺手的是 Morphic Studio(地址 morphic.com)。它底层挂着 Flux Kontext,界面是无限画布式的,你把图拖进来,点一下就能下文字指令出图。免费试用送 50 个生成额度,后续按订阅或按量都有。
莫潇羽@源码七号站 实操提示:Morphic 的源图必须用拖放方式上传,直接点"上传"按钮经常识别不了。这是新人最容易卡的第一关。
操作上有几个一定要会的小快捷键:
|
操作 |
鼠标 |
触控板 |
|
缩放画布 |
按住 Ctrl + 滚轮 |
双指张合 |
|
拖动画布 |
按住中键拖动 |
双指拖动 |
|
切换抓手 |
H 键切到手型,再按住左键拖 |
同左 |
熟悉这几个之后,在画布上整理几十张衍生图就不会乱。
2.2 视频生成:Seedance 与 WaveSpeed
第二站是图生视频。
模型层面,我现在的首选是字节跳动 Seed 团队的 Seedance 1.0,2025 年 6 月发布。它的几个核心特性,放在 AI 动画这个场景里非常贴:
- 图生视频(I2V)和文生视频(T2V)统一架构,你既可以纯文字生成,也可以丢一张图给它动起来;
- 原生多镜头叙事,一段 10 秒视频里能自带 2 到 3 个分镜切换,且保持主体一致;
- 1080P / 720P / 480P 三档分辨率可选,价格差挺大,学习阶段用 480P 性价比最高;
- 生成时长 2 到 12 秒可调,5 秒和 10 秒是最常用的两档。
平台层面,Seedance 在多个聚合平台都能用,我个人长期挂在 WaveSpeed.ai 上。原因有两个:一是它把多家厂商的视频/图像模型都聚合了,可以按量充值,不强订阅;二是单次生成成本比官方平台便宜不少。注册之后充个十几二十块钱就能跑很多次,适合先练手。
操作起来非常朴素:在模型列表里搜 Seedance(具体模型名以平台当时显示为准,平台会定期更新版本号),进去之后上传图、写动作描述、选时长,跑就完了。一次 5 秒 480P 的生成大约几十秒出结果。
2.3 剪辑合成:剪映/CapCut 的轻量打法
第三站是剪辑。这一步我推荐用剪映(国内版,capcut.cn)或者 CapCut(国际版,功能基本一致)。两者都是字节出品,免费,新手 30 分钟就能上手。
我之所以不推荐 Premiere、Final Cut 这些专业软件,理由很简单:AI 短片的剪辑工作量小得可怜——AI 已经把绝大多数复杂操作做完了,我们要做的只是把生成出来的若干段视频按顺序拼起来、卡好时长、配上音乐。这件事剪映五分钟教完,Premiere 反而是杀鸡用牛刀。
剪映的核心区域就四块:
┌─────────────┬─────────────┐
│ 素材面板 │ 预览窗口 │
│ (左上) │ (中上) │
├─────────────┴─────────────┤
│ 时间轴 (下方) │
│ 多轨道 + 工具栏 │
└───────────────────────────┘
│ 右侧:
│ 剪辑面板
你要熟练的功能也就三个:剪切(把视频头尾不要的部分切掉)、变速(把 5 秒视频压成 2 秒)、多轨合层(把人物图层叠到背景图层上面)。这三个搞定,八成的短片剪辑都不在话下。
2.4 三件套衔接的整体逻辑
把三件套画在一张图上,数据流是这样的:
graph TD
A[1 张源图 PNG] --> B[Morphic Studio + Flux Kontext]
B --> C[10~20 张场景分镜 PNG]
C --> D[WaveSpeed + Seedance]
D --> E[10~20 段 5~10 秒动态分镜 MP4]
E --> F[剪映/CapCut 时间轴]
G[Suno AI 主题曲 MP3] --> F
F --> H[最终短片 MP4]
一个常见的误解是:很多人觉得"AI 动画"就是丢一张图让 AI 全自动出片。这是想多了。AI 是把每一段的最难处替你扛了,但串联、节奏、故事、情绪还是要靠人的判断。这跟摄影没了胶片不代表摄影变简单是一回事——技术门槛降了,审美门槛没降,有时候反而被衬得更明显。
我建议新手第一周先集中突击第二站(图生视频)。源图准备这种事情,你哪怕用现成素材都能起步;剪辑无非剪切变速;只有图生视频这一环的 Prompt 经验,是别人没办法替你练的——必须自己跑过几十次,才能知道什么样的描述会出问题、什么样的描述能一次过。
至此你已经把工具盘清楚了。下一章我们进入真正的方法论:源图思维。这是整套工作流里最像哲学、也是新人最容易跳过、跳过之后做出来的片子最不连贯的一节。
三、源图思维:从一张静态图衍生一整部短片
3.1 源图为什么是整个工作流的命门
"源图"这个概念非常朴素:它就是你这部短片所有镜头的"母体"——一张用来定义主角长相、画风、世界观、色彩基调的图。所有后续场景,都是 Flux Kontext 看着这张图、按你的文字指令二创出来的。
为什么必须有源图?核心原因只有一个:保证角色一致性。AI 模型不像传统动画师有"角色设定稿"这种东西,你每次让它画一个"戴礼帽的小老头",它都会画一个稍微不一样的版本。如果你直接用纯文字 Prompt 一张张去生成,做到第五张你的"主角"已经变成另外一个人了。
源图机制把这件事彻底解决了。Flux Kontext 是 in-context 编辑模型,它能从源图里提取视觉概念——人脸特征、衣服样式、画面色调、艺术风格——然后在新场景里复用。官方测试报告里讲到,即便经过多轮编辑,角色的核心面部特征依然能保持下来。在做短片这个场景下,这等于解决了"分镜不连戏"这个老大难。
3.2 一张好源图必须承担的"四件事"
我自己后来摸出来一个标准:只要这四件事都齐了,源图就合格。
第一,清晰定义角色。 主角的五官、表情、发型、服饰、配饰、身形,要在源图里集中表达完整。最忌讳的是一张主角小小在角落、背对镜头的图——AI 看不清你的角色长啥样,衍生出来的图就会到处漂。
第二,呈现完整画风。 是赛璐璐二维?是美式情景剧风?还是写实三维?是冷色调还是暖色调?是写实质感还是夸张漫画感?这些都靠源图给后面立规矩。
第三,带出基本世界观。 是现代都市?中世纪小镇?未来太空舱?海岛漂流?至少要让源图本身带一点环境线索,这样后续衍生的场景才不会跳戏。
第四,留好"可衍生空间"。 别把源图画得太满。角色头顶或脚下要留点环境信息,身后要留点背景线索,这样 Flux Kontext 在生成新场景时才有发挥的余地。
我自己的偏好是,源图里主角占画面 50% 左右,周围 30% 是环境信息,20% 是留白。这个比例在我做过的十