本文由源码七号站原创整理,系统性讲解AI视频制作的核心技术与实操方法。从分镜设计到人物一致性,从文生图到图生视频,手把手带你掌握全流程。
写在前面
过去,制作一部高质量的短片需要庞大的团队——编剧、导演、摄影、美术、后期……每个环节都意味着高昂的成本和漫长的周期。而现在,借助AI工具,一个人就能完成从故事构思到成片输出的全部工作。
这不是噱头,而是已经被验证的事实。那些在B站、抖音爆火的AI动画短片、科幻小说影视化作品,背后往往只有一两个人在操作。他们依靠的不是什么黑科技,而是对AI工具的熟练运用,以及扎实的创作思维。
本文将系统性地拆解AI视频创作的完整流程,涵盖:
- 如何用AI辅助故事创作与分镜设计
- 文生图工具的使用技巧与提示词优化
- 图生视频的工具对比与实操方法
- 首尾帧、人物一致性等进阶功能
- 对口型、配音与后期剪辑
无论你是完全零基础的小白,还是有一定经验想要系统提升的创作者,都能从中获得实用的知识和可落地的方法。
第一章:AI视频创作的基本认知
1.1 什么是AI视频创作
AI视频创作,简单来说就是利用人工智能工具,将文字描述转化为图片(文生图),再将静态图片转化为动态视频(图生视频),最后通过剪辑软件整合成完整的影片。
整个流程可以概括为:
故事/剧本 → 分镜设计 → 提示词编写 → 文生图 → 图生视频 → 剪辑合成 → 成片
与传统视频制作相比,AI视频创作有几个显著特点:
成本极低:不需要摄影设备、演员、场地,只需要一台能上网的电脑。
效率极高:传统动画一分钟可能需要数周甚至数月,AI可以在几小时内完成。
门槛降低:不需要会画画、会建模,只要能清晰地描述想要的画面即可。
随机性强:AI生成的内容具有一定的不确定性,需要学会与这种随机性共处。
1.2 需要掌握的两个核心能力
要做好AI视频,你需要具备两个核心能力:
第一,分镜设计能力。 分镜就是把脑海中的画面记录下来的过程,可以是精致的手绘稿,也可以是简单的文字描述。它决定了你的视频是否有逻辑、能否把故事讲明白。这需要对镜头语言、构图、叙事节奏有一定的理解。
第二,与AI沟通的能力。 在整个创作过程中,你始终在用文字与AI对话。无论是让AI帮你构思故事、拆分分镜,还是生成图片、生成视频,都需要你准确地表达需求。提示词(Prompt)写得好不好,直接决定了输出质量。
这两个能力是相辅相成的。分镜设计能力帮你想清楚"要什么",与AI沟通的能力帮你"拿到想要的"。
1.3 主流工具概览
目前AI视频创作涉及的工具可以分为几大类:
AI对话/辅助创作工具:豆包、腾讯元宝、DeepSeek等,用于故事构思、分镜拆解、提示词生成。
文生图工具:即梦(Jimeng)、Midjourney、豆包等,用于根据文字描述生成静态图片。
图生视频工具:可灵(Kling)、通义万象、即梦、海螺、微度、轻颖等,用于将静态图片转化为动态视频。
配音/音乐工具:海绵音乐(AI作曲)、剪映(AI配音)、Minimax、智影云配等。
剪辑工具:剪映、Premiere Pro等,用于视频的后期剪辑和合成。
后文会针对每个环节的核心工具进行详细讲解。
第二章:故事创作与分镜设计
2.1 用AI辅助故事创作
每个视频都始于一个故事或创意。如果你已经有了完整的故事,可以直接进入分镜阶段。如果还没有头绪,可以借助AI来辅助创作。
打开豆包、腾讯元宝或DeepSeek,先明确你的需求。与AI沟通就像给下属布置任务,越清晰越好。
错误示范:
帮我写一个爆款故事
这种模糊的需求,AI只能随机发挥,结果必然不可控。
正确示范:
我要拍一部5分钟的太空题材悬疑惊悚短片,帮我提供5个故事灵感。
要求:
1. 每个灵感200字左右
2. 脑洞够大,情节够高能
3. 类似《异形》的风格
给出明确的时长、题材、风格、字数要求后,AI的输出就会在你设定的框架内,便于筛选和二次加工。
如果对某个灵感感兴趣,可以继续对话:
帮我把第一个灵感拓展成3000字的完整故事。
主角是中国男性,情节要高能,结局要有大反转。
关键技巧:使用深度思考模式。在豆包、腾讯元宝等工具中,开启"深度思考"后,AI会更认真地分析你的需求,输出质量明显提升。
当然,AI不可能一次就给出完美答案。你可以把多个灵感中的优秀部分整合起来,形成自己的故事。对故事的理解和审美决定了最终作品的上限。
2.2 选择现成的故事素材
如果不想从零开始创作,也可以选择现成的故事进行改编。比如:
- 科幻小说(刘慈欣的作品非常适合影视化)
- 古诗词(木兰辞、将进酒等叙事性强的作品)
- 历史故事、神话传说
- 影视作品的二次创作
以木兰辞为例,这首流传千年的乐府诗本身就是一个完整的故事,有人物、有情节、有情感冲突,非常适合作为AI视频的素材。
2.3 分镜设计的基本方法
有了故事之后,下一步是将故事拆解成一个个镜头。这个过程叫做分镜设计。
什么是分镜?
分镜就是把连续的故事拆分成若干个画面,每个画面对应一个镜头。专业的分镜脚本会标注每个镜头的景别、角度、时长、动作、对白等信息。
对于AI视频创作来说,分镜可以简化为文字描述。比如:
镜头1:城市全景,鸟瞰视角,展示繁华的街道和密集的房屋
镜头2:集市中景,人来人往,热闹喧嚣
镜头3:某户人家的庭院,有银杏树,布料晾晒在院子里
镜头4:房间内部特写,梳妆台上有家书一封
用AI辅助拆分分镜
你可以把故事原文发给AI,让它帮你拆分:
把木兰辞的第一段拆分成分镜,每个镜头对应一句台词。
要求:
1. 标注每个镜头的景别
2. 标注镜头的运动方式
3. 描述画面的主要内容
AI会给出一个初步的分镜方案,包括画面描述、景别、运镜等信息。虽然可能不完美,但作为起点已经足够。
2.4 景别与角度的基础知识
为了更好地设计分镜,你需要了解景别和角度的基本概念。
景别(由远到近):
|
景别 |
英文 |
特点 |
|
远景 |
Extreme Long Shot |
展示大环境,人物很小 |
|
全景 |
Long Shot |
展示完整场景,人物全身可见 |
|
中景 |
Medium Shot |
人物膝盖以上,展示动作 |
|
近景 |
Medium Close-up |
人物胸部以上,展示表情 |
|
特写 |
Close-up |
面部或局部,强调细节 |
|
大特写 |
Extreme Close-up |
眼睛、嘴唇等,极度强调 |
角度:
|
角度 |
特点 |
|
平视 |
镜头与被摄物体平行,最常用的角度 |
|
俯视 |
从上往下拍,让被摄物体显得渺小 |
|
仰视 |
从下往上拍,让被摄物体显得高大 |
|
鸟瞰 |
高空俯拍,展示大场景 |
|
顶视 |
正上方往下拍,特殊视角 |
实用建议:
- 每场戏的开头最好给一个全景,交代环境信息,让观众知道"这是哪里"。
- 避免连续使用相同景别的镜头,这会让画面单调。
- 避免连续切换内容相似、景别相近的镜头,这容易暴露一致性问题。
2.5 分镜设计的进阶思维
好的分镜不只是把故事拆开,而是要考虑如何用画面讲故事。
以木兰辞为例:
原文是"问女何所思,问女何所忆",字面意思是有人问木兰在想什么。如果直接按字面意思拍,就是一个人问、木兰回答,画面会很单调。
更好的处理方式是:引入木兰的母亲这个角色,用一组镜头展示母女之间的互动:
- 母亲走进房间,坐下(铺垫母亲出场)
- 木兰起身回避,表情难过
- 母亲的表情特写,关切地看着女儿
- 木兰走到窗边,看着窗外
- 切木兰的主观视角——窗外的景色
这样处理后,一句简单的歌词就变成了一组有情绪、有层次的镜头。
关键原则:
- 尽量避免同景别、同内容的连续镜头。如果两个镜头都是木兰的特写,中间最好插入其他内容隔开。
- 用镜头引导观众注意力。全景让观众看环境,特写让观众关注细节。
- 考虑镜头之间的衔接。前一个镜头的结尾和后一个镜头的开头要有逻辑关联。
第三章:提示词技巧与文生图实战
3.1 提示词的基本结构
提示词(Prompt)是与AI沟通的语言。写好提示词,是获得满意图片的关键。
一个完整的提示词通常包含以下元素:
风格 + 时间/场景 + 主体/人物 + 动作/状态 + 构图/景别 + 细节/光影
你也可以用更直观的方式记忆:
时间 + 地点 + 人物 + 事件 + 细节 + 风格 + 构图
示例:
皮克斯3D动画风格,秋天,北魏时期的城市全景,鸟瞰视角,
密集的房屋沿着街道分布,其中有几棵银杏树,
远处有山,天空飘着云,暖色调的光线
3.2 提示词的影响程度
不同元素对画面的影响程度是不同的。
影响最大的元素:
- 风格(皮克斯、写实、水墨画等)
- 景别/构图(全景、特写、鸟瞰等)
- 主体(人物、建筑、物品等)
影响较大的元素:
- 光影/色调(暖色调、冷色调、黄昏光线等)
- 时间/季节(秋天、夜晚、雨天等)
影响较小的元素:
- 细节描述(某个装饰、纹理等)
实验验证:
用同一张图,逐步增加提示词,观察变化:
- 只写"城市的全景" → 风格随机,什么都有
- 加上"皮克斯风格3D渲染" → 风格确定,画面统一
- 加上"秋天" → 色调变暖,出现落叶元素
- 加上"鸟瞰视角,远处有山" → 视野更开阔,构图改变