莫潇羽@源码七号站(www.fuyuan7.com)原创内容,转载请注明出处。
快速摘要
如果你只有两分钟,请先看这里。 AI视频制作的核心流程可以概括为六个字:写、画、生、配、剪、调——用AI写脚本,用AI绘画生成关键帧图片,用AI工具将图片或文字生成视频片段,再进行配音配乐,最后通过剪辑软件拼合成片,必要时还可以叠加风格转绘和特效。整个链条里,提示词(Prompt)是贯穿始终的核心技能,无论是文生视频还是图生视频,精准的结构化提示词直接决定了最终画面的质量上限。角色一致性则是制作长片、短剧和动画时最大的技术难点,目前主流的解决方案是通过Midjourney的 --cref 和 --sref 参数,结合详细的人物细节描述来控制。往下看,有从脚本到成片每一步的详细操作拆解。
一、为什么现在是学习AI视频制作的好时机
2024年被称为AI视频的"大爆发元年"。从年初OpenAI发布Sora引发全网关注,到可灵、即梦、Runway、Pika等工具你追我赶地迭代升级,AI视频生成的画质和可控性在短短一年内实现了质的飞跃。但坦率地说,2024年的AI视频更多停留在"炫技"阶段——大家在社交媒体上分享各种令人惊叹的AI短片,真正的商业化落地案例却屈指可数。
进入2025年之后,情况正在快速改变。一方面,模型能力持续升级,可灵、Runway Gen-3、Pika 2.0等工具已经能够生成具备电影质感的镜头片段;另一方面,围绕AI视频的工作流日趋成熟——从脚本写作到关键帧绘制,从视频生成到配音配乐,再到最终剪辑成片,每一个环节都有了相对稳定的操作方法和工具链。
这意味着,以往需要一个几十人团队才能完成的影片制作,现在一个人配合AI工具就能独立搞定。 这不是夸张的说法,而是很多创作者已经在实践中验证过的事实。莫潇羽在源码七号站分享这篇文章,就是希望帮你从零开始,系统地掌握这套完整的AI视频制作流程。
在正式开始之前,莫潇羽先帮你梳理一下目前市面上主流的AI视频生成工具及其各自的特点,方便你在后续的实操中根据需要进行选择:
|
工具名称 |
擅长领域 |
适用场景 |
|
可灵(Kling) |
中国元素、电影质感、对口型 |
写实短片、广告、中国风内容 |
|
Runway Gen-3 |
运镜控制、写实风景、风格转绘 |
风格转换、写实场景、创意短片 |
|
Pika |
动漫风格、特效模板(爆炸/熔化等) |
特效制作、动漫内容、趣味短视频 |
|
即梦(Jimeng) |
一站式操作、首尾帧视频 |
快速内容生成、短视频创作 |
|
海螺AI(Hailuo) |
写实电影画面、稳定性高 |
电影质感影片、品牌宣传 |
|
Luma AI |
3D场景建模、首尾帧串联 |
VR内容、游戏概念、创意动画 |
|
Sora |
综合性能强、物理模拟 |
概念验证、创意探索 |
|
Midjourney |
AI绘画、角色一致性控制 |
关键帧生成、角色设计、海报 |
这些工具各有千秋,实际制作中经常需要组合使用——比如用Midjourney生成关键帧图片,用可灵生成视频片段,用Runway做风格转绘,最后用剪映完成剪辑。不需要一开始就把所有工具都学会,先从你最需要的工具入手,边做边学是最高效的方式。
接下来,我们按照实际制作的先后顺序,把整个流程从头到尾拆解一遍。
二、第一步:用AI撰写视频脚本
不管你想做的是AI电影、AI广告、AI动画还是MV,所有优秀的视频作品都有一个共同的起点——剧本或脚本。脚本是整个制作的蓝图,它规定了每个镜头拍什么、怎么拍、时长多少、画面是什么样的。
对普通人来说,从零写一个脚本既耗时又有门槛。好消息是,大语言模型(如ChatGPT、Claude、文心一言、通义千问等)在文本创作方面已经非常成熟,我们完全可以让AI代劳。
提示词的万能框架:"是什么—做什么—怎么做"
和AI沟通的关键在于提示词的编写。这里有一个简单但通用的框架,几乎适用于所有类型的脚本生成任务:
"是什么"——给AI设定身份。 大语言模型拥有海量的知识储备,但这些知识并没有按照某个特定的专业领域进行分类。如果你直接问它一个问题,它可能从多个角度给出一个比较泛化的回答。但如果你先告诉它"你是一位拥有30年电影拍摄经验的世界顶级导演",它就会从导演的专业视角来思考和输出内容。
一个很经典的例子:同样是问"为什么人们喜欢苹果",如果AI的身份是手机销售员,它会谈iPhone的用户体验和生态系统;如果身份是水果商贩,它会谈口感、营养和产地。身份不同,答案截然不同。
"做什么"——告诉AI你的需求。 比如"为我创作一部一分钟左右的科幻微电影脚本"。
"怎么做"——给AI定标准。 比如"一共设计20个分镜头,每个镜头3到4秒,每个镜头需要包含镜头序号、画面描述、运镜方式、对白、音效提示"。
把这三部分组合起来,就是一段完整的脚本生成提示词。下面给出一个可以直接套用的模板:
假设你是一位拥有30年电影拍摄经验的世界顶级导演,
擅长科幻题材和悬疑叙事,精通镜头语言和视觉叙事。
我需要你为我创作一部时长约1分钟的科幻微电影脚本。
要求如下:
- 设计20个分镜头,平均每个镜头3~4秒
- 每个镜头需要包含:镜头序号、画面描述(用于AI绘画的提示词)、
运镜方式、对白/旁白、音效提示
- 整体色调为冷色调赛博朋克风格
- 包含完整的美术设计(风格设计、场景设计、主体设计)
关于脚本时长的控制技巧
有一个需要特别注意的细节:AI对时间概念非常模糊。你告诉它"生成一分钟的脚本",它输出的内容实际播放时间往往只有30到40秒。目前控制时长最靠谱的方法不是直接指定"一分钟",而是通过镜头数量来间接控制。比如,平均一个镜头3到4秒,你需要一分钟的视频,那就让它生成20个分镜头。这样出来的总时长大致就在一分多钟。
另外,不同的大语言模型用同一段提示词生成的脚本质量会有差异。有的模型可能会遗漏"画面提示"这一栏,有的可能对白写得比较生硬。遇到这种情况不需要全部重写,直接追问"请补充每个镜头的画面提示词"或者"请优化第5个镜头的对白"就可以了。
脚本生成的常见问题与解决方法
在实际操作中,你可能会遇到以下几种情况:
问题一:AI生成的脚本太短。 这是最常见的问题。你明明要求了一分钟的脚本,结果只有七八个镜头。解决方法是不要用时长来约束,而是明确指定"不少于18个分镜头"这样的数量要求。
问题二:画面描述不够具体。 AI给出的画面描述可能是"一个城市"这种笼统的说法,无法直接用来生成高质量的图片。你可以追加指令:"请把每个镜头的画面描述扩展为50字以上的详细描述,包含具体的场景元素、光线、色调和拍摄角度。"
问题三:剧情逻辑不通顺。 如果你发现某些镜头之间的转场不自然或者剧情有跳跃,不需要全部重写。可以针对性地提示:"镜头8和镜头9之间的转场不够自然,请增加一个过渡镜头。"
问题四:生成中断。 由于模型输出长度的限制,较长的脚本可能生成到一半就停了。这时候只需要发送"继续"或者"请接着上面的内容继续输出"即可。
不同类型视频的脚本差异
虽然提示词的底层框架是通用的,但不同类型的视频在脚本结构上还是有一些差异的。广告脚本通常更注重产品的展示角度和卖点传达,每个镜头都围绕产品设计;动画脚本需要特别关注角色的表情变化和动作描写,因为动画的表现力很大程度上依赖于夸张的动作和表情;MV脚本则是以歌词为驱动的,画面需要和歌词的情感节拍相匹配。关于这些具体差异,我们会在后面的"进阶应用"章节中详细展开。
脚本中的美术设计部分
一个高质量的脚本不仅仅是镜头列表。好的脚本还应该包含一个"美术设计"板块,涵盖三个方面:
风格设计:确定整部影片的视觉基调,比如"冷色调赛博朋克风格"或"暖色调吉卜力动画风格"。这个设定将贯穿所有镜头,是保持视觉统一性的第一道防线。
场景设计:对影片中重复出现两次以上的场景进行详细描述。比如"未来城市——高耸入云的全息广告牌,雨水冲刷的霓虹街道,空中穿梭的飞行器"。这样在后续生成画面时,只要把这段描述附在提示词后面,就能让不同镜头中的同一场景保持视觉一致。
主体设计:对影片中的主要角色进行详细的外貌特征描述。比如"叛乱者——30岁左右男性,亚洲人种,短发,棱角分明的方脸,穿着深色皮质外套,左臂为半机械化义肢"。描述得越详细,后续AI绘画和视频生成时角色的一致性就越好。
三、第二步:AI绘画——锁定画面的关键帧
你可能会好奇:既然是做视频,为什么要先学AI绘画?
原因很现实——目前的AI视频技术还无法完全实现精确可控的画面生成,尤其是在角色一致性方面。直接用文字描述生成视频,前后镜头中的同一个角色往往长得判若两人。所以我们需要先用AI绘画生成关键帧图片,再用这些图片去引导视频的生成。 这就是"图生视频"比"文生视频"更常用于正式项目的原因。
AI绘画提示词的六要素
一段完整的AI绘画提示词通常包含以下六个方面:
- 主体:画面中的主角或核心对象(如"一个身穿红色长裙的女