VIDU AI 视频创作实战全攻略:从零基础到独立产出专业级动画短视频
源码七号站 · 深度技术解析
本文将系统性拆解当下火爆的 AI 动画短视频创作流程,涵盖 VIDU、海螺、豆包等主流工具的核心玩法,帮助零基础创作者快速上手 AI 视频制作。
一、AI 视频创作浪潮:为什么要学 VIDU?
近年来,以"噜噜动画"为代表的 AI 生成短视频在各大平台迅速走红。这类视频的特点是:制作成本低、产出效率高、画面风格独特。背后的核心技术正是以 VIDU(即 Video 的音译)为代表的 AI 视频生成工具。
什么是 VIDU?
VIDU 是一款国产 AI 视频生成平台,支持文生视频、图生视频、主体一致性控制等功能。相比早期的 AI 视频工具,VIDU 在角色一致性、动作连贯性、画面质量等方面都有显著提升,特别适合制作动漫风格的短视频内容。
为什么选择 VIDU?
- 主体库功能:可以上传角色的正视图、侧视图、背视图,让 AI 在生成视频时保持角色外观的一致性
- 错峰模式:旗舰版会员支持错峰免费生成,大大降低使用成本
- 多模型支持:Q1 模型适合静态或小动作场景,Q2 模型适合大动态、特效场景
- 中文友好:作为国产工具,对中文提示词的理解更加准确
二、创作工具链全解析
在开始实战之前,我们需要了解完整的工具链。一个完整的 AI 视频创作流程通常需要多个工具配合使用。
2.1 核心工具介绍
(1)VIDU(Video)—— 视频生成主力
VIDU 是整个创作流程的核心工具,负责将静态图片或文字描述转化为动态视频。
主要功能模块:
- 参考生视频:上传角色主体库 + 场景图,生成保持角色一致性的视频
- 图生视频:直接用图片生成视频,适合首尾帧连接
- Q1/Q2 模型:Q1 画质高但动作幅度小,Q2 动作幅度大适合打斗特效
使用建议:
建议开通旗舰版会员(月付模式),原因是错峰模式可以无限生成。如果使用积分模式,AI 创作的"抽卡"属性会让积分消耗非常快——同一个镜头可能需要生成几十甚至上百次才能选出满意的效果。
(2)海螺 AI —— 图生视频利器
海螺 AI 是另一款优秀的图生视频工具,特别擅长动态效果和特效生成。
核心优势:
- 动态表现力强,运镜效果出色
- 支持首尾帧功能,便于镜头衔接
- 特效生成能力突出
使用技巧:
海螺的官方会员较贵,可以通过其他渠道获取性价比更高的账号。通常 500 积分的账号可以满足基本的创作需求。
注意事项:
海螺对某些内容有限制(如御剑飞行等仙侠元素),遇到限制时需要调整提示词或更换工具。
(3)豆包 AI —— 智能助手
豆包是字节跳动旗下的 AI 对话工具,在视频创作中主要用于:
- 提示词优化:将简单的想法扩展为详细的专业提示词
- 图片生成:基于文字描述生成角色或场景图片
- 创意辅助:帮助完善剧情构思和分镜设计
提示词优化示例:
假设你想表达"角色从天空飞下来",可以让豆包帮你优化:
原始想法:角色从天空飞下来
优化后的提示词:以图一为场景固定视角,拍摄侧面视角,
角色脚踩飞剑向下方极速飞行,画面带有速度线条,
镜头跟随角色同步向下移动,产生强烈的速度感
(4)即梦(AI)—— 图片生成
即梦是另一款国产 AI 图片生成工具,与豆包同属字节系产品,使用 4.0 模型效果较好。
适用场景:
- 生成角色的三视图(正视、侧视、背视)
- 制作场景背景图
- 角色换装
(5)香蕉(Banana)—— 专业级图片生成
香蕉是一款基于 Stable Diffusion 技术的图片生成工具,特点是:
- 体型保持能力强,不会像其他工具那样"把角色变成河马"
- 三视图生成准确度高
- 需要科学上网才能使用
替代方案:
如果无法使用香蕉,可以在空洞(一个集成平台)中调用 Banana 模型,不过积分消耗较高。
(6)清流 / 醒图 —— 图片处理
清流是一款手机端图片处理应用,主要用于:
- 图片抠图(提取主体)
- 去除背景
- 高清放大
- 局部擦除
重要提醒:
在清流中生成噜噜风格的角色时,一定要选择带有"噜噜"关键词的模型,这是保证风格一致性的关键。
(7)Photoshop —— 精细化处理
PS 在创作流程中承担精细化处理的角色:
- 图层合成(将角色放入场景)
- 水印去除
- 比例调整(如调整为 16:9)
- 细节修复
2.2 工具协作流程
一个完整的创作流程通常是这样的:
构思剧情 → 准备素材图片 → 生成角色三视图 →
创建 VIDU 主体库 → 编写提示词 → 生成视频 →
抽卡筛选 → 首尾帧衔接 → 剪辑合成 →
配音配乐 → 导出成品
三、基础准备:从零开始搭建创作环境
3.1 账号准备
VIDU 账号配置:
建议开通旗舰版会员,利用错峰模式实现无限生成。错峰模式的原理是在非高峰时段(通常是深夜到清晨)使用服务器空闲资源,不消耗积分。
多账号策略:
为了提高创作效率,可以准备多个工具账号:
- 1 个 VIDU 旗舰版账号(主力)
- 2-3 个海螺账号(辅助)
- 多个浏览器(Chrome、Edge、夸克等)同时登录不同账号
这样在等待一个视频生成时,可以同时用其他账号生成其他镜头,大大提高效率。
3.2 素材准备
场景素材来源:
- 游戏截图:直接从游戏中截取场景,省去描述和生成的麻烦
- 小红书搜索:搜索"仙侠场景""古风背景"等关键词
- AI 生成:使用豆包、即梦等工具生成
- 素材网站:各类免费/付费素材站
角色素材要求:
- 清晰度要高
- 最好有白色或简单背景
- 姿势尽量标准(便于生成三视图)
3.3 了解关键概念
三视图是什么?
三视图是指角色的三个标准视角图片:
- 正视图:角色正面面向镜头
- 侧视图:角色侧面朝向镜头(左侧或右侧)
- 背视图:角色背面朝向镜头
上传完整的三视图到 VIDU 主体库后,AI 在生成视频时就能从各个角度保持角色外观的一致性。
抽卡是什么意思?
"抽卡"是 AI 创作圈的术语,指的是用相同的提示词多次生成内容,从中挑选最满意的结果。
由于 AI 生成具有随机性,同样的提示词每次生成的结果都不同。一个 5 秒的镜头可能需要生成几十次才能得到满意的效果——这就是为什么建议使用错峰模式或无限生成套餐。
首尾帧技术
首尾帧是实现镜头无缝衔接的核心技术:
- 首帧:视频的第一帧画面
- 尾帧:视频的最后一帧画面
工作原理:将上一个视频的最后一帧作为下一个视频的第一帧进行生成,这样两段视频就能自然衔接。
四、角色主体库创建详解
主体库是 VIDU 保持角色一致性的核心功能。本章将详细讲解如何创建高质量的主体库。
4.1 获取角色基础图
方法一:使用现成素材
如果你要制作的是已有 IP 的角色(如噜噜、皮卡丘等),可以直接搜索该角色的高清图片作为基础。
方法二:AI 生成原创角色
使用豆包或即梦生成原创角色:
提示词示例:
一个可爱的黄色卡通角色,大眼睛,圆圆的身体,
没有头发,表情呆萌,白色背景,高清
方法三:为角色换装
如果需要给角色穿上特定服装:
- 打开豆包,上传角色图片
- 输入提示词,如"为图中卡通穿上中国古代仙侠服饰"
- 如果不会写服装描述,可以先让豆包生成提示词
换装提示词技巧:
让豆包帮你写:
"我想要中国古代仙侠服饰的提示词,帮我生成一段提示词"
如果要英文版(用于香蕉等工具):
"以 MJ 提示词格式生成"
4.2 生成三视图
使用清流生成三视图:
- 打开清流 App,选择"立即制作"
- 选择带有角色名称的专用模型(如"噜噜"模型)
- 输入描述,如"角色在沙滩上看太阳"
- 选择比例,点击生成
处理技巧:
有时生成的图片会出现不需要的元素(如额外的头发、配饰),可以使用清流的"擦除"功能去掉。
使用香蕉生成三视图:
香蕉的体型保持能力更强,步骤如下:
- 上传角色正视图
- 输入提示词,如"侧视图"或"背视图"
- 选择 Banana 模型
- 生成并下载
三视图注意事项:
- 确保三个视角的服装、颜色完全一致
- 背视图的头部形状要合理(有些工具会把头变形)
- 如果某个视角生成效果不好,多抽几次卡
4.3 上传主体库
VIDU 主体库上传步骤:
- 进入 VIDU,找到"主体库"或"参考生视频"功能
- 点击"添加主体"
- 依次上传正视图、侧视图、背视图
- 为主体命名(方便后续调用)
- 填写主体描述,如"黄色卡通角色"或"黄色生物"
关键提醒:
在主体描述中,如果出现"河马"等词汇,一定要删除!否则生成视频时角色可能会变形成河马的样子。
4.4 嘴巴处理技巧
如果角色需要在视频中说话,需要给角色添加嘴巴:
问题: 噜噜等角色本身没有嘴巴,如果不处理,AI 生成说话动作时可能会把嘴巴张得很大、很丑。
解决方案:
- 在清流中打开角色图片
- 使用"局部重绘"功能
- 在嘴巴位置涂抹选区
- 输入提示词"噜噜的嘴巴"或"小嘴巴"
- 选择合适的结果
这样处理后,生成视频时角色的嘴部动作会更加自然。
五、提示词编写技巧
提示词(Prompt)是与 AI 沟通的语言。好的提示词能大大提高出图/出视频的成功率。
5.1 提示词基本结构
一个完整的视频生成提示词通常包含以下要素:
[场景描述] + [主体动作] + [镜头运动] + [画面风格/特效]
示例分析:
以图一为场景,固定视角拍摄,
角色脚踩飞剑向下方极速飞行,
镜头跟随角色同步向下移动,
画面带有速度线条,电影级画质
拆解:
- 场景描述:以图一为场景
- 主体动作:角色脚踩飞剑向下方极速飞行
- 镜头运动:固定视角拍摄,镜头跟随角色同步向下移动
- 画面风格:画面带有速度线条,电影级画质
5.2 镜头术语速查
视角类型:
|
术语 |
含义 |
适用场景 |
|
俯拍 |
镜头从上往下拍 |
展示全局、威压感 |
|
仰拍 |
镜头从下往上拍 |
突出高大、气势 |
|
平视 |
镜头与主体平行 |
日常对话、叙事 |
|
特写 |
聚焦局部细节 |
表情、道具 |
|
全景 |
展示完整场景 |
环境介绍 |
|
近景 |
人物腰部以上 |
对话场景 |
镜头运动:
|
术语 |
含义 |
效果 |
|
固定镜头 |
镜头不动 |
稳定、正式 |
|
跟随镜头 |
镜头跟着主体移动 |
动感、追踪 |
|
环绕镜头 |
镜头绕主体旋转 |
展示全貌、炫酷 |
|
推镜头 |
镜头向前移动 |
聚焦、紧迫感 |
|
拉镜头 |
镜头向后移动 |
展示环境、远离 |
|
摇镜头 |
镜头左右/上下摇动 |
扫视场景 |
5.3 提示词优化技巧
技巧一:让 AI 帮你写提示词
如果不会写复杂的提示词,可以把想法告诉豆包,让它帮你扩展:
你的输入:
角色从门口走出来,表情严肃,说话的样子
豆包帮你优化后:
固定镜头中景拍摄,角色从图一场景的大门口缓缓走出,
表情严肃庄重,嘴部做出说话的动作,
动作自然流畅,画面质感电影级
技巧二:分步骤描述复杂动作
如果一个镜头包含多个动作,建议分开描述:
不好的写法:
角色飞过来然后环绕然后降落
好的写法:
初始镜头为侧面跟拍,角色脚踩飞剑极速向前飞行,
随后背景无缝切换至图二场景,
镜头顺时针环绕至角色身后,同步向上拉升并小幅度下摇,
最终以俯视角度拍摄飞行队伍
技巧三:避免矛盾描述
错误示例:
固定镜头拍摄,镜头跟随角色移动
(固定和跟随是矛盾的)
正确写法:
镜头跟随角色移动进行拍摄
技巧四:关键词要明确
模糊的:角色很开心
明确的:角色露出惊喜的表情,瞪大双眼
模糊的:角色在飞
明确的:角色脚踩飞剑,呈 45 度角向右前方极速飞行
5.4 特效相关提示词
速度感特效:
- 速度线条
- 残影效果
- 动态模糊
法术特效:
可以让豆包帮你生成特效描述:
询问:"修真者释放法术时周围环绕的特效怎么描述?"
豆包回复示例:
"周身环绕着金色的灵力光环,细小的光点如星辰般围绕身体旋转,
脚下浮现复杂的法阵纹路,发出柔和的蓝色光芒"
环境特效:
- 尘土飞扬
- 气浪冲击
- 树叶飘动
- 衣袂飘飘
六、视频生成实战:图生视频全流程
本章将以实际案例演示如何使用 VIDU 进行图生视频创作。
6.1 准备工作
步骤一:准备场景图
首先需要准备视频的背景场景图。可以是:
- 游戏截图
- 网上搜索的素材图
- AI 生成的场景图
场景图处理:
如果场景图比例不对,使用 PS 或清流调整为 16:9:
PS 操作路径:
图像 → 画布大小 → 设置为 16:9 比例 → 选择锚点位置 → 确定
步骤二:确认主体库已就绪
确保角色的三视图已经上传到 VIDU