本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
在 2026 年这个时间点,做一部具备电影感的科幻短片,真的不再需要剧组、绿幕、特效团队和六位数的预算。把 Google AI Studio 里的 Nano Banana Pro(图像)和 Veo 3.1(视频)组合起来,再加一款主流剪辑软件,一个人在自家书桌上就能完成从分镜到成片的全流程。这套工作流的真正门槛不在工具本身,而在三件事:前期的可行性沙盘演练、角色与场景的一致性控制、用首尾帧加结构化提示词精确驾驭视频生成。本篇把这条工业化生产线拆成 18 个环节,每一步该做什么、为什么这么做、容易在哪里翻车,全部用实操经验讲透。预计阅读时间约 30 分钟,适合想做 AI 短片但找不到入口的创作者——想看完整拆解,往下翻。
一、AI 视频创作正在迎来"工业化拐点"
我是莫潇羽,源码七号站(www.fuyuan7.com)的站长。过去一年我一直在跟踪 AI 影像这条赛道,见证了一件几乎反直觉的事:一个独立创作者用一台普通笔记本电脑,确实能产出过去需要小型工作室才能完成的科幻短片。这背后不是某个孤立模型的胜利,而是 Google 在 2025 到 2026 这段时间里,把图像、视频、剪辑三层链路彻底打通的结果。
要理解这件事的重量,看一组关键节点:
- 2025 年 5 月,Google 在 I/O 大会上正式推出 AI 影视工具 Flow,把 Veo 模型包装成对创作者更友好的剪辑界面。
- 2025 年下半年,Nano Banana(Gemini 2.5 Flash Image)进入大规模公测,实现了对话式图像生成与编辑。
- 2025 年 11 月底,Nano Banana Pro(Gemini 3 Pro Image)发布,支持原生 2K 上探到 4K 的输出,还引入了 Search Grounding(联网信息接入)能力。
- 2026 年初,Veo 3.1 一口气补上了首尾帧(Frames to Video)、原生音频、Ingredients to Video(多张参考图驱动视频)、Video Extend(片段延展)等功能,把"图生视频"的可控性推到了短片可用的级别。
这条时间线上最关键的化学反应,是图像与视频两个模型开始"互相能看懂对方"。用 Nano Banana Pro 生成的高分辨率人物图,可以直接喂给 Veo 3.1 作为起始帧;Veo 3.1 输出的视频又可以截帧回到 Nano Banana Pro 做二次编辑,或者作为下一段视频的尾帧——这意味着角色、场景、光线、风格可以在多个短片段里保持连续,这是 AI 短片从"试验品"跨进"作品"门槛的关键。
打个不太精确的比方:过去做 AI 短片更像是抓拍——你按一下按钮,模型甩一段东西给你,好坏全凭运气。现在做 AI 短片更像是导演拍片——你能给出明确的起点、终点、人物、风格,模型在你设定的轨道里发挥。这两种模式之间隔着一道工业化分水岭,我们刚好处在跨过去的那一年。
二、底层原理:理解模型在干什么,远比记住功能名称重要
很多新手一上来就想知道"Veo 怎么用",但这其实不是最划算的学习路径。先花十分钟搞清楚模型到底在做什么,后面所有的操作都能事半功倍。
2.1 图像模型与视频模型的本质区别
图像模型解决的是"一帧画面"的问题:给定提示词或参考图,输出一张静态的、像素级合理的图。它要解决的难点是构图、光线、纹理、人体结构、文本可读性。Nano Banana Pro 在 Gemini 3 Pro 的推理内核加持下,做的不再是单纯的扩散生成,而是先在内部"推理"一遍场景的物理关系和空间逻辑,再渲染出像素。
视频模型解决的是"一段画面"的问题:不仅要让每一帧合理,还要让相邻帧之间的运动连续、人物动作符合物理直觉、镜头切换看起来像真实摄影机的工作方式。Veo 3.1 的工程难度因此高了一个数量级——它不仅要画好画面,还要画好"时间"。
2.2 为什么"可控性"是 AI 影像的核心矛盾
模型越大、参数越多,默认的"创造性"也越强。这听上去是好事,但对短片创作者来说反而是噩梦——你不希望它在每一段视频里都加一些你没要求的元素。所谓"可控性",本质上就是用各种约束手段把模型的发挥空间压回你能预测的范围。
约束手段一共就这么几种:
- 提示词约束:用文字描述告诉模型要做什么、不要做什么。
- 参考图约束:给模型一张或多张参考图,让它"对齐"画面风格、角色长相、物体造型。
- 首尾帧约束:给视频模型一张起始帧和一张结束帧,让它必须从 A 走到 B。
- 结构化引导:像 Ingredients to Video 这样的功能,允许你同时提供多张不同语义的参考图(角色、道具、场景),让模型在它们之间组合。
短片创作者的全部工作,就是把这四类约束按需组合,让模型在"听话"和"创造"之间找到平衡点。
2.3 多模态闭环:图模型和视频模型互相喂数据
这是 2026 年这套工作流最值得记住的关键词——闭环。它的具体含义是:
Nano Banana Pro 生成静帧 ──→ Veo 3.1 作为起始帧 ──→ 视频输出
│
▼
截取尾帧
│
▼
Nano Banana Pro 做二次编辑 ──→ 作为下一段视频起始帧
这个循环你跑顺了,理论上可以无限延伸下去。每一段 Veo 视频虽然只有 8 秒,但通过尾帧承接,你可以把无数个 8 秒拼成 1 分钟、2 分钟、5 分钟的连续叙事。这是当下 AI 短片能做出"作品感"而不是"片段感"的物理基础,莫潇羽@源码七号站建议你把这张图打印出来贴在桌前。
三、工具栈全景:每个工具的角色与边界
把原理搞清楚之后,工具的选择就变成一件简单的事——按角色对位就行。整条链路只有三类工具:图像生成器、视频生成器、剪辑器,其余都是辅助。
3.1 Nano Banana Pro:基础图像层
Nano Banana Pro 的正式名字是 Gemini 3 Pro Image,是 Google DeepMind 在 2025 年 11 月发布的图像模型。它在短片创作里承担"原始素材供应商"的角色:
- 支持 2K 原生输出,可智能上探到 4K,纵横比覆盖 1:1、16:9、9:16、2:3、3:2、21:9 等多个常见尺寸。
- 一次最多可以接入 14 张参考图,适合做品牌素材融合、多元素拼合。
- 对最多 5 个人物角色保持身份一致性,这对多人对手戏的短片特别关键。
- 内置 Google Search Grounding,可以让生成的图像贴近真实世界的事实(比如某个特定的建筑、某个产品的细节)。
- 文本渲染能力是当下图像模型里最强的之一,海报、UI、信息图都能放心交给它。
实操层面,你在 Google AI Studio(aistudio.google.com)里就能调用它,免费额度内可以做相当多次试用。短片创作里,所有的"基础素材"——角色立绘、机甲设计、道具特写、场景概念图、分镜稿——几乎都从这里产出。
3.2 Veo 3.1:动态镜头层
Veo 3.1 是 Google DeepMind 在 2025 年下半年迭代出的视频模型,是当下做 AI 短片可控性最高的方案之一。它在 Gemini API 里的核心能力:
- 支持 720p、1080p、4K 三档分辨率,长度 4 秒、6 秒、8 秒可选。
- 三种生成模式:Text to Video(文生视频)、Image to Video(单帧驱动)、First & Last Frame(首尾帧驱动)。
- 支持 Ingredients to Video,最多接入 3 张参考图作为角色、道具、风格的"配料"。
- 原生支持 音频生成:环境音、对话、口型同步都能在一次生成里完成,但中文台词建议在剪辑阶段后期配音。
- 支持 Video Extend:基于已生成视频的最后 1 秒(约 24 帧)继续往下扩展,可以把多段 8 秒拼成 1 分钟以上的连续镜头。
短片里 90% 以上的镜头,都是用 Veo 3.1 由静态图驱动出动态画面。它的可控性强弱,直接决定了你短片的成败。
3.3 Google AI Studio 与 Google Flow 的取舍
两套面板的差异在哪里:
|
维度 |
Google AI Studio |
Google Flow |
|
定位 |
开发者级别的模型试验场 |
创作者专用的影视工作台 |
|
模型选择 |
灵活,可自由切 Gemini / Veo / Imagen |
锁定在 Veo + Nano Banana Pro 链路 |
|
历史记录 |
单次会话内可见,跨次需自己保存 |
自动保存,有 Scenebuilder 时间线 |
|
镜头拼接 |
需手动衔接 |
内置场景拼接、Jump To、Extend |
|
出品水印 |
免费版有 SynthID 隐式水印 |
免费版有可见水印,付费版去水印 |
|
适合场景 |
单镜头精细调试、批量参数实验 |
多镜头叙事、试拍长片 |
实战里我的做法是两个面板交替使用:在 AI Studio 里精修单镜头的提示词和参数,确认效果后再在 Flow 里把多个镜头拼接成场景。如果你只能选一个,新手先用 Flow,熟练之后再下探到 AI Studio。
3.4 国产备选与辅助工具
完全在国内合规可访问的图像/视频生成方案,这里给一组常见替代:
- 通义万相 / 通义千问的图像视频模式:阿里出品,支持中文提示词,生成速度较快,适合做快速概念草图和短视频原型。免费额度有时间窗限制,但作为补位工具完全够用。
- 腾讯混元、字节豆包:这两家也在持续迭代图像与视频生成能力,中文场景下的语义对齐相对友好。
- 海螺 AI 视频(MiniMax):在国产视频生成里属于动作流畅度比较稳定的一档。
- 可灵 AI(Kling):专注于视频生成,角色一致性表现较好,对运动物理学的还原比较自然。
这些工具我建议你作为"备胎"或者"补位选项"看待——主力工作流仍然以 Nano Banana Pro + Veo 3.1 为核心,因为它俩的协同度是当下最高的。
3.5 剪辑软件选型
剪辑软件其实没有"最优解",看你顺手哪一个:
- Filmora:适合新手,关键帧动画和速度曲线编辑特别直观,转场库里现成的"故障""闪白""黑场"都直接能用。
- 剪映专业版:对中文素材、自动字幕、平台直发(抖音/视频号)的支持是最顺的。
- 达芬奇 Resolve:免费版的功能就已经很强,调色面板是行业标杆,适合后期对画质有要求的项目。
- Adobe Premiere Pro:跟 Photoshop、After Effects 的协同最丝滑,但订阅费用相对高。
源码七号站的建议是:你已经熟悉哪个就继续用哪个,不要为了"听上去更专业"切换工具。AI 短片对剪辑软件的要求其实不高,核心需要的功能(关键帧、变速、反向播放、转场、调色、调音)所有主流软件都有。
3.6 辅助修图工具
AI 生图最常见的瑕疵——多指、错位、穿帮——靠模型自己修是修不好的,得有 Photoshop 或者它的免费替代品:
- Adobe Photoshop:行业标杆,修复画笔、内容感知填充都是利器。
- Photopea(photopea.com):在线版的"Photoshop",免费、不用安装、功能基本覆盖修图、抠图、图层蒙版、修复画笔。
- Krita / GIMP:开源选项,适合习惯用键盘快捷键的老用户。
把这一组工具配齐,整条流水线就搭好了。
四、项目启动前:用半天做一次"可行性沙盘"
太多创作者犯过同一个错误——脑子里有个画面,直接打开 AI Studio 就开干,然后三天后撞墙放弃。莫潇羽@源码七号站的建议是:正式开始前,先用半天时间做一次"可行性沙盘"。
4.1 三层可行性验证
可行性测试不是抽几张图看看就完事,它要分成三层来验证,任何一层不过关都意味着你需要调整剧本而不是死磕模型:
- 第一层:单帧能否成立。我脑海里最想要的画面,Nano Banana Pro 能不能给我一张让我满意的静帧?如果这一关都过不去,后面所有的事情都是空中楼阁。
- 第二层:动态能否成立。这张静帧丢给 Veo 3.1,能否产生合理的运动?有些画面静态时很美,一动起来就崩——比如密集的群体战斗、极复杂的粒子效果、剧烈的光影切换。
- 第三层:序列能否成立。两段连续的视频之间,角色、场景、光线能否保持一致?这是绝大多数"看上去很厉害的 demo"和"真正能用的短片"之间的鸿沟所在。
很多人只做了第一层就开干,结果在第二、三层全军覆没。把半天时间投入到这套验证上,能省下后面两周以上的痛苦。
4.2 把测试结果固化成一份"项目简报"
简报哪怕写在记事本上也行,但必须有这几项:
项目名称:____________
片长:____ 秒
故事核心:____________(一句话)
非有不可的画面:1. ____ 2. ____ 3. ____
有更好的画面:1. ____ 2. ____
经测试 AI 能稳定做出:____________
经测试 AI 困难但可以迭代:____________
计划用"小聪明"绕开的画面:____________(裁剪/反向/黑场/省略)
这份简报最大的价值,是让你在每一次迭代时都知道"我在为哪个目标服务",而不是被模型的随机输出牵着鼻子走。它是你创作时的导航,不是装饰品。
4.3 时间与积分预算
AI 影像创作有两个隐性预算项:时间和生成积分。
时间预算的合理拆分大概是:60% 用在素材生成与精修,40% 用在剪辑与音效。如果你发现自己 90% 时间都在等 Veo 渲染,八成是出了流程问题。
积分预算更直接——Veo 3.1 单次生成在不同分辨率下消耗不同,4K 的成本明显高于 720p。我的做法是前期所有迭代都用 720p,确认成片整体没问题后,再把关键镜头重做 1080p,最后整片导出到 1080p。这能在画质和成本之间取得最佳平衡。
五、角色塑造工作流:把"一致性"做成可复用资产
任何接触过 AI 视频的创作者都会同意一件事——如果一个角色在不同镜头里不能保持一致,再炫的画面也只是 demo,不是作品。观众三秒钟就跳戏。
5.1 一致性问题的本质
Veo 3.1 单次生成的视频长度是 4 到 8 秒,这意味着一部 1 分钟的短片至少要拼接 8 到 15 段。如果每一段里角色"长得不一样",成片观感就崩了。这件事的解决思路,不是寄希望于某个模型一次给你完美输出,而是建立一套角色资产管理体系。
5.2 从一张种子图开始
角色设计不要从零空想,而是先拿一张方向对的图作为种子。这张图可以来自:
- Nano Banana Pro 自动生成的初稿。
- 你自己拍的、画的、或者免版权素材库里挑的图(注意版权)。
- 影视截图(注意:只能作为风格参考,不能直接用,会有侵权风险)。
然后把这张种子图作为"基准",在它的基础上做迭代调整。
5.3 最有效的"换脸"提示词
不要一开始就堆形容词。最有效的提示词反而极其简洁:
Replace the face of the person in this image with another person of
the same race, hair color and skin tone. Keep the body structure,
clothing, and pose unchanged.
注意三个细节:
- "same race, hair color and skin tone" 是用来防止模型乱改肤色——它有时会顺手把肤色一起改了。
- "Keep the body structure unchanged" 锁定身材比例。
- 输出参数设置成 Aspect Ratio: Auto、Resolution: 4K。
如果生成出来的脸不满意,每次只调一个变量。比如"slightly larger eyes"、"more pronounced cheekbones"、"longer hair with more volume"。这是迭代式 AI 创作里非常重要的纪律。
5.4 多视角档案的标准化
主角光有正面照不够,实战里至少要准备这些视图:
角色资产文件夹/
├── hero_front_v3.jpg # 正面全身,4K
├── hero_back_v2.jpg # 背面全身
├── hero_side_left_v1.jpg # 左侧身位
├── hero_side_right_v1.jpg # 右侧身位
├── hero_portrait_v4.jpg # 面部特写(后续换脸用)
├── hero_emotion_calm.jpg # 平静表情
├── hero_emotion_angry.jpg # 愤怒表情
├── hero_emotion_shock.jpg # 惊讶表情
└── hero_action_run.jpg # 跑动姿态
获取方式很简单:把基础图丢回 Nano Banana Pro,用 "generate full panels: front, back, left side, right side, all matching the reference character" 这样的提示词。一次生成可能拿不齐,多迭代几次。
命名规则建议:角色_视角_版本号.扩展名。后面在写视频提示词时,直接按文件名引用,管理成本骤降。
5.5 双图融合做表情和服装替换
Nano Banana Pro 有一个特别好用的能力——双图融合。比如你手上有一张表情对但服装错的图,和一张服装对但表情错的图,可以把两张图同时上传,提示:
Use the body, clothing, and pose from Image 1.
Use the facial expression and head angle from Image 2.
The face identity should match the character reference (Image 3).
Output as a single photorealistic image at 4K resolution.
这种"取长补短"的玩法,比让模型从零生成靠谱得多。莫潇羽@源码七号站的经验是,当你有 2-3 张"半成品"图时,与其重抽,不如做融合。
六、装备、机甲与道具:风格收敛的提示词工程
科幻短片里,装甲、机甲、武器、飞船的设计往往比人脸还难控,因为模型有自己的"审美惯性"——你说"作战盔甲",它默认给你霓虹赛博朋克;你说"机甲",它默认堆满夸张的发光线条。这种惯性必须用提示词工程压回去。
6.1 模型的"审美惯性"在哪里
观察下来,主流图像模型的几个常见惯性偏差:
- 提到 "armor" → 默认偏向中世纪板甲或者赛博朋克外骨骼。
- 提到 "mech" → 默认偏向日系机甲(夸张的关节、巨大的肩部装甲、强烈的发光元素)。
- 提到 "futuristic" → 默认堆满霓虹光条。
- 提到 "weapon" → 默认偏向卡通化、夸张的造型。
这些惯性不是"错",只是不一定符合你想要的风格。要让模型按你的想法走,得用反向提示词把这些惯性按住。
6.2 反向提示词的力学
一个被验证过有效的装甲设计模板:
A sci-fi marine combat armor, slightly bulky but with clean lines.
Main color: matte white, with deep blue trim (the trim is NOT glowing).
Inner padding visible at joints: dark gray leather texture.
Reinforced shoulder plates, integrated helmet with visor down.
NO neon, NO cyberpunk style, NO anime elements, NO stylization, NO cartoon.
Photorealistic, studio lighting, plain gray background.
Full body shot from head to toe, 4K, aspect ratio 9:16.
这里几个细节值得抄作业:
- 用大写的 "NO ××" 来反向锁定风格,这对 Nano Banana Pro 特别有效。
- 明确主色和点缀色,并强调"点缀色不发光",可以避免大多数赛博朋克意外。
- 写出内衬材质(灰色皮革),是质感的关键。不写这一句,内衬经常变成科技纤维或金属网。
6.3 性别身形锁定
如果主角是女性而你又不希望机甲穿出男性化效果,提示词里要专门补一句:
The armor should follow a feminine silhouette: narrower waist,
chest plating with subtle curvature, no large flat plates on the bust area.
这句听上去像废话,但模型在没有明确指令时会按"标准战士体型"出图,结果就是一身平板胸甲——硬伤。
6.4 手指、关节这些顽疾,直接用 PS 兜底
AI 生图最出名的毛病就是手指数量不对、关节扭曲、装甲板互相穿模。不要在提示词里反复让模型修复——它修不好。高效流程:
- 在 Nano Banana Pro 里把整体生成到 80 分。
- 把图丢进 Photoshop 或 Photopea,用修复画笔(Healing Brush)处理多余手指。
- 用快速选择 + 图层蒙版,把出问题的甲片局部替换成另一张正确版本里的甲片。
源码七号站补充一个心得:最终成片大概率会输出 1080p,你在修图时不需要追求像素级完美。差不多过得去就走下一步,缩放和压缩之后很多瑕疵会自然消失。
七、场景与世界观:用参考图链统一画面
短片的世界观靠场景撑起来。一艘能反复出镜的飞船、一个能反复入镜的星球地表,值得你花专门的时间设计。
7.1 飞船的多视图标准化
飞船设计的思路和角色完全一样——先有一张你已经认可的飞船图(可以是 Veo 视频里的截图,也可以是 Nano Banana Pro 生成的)作为参考,然后让模型生成它的全角度视图。提示词模板:
Generate full design pa