本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
这篇长文把我自己折腾 AI 影像大半年的实操心得整理成了一套可复用的方法论:核心结论就一句话——决定一条 AI 视频好坏的,从来不是你用了哪个最新模型,而是你"控制画面"的能力,也就是图片质量和提示词功底这两件底层功夫。 全文围绕国内可直接访问的工具链展开,把"模型 / 平台 / 公司"的关系讲清楚,再从图片生成原理、提示词的两种写法与六个维度、镜头语言(景别 / 视角 / 运镜)、批量出图与九宫格一致性、图片编辑全家桶、图生视频的三种打法、口播数字人、实拍 + AI 融合的动作迁移工作流,一直讲到 AI 配乐、图文设计和我踩过的坑。新手照着读完,基本能独立做出一条有故事、风格统一的短片。
想看完整拆解,往下翻。
一、先把概念理清:模型、平台、公司到底是什么关系
很多人刚接触这行最大的障碍不是技术,而是被一堆英文名词绕晕。一会儿是 Seedance,一会儿是 nano banana,一会儿又是 Veo、可灵、海螺……听着像天书,其实只要搞懂三层关系,后面学什么都豁然开朗。这三层就是:公司 → 模型 → 平台。
我用最直白的话给新手解释一遍。模型是真正干活的"大脑",它被训练出来专门做某一件事;平台是给你按按钮、上传图片、写提示词的"操作台";公司则是开发这些模型的那家企业。一个模型可以出现在好几个平台上,这就是大家容易混淆的地方。
拿字节跳动举例。它家有两条主力线:图像模型叫 Seedream(很多人嘴里念成"即梦图片模型"),视频模型叫 Seedance。2026 年 2 月,字节跳动旗下即梦 AI 正式发布 Seedance 2.0,这是继 2025 年 6 月初代 Seedance 之后的重大升级,支持文本、图像、视频、音频多种素材作为参考。注意,Seedance 2.0 只是"模型"这个大脑,它能在哪些"操作台"上用呢?字节自家就有好几个——即梦、豆包、小云雀,还有火山引擎的企业接口。2026 年 2 月,Seedance 2.0 已在即梦、豆包、小云雀等多款字节系产品中开启内测。所以你在不同 App 里看到的可能是同一个大脑,只是换了个壳。
谷歌那边逻辑一模一样。图像模型叫 nano banana,正式名称是 Gemini 2.5 Flash Image,是谷歌最新的图像生成与编辑模型,核心亮点就是快、准、狠。视频模型叫 Veo,谷歌旗下首个 AI 视频创作平台 Flow 整合了 Veo、Imagen 和 Gemini 等模型,支持一键生成 8 秒音画同步的视频。它们既能在谷歌自家产品里用,也通过接口对外开放。
理解了这层关系,你就明白一个事实:模型会一直迭代,从 3.0 升到 4.0、5.0,从初代 Seedance 升到 2.0,名字花里胡哨地变,但它干的事永远只有两类——要么生成图片,要么生成视频。至于豆包、DeepSeek 这种主要拿来打字聊天的,那叫大语言模型,不是我们影像创作的研究重点(虽然写提示词、写文案时会经常用它打下手)。下次再看到某博主喊"某某模型更新到 X.0 啦",你心里有数就行,不用焦虑。
国内能不能直接用?答案是完全可以
新手最常问我一个问题:这些谷歌的模型,在国内到底能不能直接用?我的回答很明确:能用,"用不了"是个很大的认知误区。国内现在有大量平台已经把这些模型集成进来了,你打开就能直接调。目前自己去找谷歌官方渠道比较折腾,但国内已经有不少平台集成了 nano banana 模型,大家按需选择即可,完全不用为入口的事发愁。
我特意强调这一点,是因为太多新手卡在了第一步——以为这些模型门槛很高、离自己很远,迟迟不敢上手。其实恰恰相反,国内平台把调用入口铺得很平,注册个账号、充点钱包余额,就能像用国产工具一样顺手地调用这些海外顶尖模型。把这个心理门槛拆掉,你才能真正进入创作状态。
我自己用得最多的几个国内可访问平台,一个是云工作流类的 RunningHub(它把 nano banana、Seedance、Veo 等一堆模型都装进了一块画布里),一个是各家模型的官方网页端(即梦、豆包),抓产品的话也会用一些综合性的第三方站点。它们的操作逻辑高度相似:双击一个节点,里面就能挑模型、设比例、设时长。所以你不必为"能不能用上这些模型"发愁,国内平台已经把入口铺好了,把心思放在创作本身就行。
为什么有时候用官方平台、有时候用第三方
莫潇羽@源码七号站这里说点掏心窝的话:我在不同平台之间换来换去,核心就两个考量——创作的便捷性和使用成本。同一个模型,在它的官方平台(比如即梦里调 Seedance)单价通常更低;而第三方云平台的好处是"一站搞定",图片、视频、声音都在一块画布上完成,省得到处找。
成本上,第三方平台一般是按次计费,比如调一次图像模型大约几毛钱,调一次视频大约几毛到一块多,用多少扣多少,不用一上来就办昂贵的会员。官方平台则多是会员制,按月或按年充值,活动期常有折扣。两种模式没有绝对的好坏,看你的使用频率和习惯。我的经验是:高频生产就办官方年度会员摊薄单价,零散测试就用第三方钱包按次扣费。
公司 模型(大脑) 平台(操作台)
─────────────────────────────────────────────
字节跳动 → Seedream(图) ┐
Seedance(视频) ┴─→ 即梦 / 豆包 / 小云雀 / 火山引擎接口
谷歌 → nano banana(图)┐
Veo(视频) ┴─→ Gemini / Flow / 国内第三方集成平台
第三方画布 → 上面这些模型都能调用 → RunningHub 等云工作流平台
二、图片是一切的地基:AI 到底怎么画画、怎么读提示词
我从不一上来就教视频生成技巧。原因很简单:视频的本质就是一张张连续的图片,一秒二十几格,你连一张静态画面都控制不住,怎么可能控制连续画面?而且做视频要解决的角色一致性、场景稳定性、风格统一,最终都要落到"参考图"上。所以图片是底层中的底层,先把图片吃透,视频就成功了一大半。
要把图片用好,得先懂一件事:AI 画画到底是怎么回事。我把它拆成三步讲,新手一听就明白。
第一步是投喂海量数据。开发者给模型看了天量的图片,每张都打上标签——这张有猫、有森林、有日落,让模型把"文字概念"和"画面"一一对应起来。第二步是学习规律。模型把复杂图片拆成最小的视觉单元:线条、色彩、构图、风格。就像人类画猫会注意尾巴、胡须、爪子,模型也在提取这些稳定特征,建成自己的"词典"。第三步是生成画面。当你输入一句"一只穿西装的猫",它会在词典里找到"猫"和"西装"的视觉特征,从一团噪点开始,经过几十步迭代,让画面越来越接近你描述的样子。
这里有个关键认知,新手一定要记牢:AI 并没有真正"理解"你的话,它是在算概率。长期以来我们倾向于认为,要解决主体一致性这样高精度的难题需要专门优化的模型,但通用大模型凭借更宏大的数据和更深层次的理解,可能以润物细无声的方式从根本上解决这些问题。但即便是这种"理解",本质上仍是统计——它只是在判断"把哪些像素拼在一起最符合你这串文字"。你说"一个忧伤的小女孩站在雨中",它感受不到忧伤,它只是从数据里调出"过去人们配'忧伤'时常出现的低饱和、阴雨、灰蓝天空"这些特征,组合起来。
明白了这点,你就能反推出提示词的真正作用了。你写下的每一个词,本质上都是在给概率分布做收敛。描述得越清晰,它的选择范围越小,越容易给你想要的;描述得越模糊,它就越自由发挥,越随机。所以提示词不是"写一句漂亮话",而是对画面进行结构化控制的过程。这也是为什么有人写了一千多字、堆得像作文,画面还是飘——不是模型不行,是信息乱、没结构。
flowchart LR
A[海量图文数据投喂] --> B[拆解视觉单元<br/>线条/色彩/构图/风格]
B --> C[建立文字↔画面词典]
D[你的提示词] --> E[转成数字向量]
C --> F[从噪点迭代去噪]
E --> F
F --> G[输出图片]
把这套底层逻辑想透,比记一百条提示词模板都管用。因为模型会换,工具会变,但"它如何理解人类指令"这件事的底层运行逻辑,过去、现在、未来几乎是一样的。这也