本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
这是一篇把 AI 带货视频从"零散尝试"做到"工程化产线"的全流程手册。我把过去几个月在 Seedance(即梦)和 Veo 3.1 上反复抽卡踩坑的全部心得,按照"模型 → 图片 → 脚本 → 镜头 → 流水线 → 工作流"的顺序整理出来,核心结论先放在这儿:
- 模型不要押宝在一个上。Seedance 负责复杂动作和人物表演,Veo 3.1 负责高质感产品镜头和氛围渲染,两者搭配,单条视频的素材成本可以压到一块钱以内。
- 图片决定视频的天花板。绝大多数"成片 AI 感太重"的根本原因不在视频模型,而在前置的图片没有做过白底处理和有效信息密度提升。
- 分镜脚本必须 JSON 结构化,这是当下国产视频模型理解力的最佳格式,优于自然语言段落和 Markdown 表格。
- 人物模特避开人脸检测有完整的工程链路:四视图、网格遮挡、网纹遮罩、二合一组合,通过率可以从不到 20% 拉到 80% 以上。
- 同行爆款 1 比 1 复刻是有方法论的,五个物理维度(主体、动作、环境、光影、运镜)的反推,远比"一句话生成 JSON"靠谱十倍。
- 真正能压住成本的是镜头资产化:把每一条命中数据的分镜及其提示词、首帧图都归档到素材库,后续视频按模块复用,边际成本会一路向下。
想看完整拆解,往下翻。文章里我会把每一步的提示词模板、避坑细节、流水线 SOP 和工作流编排思路全部摊开,新手也能跟着做出第一条像样的成片。
一、AI 带货视频的底层逻辑:回归"图片 + 提示词"的本质
刚接触 AI 视频生产那阵子,我自己也走过弯路。下载一堆教程,看了一堆模型介绍,觉得越复杂越高级。后来真的把流水线跑起来才发现,所有主流视频生成模型,无论是国内的即梦 Seedance、可灵,还是国外的 Veo、Runway、Sora,本质上吃的都是同两样东西:一张(或几张)参考图,一段结构化的提示词。
你给它的信息越精准,它抽卡的命中率就越高。反过来,如果你扔一张光线杂乱、主体不明的随手拍上去,再写一段"高级感、电影质感、4K"这种空话,模型只能靠概率乱猜,出来的东西自然不能看。
1.1 为什么是这两样东西?
视频生成模型的工程结构很有意思。即便是 2026 年 Seedance 2.0 这种支持四模态(文本、图像、视频、音频)联合输入的最新版本,在火山引擎给出的 API 接口里,核心入参依然是「参考素材 + Prompt」的组合。模型并不能"凭空想象"你的产品长什么样,它必须从你给的素材里学习构图、风格、运镜节奏,再按提示词去生成。
这一点不止国产模型,Google Veo 3.1 也一样。它在 2025 年 10 月更新后的最大变化,就是把首帧参考图(image-to-video)做得更稳,意味着你给一张产品图,它能保留产品的所有细节,而不是自由发挥。
把这个底层逻辑想透,后面的所有操作都顺理成章了:
带货视频生产 = 图片工程 × 提示词工程 × 模型抽卡
任何一环出问题,整个链路都会塌方。所以我从头到尾,会把图片处理摆在和提示词同等重要的位置。
1.2 从"试一试"到"做产线"的心态切换
我观察了一圈,大部分新手在 AI 视频上卡死的点不是技术,是心态。他们的状态是"我抽一次卡,效果不好,换一个模型再抽一次,还是不好,放弃"。这种玩法注定做不出东西。
把它当一条产线来做,逻辑就完全不一样了。产线意味着:
- 变量是可控的。模特、产品、场景、卖点、风格,每一项都是一个变量,我清楚自己在控制什么。
- 失败是可解释的。这一次抽卡失败,我能定位到底是图片信息密度不够,还是提示词的某个维度漏了。
- 复用是默认的。任何一个跑出好数据的镜头,它的图、它的提示词、它的参数都会被归档,下次直接复用。
莫潇羽@源码七号站这边自己的小规模测试,基本就是按这个思路在跑。下面进入正题,从最关键的模型选型说起。
二、模型选型:为什么是 Seedance 加 Veo 3.1 的双引擎搭配
2.1 不要押宝在单一模型
这是我反复跟人强调的第一条原则。任何一个模型,都有它擅长和不擅长的事情,也都有可能临时改版、调价、限流。把所有产能压在一个模型上,等于把命脉交给别人。
我现在的稳定做法是双引擎搭配:
+-------------------------+ +-------------------------+
| Seedance(即梦) | | Veo 3.1 |
| --- 复杂动作/人物 --- | | --- 质感/氛围/产品 --- |
| - 多模态参考(12 输入)| | - 8 秒高清单镜头 |
| - 中文理解强 | | - 物理规律最强 |
| - 适合 10-15 秒主镜头 | | - 单价低,适合补充镜头 |
+-------------------------+ +-------------------------+
\ /
\ /
\ /
\ /
+--- 混剪成成片 -------+
这套搭配的核心思想:用 Seedance 解决"难做的事"(人物表演、对口型、复杂手部动作),用 Veo 3.1 解决"贵的事"(高质感产品空镜、环境烘托、氛围铺垫)。
2.2 Seedance 这边到底强在哪
字节跳动 Seed 团队的 Seedance 系列从 2025 年中的 1.0 一路迭代到 2026 年 2 月的 2.0,我自己感知最深的几个能力点是这样的:
第一,多模态参考是国内目前做得最彻底的。它一次能接受最多 12 个文件作为参考,涵盖图片、视频、音频、文本。这意味着你想生成的视频里,"人物长什么样、画面什么质感、运镜怎么走、背景什么环境、音色什么调性",可以全部用素材去锁定,不需要靠提示词反复描述。
操作层面就是在提示词里用 @图片1、@视频1、@音频1 这种语法去引用,模型会自动学习对应素材的属性。这是国内其它视频模型暂时还不具备的能力。
第二,复杂动作的稳定性目前是国内梯队最顶。比如人物的肢体连贯动作、对口型、转身、互动,Seedance 的生成稳定性比一些同类模型高不少。我自己测过卖服装的拉袖口、扯裤腿这种细节动作,Seedance 出片的命中率明显占优。
第三,它有满血版和 Lite 版的搭配。我自己的策略是,前期测试阶段用 Lite 跑,大概便宜 30% 左右,等到提示词和图片都调好了,再上满血做最终版。这个习惯能省不少素材成本。
它的局限性也得直说:
- 不支持直接上传人脸参考图。直接上传,系统会判定包含人脸信息并拒绝。绕开这个限制有一套工程方法,后面单独讲。
- 单条生成成本仍然不算低。即便用 Lite 版,一条 10 秒视频的素材成本也要两三块钱。
2.3 Veo 3.1 的价值在哪
Google DeepMind 的 Veo 系列,从 2024 年 5 月的初代到 2025 年 5 月的 Veo 3(开始支持原生音频生成),再到 2025 年 10 月的 Veo 3.1,迭代节奏非常快。Veo 3.1 我自己用下来,最大的感受是物理规律和材质质感真的厉害。
举个例子,拍一段香水瓶在阳光下旋转的镜头,光线从瓶身折射出来的样子、玻璃的厚度感、瓶身贴标在光线里的微反光,Veo 3.1 能渲染得相当真实。同样的场景给到 Seedance,质感会稍微弱一些。
但 Veo 3.1 也有它的边界:
- 单次生成只有 8 秒。8 秒就是它的硬上限,做长视频必须靠分镜拼接。
- 复杂动作不稳定。它最适合的是"产品空镜""氛围镜头""主体小幅度运动",不要让它去演人物表演。
- 首帧参考要选对。这里是一个新手最容易踩的坑:不要用首尾帧,只用首帧参考图。后面讲操作的时候我会展开。
为什么 Veo 3.1 能把单条成本压到三毛左右?这是因为现在主流的 API 中转都做了批量调用优化。原本一秒一美金的原生定价,经过工程层面的优化,可以把单条 8 秒的视频生产成本压到几毛钱量级。对个人创作者非常友好。
还有一个细节值得单独提一句:Veo 3.1 从 2025 年 10 月开始,首帧参考(image-to-video)的稳定性做了一次大的升级。在这之前,它的首帧理解力其实不如即梦。升级之后,你给它一张高质量的产品图作为首帧,它能非常忠实地保留产品的所有细节,这才让它真正适合做带货视频。所以如果你之前测过老版本的 Veo 觉得效果一般,现在可以重新评估一次,体感差距很大。
我自己跑过一个简单的对照测试,同一张箱包白底图、同样的提示词,在 Veo 3 和 Veo 3.1 上各抽五次卡:Veo 3 大概有两次出现 logo 偏移、配色微差;Veo 3.1 五次全部稳定还原。质量稳定性这条曲线,这半年改善得非常明显。这也是为什么我把 Veo 3.1 放进双引擎搭配的核心位置。
2.4 双引擎搭配的成本测算
我跑了一个简单的对比测算,以一条 15 秒的带货视频为例(假设 3 个 5 秒的分镜):
|
方案 |
镜头构成 |
单镜头成本 |
总素材成本 |
|
纯 Seedance |
3 段动作镜头 |
约 3-4 元 |
9-12 元 |
|
纯 Veo 3.1 |
3 段 8 秒(裁剪) |
约 0.3 元 |
1 元以内 |
|
双引擎搭配 |
1 段人物 + 2 段产品 |
3 + 0.3×2 |
约 3.6 元 |
纯 Veo 是最便宜,但完成不了人物口播之类的核心镜头。纯 Seedance 太贵。双引擎搭配在质量和成本之间是最优解。
把这个表算清楚之后,后面所有的镜头设计,我都会习惯性问一句:"这段镜头,Veo 能做就让 Veo 做,做不了再上 Seedance。"成本就是这么压下来的。
三、产品图预处理:决定视频天花板的关键一步
很多人做出来的视频"AI 感太重",八成不是视频模型的问题,而是输入的图本身就有问题。这一节把图片预处理的两个核心动作讲透。