本文由 莫潇羽@源码七号站(www.fuyuan7.com) 撰写,转载请注明出处。
快速摘要
Seedance 2.0 是字节跳动旗下即梦平台在 2026 年 2 月 7 日正式发布的新一代多模态 AI 视频生成模型。它最大的突破有三点:一是把图片、视频、音频、文本四种素材一起塞进一次生成;二是引入 @素材 引用语法,让模型清楚每个素材分别要扮演什么角色;三是原生音画同步,画面和声音是一次出来的,不是后期拼的。
实操层面,整个工具有两个核心入口:首尾帧(适合上传一张图 + 一句话直接出片)、全能参考(最多 12 个素材混合参考,是 2.0 的灵魂)。前者每条视频默认消耗 30 积分起,后者一旦带视频参考,15 秒视频可能要消耗近 200 积分,要算着用。
这一篇文章我把自己最近一段时间折腾下来的所有体感、踩过的坑、提示词公式、参数选择、商业化场景全部拆完了,包括多图串联、运镜复刻、长剧情生成、产品广告、视频延长等几乎所有核心玩法。想看完整拆解,往下翻。
一、先认识 Seedance 2.0 这个角色
很多人一上来就想着复制别人的提示词模板抄一下,结果出片效果一般,回头还以为是模型不行。我自己折腾下来的体会是:先得搞清楚这个模型到底"听得懂什么",再去写提示词,思路才不会乱。
1.1 一句话定位
Seedance 2.0 是字节跳动旗下即梦平台(jimeng.jianying.com)在 2026 年 2 月发布的新一代视频生成模型,核心定位是 "多模态音视频联合生成" —— 翻译成人话就是:你可以同时把图片、视频、音频、文字四种素材丢进去,让模型一次性生成一段画面与声音同步的视频,最长 15 秒。
它和上一代 Seedance 1.5 比起来,差异不是参数量上的简单增加,而是在四个维度上做了系统性升级:
|
维度 |
上一代体感 |
Seedance 2.0 体感 |
|
输入模态 |
文字 + 单图首帧(个别版本支持音频) |
文字 + 多图 + 视频 + 音频混合参考 |
|
角色一致性 |
跨镜头容易"换脸""换衣" |
同一角色多镜头基本能锁住面部和服装 |
|
运镜控制 |
主要靠提示词描述,结果偏抽卡 |
可上传参考视频复刻运镜,精准度肉眼可见 |
|
音画关系 |
先生视频再后期补音轨 |
一次前向传播同步出画面与声音 |
我用一张简单的脑图把它的能力地图画一下,方便你在脑子里建立坐标:
graph LR
A[Seedance 2.0] --> B[输入端]
A --> C[控制端]
A --> D[输出端]
B --> B1[文本提示词]
B --> B2[图片 最多9张]
B --> B3[视频 最多3个,总时长15s内]
B --> B4[音频 最多3段,总时长15s内]
C --> C1[首尾帧入口]
C --> C2[全能参考入口]
C --> C3[@符号引用语法]
D --> D1[4-15秒高清视频]
D --> D2[原生音画同步]
D --> D3[最高2K分辨率]
1.2 它解决的最根本痛点
过去用 AI 做视频,最让人头大的两个问题:
- "猜谜式"出片:写一段话给模型,模型猜你想要什么,结果是抽卡 —— 抽到好的随缘,抽到崩的重写。
- "翻车式"延长:好不容易抽到一段满意的,想再续 5 秒,结果一续就脸变了、衣服变了、镜头视角也跳了。
Seedance 2.0 的多模态参考就是冲着这两个痛点来的:你不用再"许愿",可以直接把"参照对象"喂给模型 —— 一张图定角色长相,一段视频定运镜,一段音频定节奏,提示词只用来串剧情。模型解码的不再是你脑海里的画面,而是你已经给过的真实素材。这之间的差距,就是抽卡和定制的差距。
我之前在源码七号站写过几篇关于 AI 工作流标准化的文章,思路和这个其实是一脉相承的:让结果可控的关键,从来不是写更长更花哨的提示词,而是给模型更多结构化的输入。 Seedance 2.0 把这个理念落到了视频领域。
1.3 别迷信"地表最强"的标签
网上有不少铺天盖地的"地表最强 / 改变行业 / 终极答案"之类的评价,这些标签作为传播口号没问题,但你要拿着它真的去做项目,得有几个清醒认知:
- 它的真人写实素材是有合规限制的,目前不能直接上传清晰可辨认的人脸做主体参考;要让自己出镜需要走真人活体校验后再做数字分身。
- 它在某些极端运镜(比如多人剧烈打斗、超快闪剪辑)上仍然会"污染"参考素材中的原画面。
- 它对中文长提示词的理解算业内顶尖,但仍然吃 token 限制,超长指令会被截断。
接下来我就按"小白上手 → 进阶玩法 → 商业落地"的顺序,把它的具体用法拆给你。
二、参数预览与积分机制:开干之前先把账算清
第一次进入即梦的视频生成界面,新手很容易在参数面板上发懵。我把这一节当成"操作前置课",把每个开关都讲清楚。
2.1 入口在哪里
进入即梦主页 → 顶部导航选视频生成 → 在左上角的模型切换处,把模型切到 Seedance 2.0。同一个模型下面会出现两个细分入口:
- 首尾帧:上传一张首帧图(最多再加一张尾帧图)+ 文字提示词,最多两张图。适合"图生视频"这种最简单的场景。
- 全能参考:可以同时上传图片、视频、音频,再配合提示词,最多 12 个素材。是 2.0 的核心入口,也是这一节后面要重点讲的。
切换的方式很傻瓜化,鼠标点一下就好。如果你的账号还没看到 Seedance 2.0 这个选项,多半是会员级别没开够 —— 平台目前要求至少有基础会员才能用 2.0,新用户也可以走小云雀的免费体验额度先尝鲜。
2.2 默认参数能直接用吗
平台默认会给一组参数:
- 时长:默认是 5 秒,可调范围 4 至 15 秒。
- 分辨率:默认 1080p,可上拉到 720p / 1080p / 2K(部分入口才支持 2K)。
- 画面比例:6 种比例可选,竖屏、横屏、方屏、电影宽银幕都齐了。
- 创作种子:默认随机,可固定后用于复用同一种生成倾向。
我自己的习惯是:先用默认参数跑一次最便宜的版本试效果,确认提示词没问题再拉满分辨率和时长。这样能省下大量积分。
2.3 积分怎么扣,最容易翻车的就是这块
这是很多人第一次用 Seedance 2.0 被劝退的原因 —— 没看清楚扣分逻辑就乱传素材,几张视频下去一天的积分就没了。莫潇羽@源码七号站这边给你一份直观的积分参考:
|
场景 |
默认参数(5 秒)大致消耗 |
拉满 15 秒大致消耗 |
|
文生视频 |
30 积分起 |
80 ~ 100 积分 |
|
首尾帧(纯图片) |
30 积分起 |
80 ~ 100 积分 |
|
全能参考(纯图片) |
30 积分起 |
80 ~ 100 积分 |
|
全能参考 + 1 段视频参考 |
60 ~ 80 积分 |
150 ~ 200 积分 |
|
全能参考 + 视频 + 音频 |
80 + 积分 |
接近 200 积分 |
简单一句话总结:纯图参考积分翻不出花来,但凡你上传了视频参考,积分会成倍往上跳。视频参考是"昂贵但精准"的能力,要把它用在真正需要复刻运镜或动作的关键片段上,不要拿来抽着玩。
2.4 Fast 模式什么时候选
平台还有一个 Seedance 2.0 Fast 模式(在模型选择处可见),相比标准版会便宜 30% 到 50%,速度也明显更快。它的妥协在于:分辨率上限稍低、对复杂运镜的还原度略弱。我自己用下来的判断:
- 做初版打样、自媒体短素材、快速试错提示词的时候,直接用 Fast 模式,省时间省积分。
- 做最终交付、产品广告、复杂运镜复刻的时候,再切到标准版精修。
2.5 会员等级与试用额度
平台目前的会员体系大致分为基础会员、高级会员、年度会员几档,差异主要体现在每月赠送的积分量、并发任务数、是否能用 2K 分辨率上。新手不用一上来就充顶配 —— 先开最低档,把 Seedance 2.0 跑顺了再考虑升级。
如果你只是想尝鲜,平台还有几个零成本通道:
- 小云雀新用户:登录后会赠送 3 次 Seedance 2.0 免费生成机会,每天还有少量赠送积分。
- 即梦每日签到:积分虽然不多,但攒一周也能跑出几条短视频。
- 官方活动:平台不定期会在创作者社群里发激励积分,关注一下。
2.6 排队与生成速度
热门时段(晚上 8 点到 12 点)排队最严重,标准模式下一条 15 秒视频从提交到出片可能要 8 ~ 15 分钟。Fast 模式排队几乎可以忽略,2 ~ 3 分钟就能出。我的建议:
- 白天工作时间用标准模式跑高质量素材
- 晚上灵感来时用 Fast 模式快速试错
- 真要赶项目,可以考虑同时开多个浏览器标签批量提交(前提是会员等级允许并发)
2.7 输出文件的格式与下载
生成完成后,平台会保留你的视频在云端历史记录里。下载下来是 MP4 格式(H.264 编码),码率根据分辨率不同,1080p 大约 8 ~ 12 Mbps,2K 大约 15 ~ 20 Mbps。做后期剪辑和发布前一定要本地备份,平台的历史记录虽然偶尔会因为版本更新导致旧素材访问异常。
三、首尾帧入口:单图驱动的稳定出片
虽然全能参考更强大,但首尾帧入口仍然是日常使用频率最高的入口 —— 90% 的"图生视频"需求其实都不需要那么多素材。
3.1 适合用首尾帧的场景
把首尾帧当成 Seedance 2.0 的"轻量版"。它适合下面这些情况:
- 手上只有一张图,想让它动起来。
- 已经有了画面起点和终点(比如人物从平静到挥手),希望模型补完中间的运动。
- 不需要复杂运镜,只想看主体的自然动作。
3.2 小白第一次出片的标准流程
把你想要的图片拖进首帧框 → 写一段不超过 80 字的提示词 → 选 5 秒时长 → 点生成。提示词写法很简单,记住"主体 + 动作 + 镜头"三件套:
[主体] 一位戴白色头盔的少女站在斜坡顶端的滑板上
[动作] 她蹬地一脚滑下,完成空中360度转体后稳稳落地
[镜头] 镜头跟随式低机位,带轻微震动,结尾平移定格
这样一段提示词,配合一张少女滑板起势的图,Seedance 2.0 通常一次就能出可用素材。我自己测试过四次抽卡,画面里没有出现过姿态扭曲、四肢错位之类的常见 AI 视频翻车点 —— 这是相比上一代最让人惊喜的地方。
3.3 物理表现的明显升级
我特意拿了一段 1.5 版本生成的滑板视频做对比。同样一句提示词、同样的首帧图:
- 1.5 版本生成:滑板下坡阶段速度逻辑还可以,但腾空那一下板面和脚底脱开了好几帧,看着像漂浮。
- 2.0 版本生成:腾空过程中板面始终贴着脚底,落地时膝盖还有微微弯曲缓冲,物理一致性显著提高。
这种细节看起来不大,但用过 AI 视频的人都知道,能把"重力 + 接触 + 缓冲"三件事同时做对的模型,在国内还真没几个。莫潇羽自己测下来,跑步、游泳、骑车、打球这类基础运动,Seedance 2.0 的稳定性都达到了"不太需要重抽"的水平。
3.4 文字保持度:广告产品的硬考点
做产品广告的朋友最关心一件事:瓶身上的文字、Logo、商标会不会被模型"擦"掉或者扭成乱码?
我拿一组化妆品图片做了实测:原图瓶身上的英文非常清晰,但字体很小(像素层面接近模型采样的下限)。同样的提示词喂进去:
- 1.5 版本:远景看着没问题,一旦画面拉近,瓶身上的字母会出现"漂移"、个别字符变形。
- 2.0 版本:从中景到特写都能把瓶身上的小字保持得很稳,连印刷边缘的反光高光都能维持。
这对做电商产品视频的同学是实打实的福音。以前需要大量后期修补的细节,现在一次过的概率明显高了。
3.5 抽卡稳定性的真实手感
抽卡稳定性这件事很难量化,但你用多了就会有体感。我把"同提示词、同图、不同种子"跑了 8 次,然后人工判断每条素材的可用性:
- 完全可用:6 条
- 微调后可用:1 条
- 必须重抽:1 条
这个比例对比 1.5 时代"3 抽 1 用"的水平,已经是质的飞跃。当然,前提是你的提示词写得不太离谱 —— 写得越含糊,模型越容易自由发挥。
四、全能参考入口:四种模态混合的核心玩法
如果说首尾帧是"傻瓜模式",那全能参考就是 Seedance 2.0 真正的舞台。这一节我用篇幅最大的一块讲清楚它。
4.1 入口与界面
在视频生成页面,把入口从"首尾帧"切到"全能参考"。这时候你会看到一个明显不一样的素材区 —— 它支持上传:
- 最多 9 张图片
- 最多 3 段视频(3 段加起来总时长 ≤ 15 秒)
- 最多 3 段音频(3 段加起来总时长 ≤ 15 秒)
- 总素材数上限是 12 个
我建议新手不要一上来就把 12 个素材都填满 —— 素材越多,模型要兼顾的维度越多,提示词的复杂度也是非线性增长。先从 3 ~ 5 个素材开始练手,掌握节奏再加。
4.2 @ 符号引用语法是真正的灵魂
全能参考最关键的不是上传了多少素材,而是你怎么告诉模型每个素材的"职责"。Seedance 2.0 的解法是 @ 符号引用。
你在提示词输入框里直接打一个 @ 符号,就会自动弹出已上传素材的列表,点选就能插入引用。也可以用工具栏上的 @ 按钮唤起选择面板。引用成功后,输入框里会出现一个带颜色的标签,显示素材文件名 —— 看到这个就说明绑定成功了。
举个例子:
@图片1 作为首帧的人物形象
@图片2 作为画面的背景场景
@视频1 参考运镜方式和节奏
@音频1 用作背景音乐
人物缓慢转身微笑,微风吹动发丝,镜头平稳跟随,不变形,4K高清。
这一段提示词的结构非常清晰:每个素材都被赋予了明确角色,剩下的文字描述只负责串联。莫潇羽自己写提示词的时候有一个习惯:先把所有 @ 引用列在前面,再把动作描述放后面,模型解码起来更稳。
4.3 四种素材的优先级关系
实际生成的时候,模型并不是把四种素材"等权重"使用的。这里有一个隐性的优先级:
|
素材类型 |
在生成中的角色 |
优先级 |
|
视频参考 |
决定运镜、动作节奏、转场 |
最高 |
|
音频参考 |
决定节奏、卡点、配乐风格 |
高(节奏维度主导) |
|
图片参考 |
决定主体外观、场景质感 |
中(空间维度主导) |
|
文本提示词 |
决定整体故事走向、补充细节 |
中(剧情维度主导) |
理解这一点很重要。比如你上传了一张人物图,又上传了一段舞蹈视频,希望让"图中人物跳视频里的舞蹈"。这时候视频参考的优先级最高,图片只负责"换皮",动作骨架由视频提供。如果你写"参考图中人物的动作",反而会让模型困惑 —— 因为图是静态的,没有动作信息。正确写法应该是 "主体外观参考 @图片1,动作和运镜完全参考 @视频1"。
4.4 我的素材准备小习惯
折腾多了之后,我会在本地把每个项目的素材按"功能角色"分文件夹,结构大概长这样:
项目-小胖系列/
├── 角色/ ← 主角图,正面/侧面/半身/全身
├── 场景/ ← 不同环境的背景图
├── 运镜参考/ ← 剪到 5 秒以内的电影片段
├── 音频/ ← 音乐片段、人声片段
└── prompt.txt ← 已经验证过的提示词模板
这样做的好处是每次生成时不会到处翻文件夹。莫潇羽@源码七号站也建议你养成这个习惯 —— AI 视频创作越往后走,工程化思维越重要,散乱的素材管理会拖死你的迭代速度。
4.5 素材数量到底放多少最合适
这里有一个我反复验证过的经验值:3 ~ 5 张关键图 + 1 ~ 2 段参考视频 + 1 段音频 是最稳的搭配。原因有三:
- 留出 2 ~ 3 个文件位的余量,方便临时补图。
- 太多素材会让 @ 引用关系变复杂,提示词反而难写清楚。
- 12 个素材跑满,模型注意力会被稀释,关键素材的还原度反而下降。
五、多图串联:让图片"接龙"成连贯视频
掌握全能参考之后,第一个能立竿见影出彩的玩法就是多图串联。
5.1 它本质上在做什么
多图串联的核心机制是:你按顺序上传一组图片,模型把它们当作"画面航线上的关键位点",自动补出位点之间的过渡画面。换句话说,你给的不是首帧和尾帧,而是 一段视频的若