本文由 莫潇羽@源码七号站(www.fuyuan7.com)原创,转载请注明出处。
快速摘要
核心结论先说清楚,往下看有更详细的拆解。
【2026 年 7 月更新】 本文写于 Seedance 3.0 传闻发酵期。截至更新时,字节实际推出的是 Seedance 2.5(6 月 23 日火山引擎 Force 大会公布,7 月初上线,单条 30 秒、支持 50 个全模态参考素材),同期 Seedance 2.0 升级支持原生 4K。文中关于 3.0 的内容请作为当时的社区传闻记录阅读。榜单方面,Seedance 2.0 的 Elo 1269 登顶为 2 月数据,后续排名已有变化。
一、Seedance 系列前传:两年磨一剑的进化路径
要真正理解 Seedance 3.0 的意义,必须先搞清楚这个系列是怎么走到今天的。字节跳动内部的大模型研究部门——Seed 团队,早在 2023 年便悄悄启动了视频生成模型的原型研究,那时候这个项目还没有正式的产品名,内部代号更接近于一个实验性探索项目。初代原型主打文本转视频(T2V),但彼时的生成效果存在明显的动作僵硬、时序断裂、画质低等问题,因此仅用于内部测试与小范围验证,并未对外公开。
这一测,就是将近两年时间。
2025 年初,吴永辉博士——前 Google Fellow、曾深度参与 Gemini 大模型开发——加入字节跳动并接掌 Seed 团队,直接向 CEO 梁汝波汇报。这一人事变动成为 Seedance 系列正式提速的信号。公开资料显示,Seed 团队规模上千人,在字节内部享有极高的资源优先级,连隐退多年的创始人张一鸣也会定期参与核心技术团队的复盘会,被外界认为是当下字节「最愿意长期投入的技术部门」。
2025 年 6 月,字节跳动正式推出面向 C 端用户的旗舰 AI 视频生成模型,命名为 Seedance 1.0(即梦平台对应「视频 3.0」)。Seedance 1.0 Lite 定位轻量,走性价比路线;紧随其后发布的 Seedance 1.0 Pro(即梦视频 3.0 Pro)则专注于更高质量的生成表现,支持原生 1080P 输出,在运镜流畅度、物理动作合理性等维度上已经让不少评测者眼前一亮。
2025 年末至 2026 年初,Seedance 1.5 Pro 短暂过渡,主要是在一致性和生成速度上做了增量优化。这个版本存在时间较短,但它奠定了 2.0 在架构层面最终成型的基础。
2026 年 2 月 7 日,Seedance 2.0 在即梦、豆包、小云雀等字节系产品中悄然开启小范围内测。上线不到 48 小时,X(原推特)、抖音、微博等平台便被 AI 生成的视频刷屏——格斗动作、广告大片、历史穿越剧……几乎你能想到的创作场景,它全都接住了。《黑神话:悟空》制作人冯骥公开评价其为「当前地表最强的视频生成模型,没有之一」,并直言「AIGC 的童年时代结束了」。2 月 9 日,#Seedance 2.0# 话题冲上微博热搜;2 月 12 日,字节官方正式宣布 Seedance 2.0 全量发布,接入豆包 App、即梦 App 及火山方舟体验中心。
这是这一系列产品的前半段故事。而现在,随着 Seedance 3.0 的内测消息在社区中持续发酵,新的故事正在开始。
二、Seedance 2.0 的技术底座:彻底理解这个「导演模型」
在进入 3.0 的分析之前,我们需要把 2.0 的技术内核讲透,因为 3.0 的所有传闻升级方向,都是在 2.0 已有架构之上的延伸与突破。
2.1 核心架构:双分支扩散变换器(DB-DiT)
Seedance 2.0 的标志性架构创新是 Dual-Branch Diffusion Transformer(DB-DiT,双分支扩散变换器),这也是它能解决市面上大多数 AI 视频工具「先生成静音视频、再叠加音轨」的两步流水线问题的根本所在。
传统的视频生成模型本质上是图像生成模型的时序扩展,它先在空间维度生成每一帧的像素内容,然后通过时序建模让各帧之间保持连贯。音频则往往是事后处理的附属品。这种分离式设计导致了一个让创作者头疼的问题:画面和声音经常无法真正「咬合」,口型对不上、音效时机错位,只能靠后期剪辑来强行弥合。
DB-DiT 彻底改变了这一逻辑。它在单次前向传播过程中同步输出画面与声音,让模型从「看到场景」和「听到声音」两条独立分支中各自提取信息,然后通过跨分支注意力机制(Cross-Branch Attention)在语义层面实现音画的深度对齐。简单来说,模型在推理时同时「想」两件事:这个画面里发生了什么,以及此刻应该发出什么声音。两者之间不是线性的主从关系,而是并行推理后的联合输出。
这套架构在实践中的效果是:人物说话时口型高度自然,打斗场景中的拳击声、落地声与动作帧精确同步,环境音效(风声、水声、机械运转声)会随着画面内容自动生成,不需要创作者单独去找音效素材。
2.2 多模态联合训练与稀疏架构
Seedance 2.0 采用了极致的稀疏架构(Sparse Architecture)来提升训练和推理效率。在模型涌现出强大泛化能力的背后,是基于统一的多模态视频生成框架进行的联合训练——文本、图像、音频、视频四种模态的数据在同一训练流程中被统一处理,而不是分别训练四个独立的专家模型再拼在一起。
这一设计带来了几个在之前版本中难以实现的能力:
其一是跨模态语义理解。当用户同时上传一张角色图、一段参考视频和一段音频时,模型需要同时理解「这个人长什么样」「这段视频里的镜头语言是什么风格」「这个音频的节奏和情绪是什么」,并把三者融合成一个统一的生成指令。这需要模型在嵌入空间中对不同模态的信息进行对齐——类似于你同时看一张图、听一首歌,脑海中自然生成画面的那种多感官协同能力。
其二是世界物理规律的内化。在大量真实世界视频数据的训练下,模型对重力、流体、刚体碰撞等物理规律形成了一定程度的隐式建模能力。这解释了为什么 Seedance 2.0 生成的水花溅射、布料飘动、人物奔跑都比之前的版本「合理」——模型本质上在每次推理时都在「预测」现实世界的物理演化,而不是单纯地「生成好看的像素」。
其三是字节内容数据飞轮的护城河。字节跳动拥有抖音、TikTok 构建起来的全球最大短视频内容生态,这意味着 Seedance 的训练数据在「什么样的镜头语言能打动人」这个维度上,积累了其他竞争者几乎无法复制的规模优势。理解「什么样的视频好看」,本身就是 Seedance 系列持续领先的核心护城河之一。
2.3 多镜头叙事引擎(Multi-Shot Narrative Engine)
这是让很多创作者直呼「颠覆」的能力。在 Seedance 2.0 之前,AI 视频工具本质上只能生成一个连续镜头——你给一段描述,它生成 4-15 秒的单镜头片段,如果你想要多个不同角度的镜头,只能多次单独生成再手动拼接。
Seedance 2.0 的多镜头叙事引擎允许你在单个提示词中描述完整的剧情走向,模型会自动规划出合理的分镜序列,并在每个分镜之间保持角色形象、视觉风格、光照环境的高度一致性。整个 15 秒的片段中,可能包含从全景到特写的景别切换、从跟拍到固定机位的运镜变化,全部由模型「自导自演」完成。
这背后的技术逻辑是模型在训练阶段大量接触了专业影视素材,时间层(Temporal Layer)已经内化了「什么样的叙事节奏应该配什么样的运镜」这套隐性规则。用户只需要提供剧情描述,模型就能自动生成堪比专业导演规划的分镜方案。
2.4 多模态参考输入:重新定义「提示词」
如果说旧时代的 AI 视频工具是「你写作文,它来配画」,那 Seedance 2.0 就是「你当导演,它来拍摄」。
系统支持同时输入最多 9 张图片 + 3 段视频(总时长不超过 15 秒)+ 3 段音频(总时长不超过 15 秒),混合上传文件上限 12 个。用户可以用图片定角色外形、用视频指定运镜风格和动作参考、用音频确定节奏氛围,加上自然语言文字描述,把创意意图以最精准的方式传达给模型。
这套「参考万物」的能力之所以有效,在于模型能从参考视频中解耦出「运镜轨迹」(即每帧的虚拟摄像机位移和旋转参数),然后将这条轨迹映射到全新的场景内容上。从角色图像中,模型提取一组高维特征向量作为「角色身份锚点」,在整个生成过程中确保形象稳定不漂移。
值得特别提及的是「分镜脚本参考」这个相对冷门但极其强大的用法。用户可以直接上传一张手绘或制作好的分镜脚本图(包含多个格子,每格写有简要描述),Seedance 2.0 能够阅读这张图的内容,理解每一格的场景意图,并将其转化为对应的视频分镜。这个功能对于习惯手绘草图规划内容的创作者,或者在制片公司工作的专业用户来说,提供了极大的便利——你可以直接用你最熟悉的工作方式(画分镜)来驱动 AI 创作,而不需要把所有东西翻译成文字提示词。
在官方公布的对标测试(SeedVideoBench-2.0)中,Seedance 2.0 在运动稳定性、指令遵循、音画同步三个维度上大幅领先 OpenAI 的 Sora 2 Pro、快手可灵 3.0 等产品,但官方同时坦承在细节稳定性、拟真度以及多人口型匹配等方面仍有优化空间,这几个痛点也恰好是 3.0 最需要重点攻克的方向。
三、Seedance 3.0 内测传闻深度解析
截至笔者(莫潇羽@源码七号站)撰文时,关于 Seedance 3.0 的信息尚未得到字节跳动官方的任何正式确认,目前流传于社区的内容主要来自参与极小范围内测的创作者泄露以及业内人士的推测分析。以下内容严格区分「有据可查的消息」与「合理推测」,请读者结合判断。
3.1 已知的泄露信息
在 Weibo、知乎、国内外 AI 社区等平台流传的内测信息中,Seedance 3.0 被描述为「AI 视频的终极核弹」,核心爆点集中在以下几个方向:
一、无限连续生成与叙事记忆(Narrative Memory)。 这是目前讨论最热烈的方向。据参与内测的用户描述,3.0 版本通过引入一种名为「叙事记忆」的机制,实现了单次生成 10 分钟以上的连续视频,内测阶段据称已达到 18 分钟无明显崩坏。这与 2.0 最长 15 秒/单次生成的限制相比,是量级上的跃升。
二、更强的多语言口型同步。 2.0 已经支持 8 种以上语言的口型对齐,但在实际测试中,中英文以外的语言精度仍有参差。3.0 据称在多语言口型同步方面有系统性升级,推测与训练数据的多语种扩充和对应的音素-口型映射模型的精细化有关。
三、生成分辨率进一步提升。 2.0 在 2026 年 4 月底已经实现原生 1080P 输出,3.0 的传闻指向 2K 甚至 4K 原生生成能力,但这一点目前可信度较低,4K 视频生成的算力消耗将是巨大的工程挑战。
四、更完善的视频编辑能力。 目前 2.0 支持基础的视频延长(每次最多 15 秒),3.0 据称将支持对视频中特定片段、特定角色的精准替换与修改,类似于「非线性编辑的 AI 化」——不只是「接着拍」,而是能「改已有的内容」。
3.2 叙事记忆机制:技术逻辑推演
「叙事记忆」这个概念是理解 3.0 最核心的技术突破点,也是目前社区讨论最多的方向。我(莫潇羽)在这里做一个基于技术原理的深度推演,帮助大家理解它究竟意味着什么,以及它为什么难做。
Seedance 2.0 的单次生成上限是 15 秒。如果想做更长的视频,创作者需要手动进行「接力生成」——把上一段视频作为参考素材上传,指示模型继续接着拍。这个方法可行,但存在一个严重问题:每次新的生成都是独立的推理过程,模型没有「记忆」上一段视频里发生了什么,只能通过参考视频的最后几帧来尝试保持连贯性。当接力次数超过 3-4 次,质量衰减就会变得明显——角色的表情微变了,背景的光照方向不一样了,道具的位置发生了漂移。
这本质上是一个上下文窗口(Context Window)问题。在文本语言模型中,这个问题已经通过不断扩大上下文长度来缓解。但在视频生成中,一帧 1080P 的视频本身就携带海量的像素信息,简单地把所有历史帧都塞入上下文是不现实的——算力和存储成本会指数级膨胀。
Seedance 3.0 的「叙事记忆」机制推测采用了类似以下的技术路径:
压缩式历史表征(Compressed Historical Representation)。 将已生成的历史视频内容压缩为一组高维语义向量,这些向量不保存每一帧的像素信息,而是保存关键的叙事元素——角色形象特征、当前场景的空间结构、已经建立的动作动量、时间轴上的叙事进度。类比于人类在看长视频时,你并不需要记住每一帧画面,但你能记住「前面发生了什么」、「主角现在在哪里」、「接下来剧情该怎么走」。
传统接力生成的信息流:
[段1 最后帧像素] → 推理 → 生成段2
Narrative Memory 推测架构:
[段1 语义摘要向量] + [全局角色锚点] + [场景拓扑] + [叙事进度指针]
↓
联合上下文
↓
推理生成段 N
全局一致性锚点(Global Consistency Anchor)。 在开始整个长视频的生成之前,模型先提取「导演意图摘要」——包括角色的外形特征锚点(高维人脸/身体特征向量)、整体美术风格向量、世界观设定(光照环境、色调基调、物理规律参数)。这些全局锚点在整个生成过程中保持固定,从而确保即便视频已经生成到第 10 分钟,角色依然不会「漂移」成另一个人。
叙事因果链(Narrative Causality Chain)。 3.0 可能会引入对叙事逻辑的显式建模,而不只是依赖像素层面的连贯性。例如,如果模型在第 3 分钟「记录」了主角受伤,那么在后续生成中,它应该能够「知道」主角的行动会有所受限——这涉及到场景级别的时序因果推理,是一个相当深的技术挑战。
3.3 长视频生成的工程挑战
把以上技术做出来并不容易,莫潇羽这里需要给大家说清楚其中的工程难度,这样才能理解为什么 3.0 还在内测而不是直接发布。这些挑战并非字节跳动一家独有,而是整个行业在迈向「长视频 AI 生成」这个方向时必须共同面对的技术天花板。
算力成本是第一道门槛。 生成一段 15 秒的 1080P 视频,Seedance 2.0 API 的消耗约合人民币 15 元(约 1 元/秒)。如果 3.0 要支持 10 分钟的连续生成,即便做了大量推理优化,算力消耗也将是一个相当可观的数字。字节跳动在 2025 年已经将资本开支中约 900 亿元用于 AI 算力采购,但算力的绝对量并不等于推理效率——如何设计更高效的推理框架,让每一个 FLOP 都发挥最大作用,才是工程团队真正的战场。业内预测,3.0 如果要在可接受的成本范围内实现 10 分钟以上的生成,需要在模型推理路径上至少做到 5-10 倍的效率提升,这不是堆算力能解决的问题,必须在算法和系统层面同步突破。
质量稳定性是第二道门槛。 在长视频生成中,模型的随机性会随着时间积累产生「误差累积」效应——越到后面的帧,偏离原始意图的概率越高。在 2.0 的手动接力生成场景中,连续延长 3 次以上就会开始出现明显的角色漂移、光照不一致等问题。3.0 的叙事记忆机制能压制这种漂移到什么程度,是衡量其工程成熟度的核心指标。从内测信息来看,18 分钟无崩坏已经是一个相当惊人的成绩,但这是否是在特定简单场景下测出来的最优情况,还是能在复杂多角色叙事场景中稳定复现,仍需要更多验证。
内容安全机制的升级是第三道门槛,也是在国内落地时特别需要关注的一点。 Seedance 2.0 已经因为真实感过强引发了版权争议和深度伪造担忧,字节在平台层面做了活体认证、真人人脸限制等一系列安全措施。3.0 支持长达 10-18 分钟的视频生成,其潜在的滥用场景将更加多元和复杂——从虚假新闻视频到侵权影视内容,都可能借助更强的生成能力进一步放大。因此字节在技术测试的同时,一定也在同步打磨内容检测、水印溯源、生成记录审计等安全基础设施,这些工作量可能并不比模型本身的研发小。
多语言口型同步的精度难题是第四道门槛。 2.0 的口型同步技术在中英文场景下表现不错,但换到日语、韩语、西班牙语等语言时,精度会有明显下滑。原因在于不同语言的音素(语音的基本单元)与口型动作的映射关系差异很大:英语是字母拼读语言,音素到口型的映射相对规则;而普通话是声调语言,同一个音节在四个声调下的口型肌肉运动是不同的;日语的拍节结构又完全不同于前两者。3.0 如果要真正实现「多语言口型同步」的完整能力,需要为每种主要语言分别建立精细的音素-口型映射模型,这是一个数据和工程量都相当大的任务。
3.4 版本节奏推测:3.0 什么时候来?
参考 Seedance 系列此前的迭代节奏——2.0 于 2026 年 2 月 7 日开启内测,2 月 12 日正式发布,内测到公测的窗口约为 5 天。但 3.0 的技术复杂度远高于 2.0,其工程实现的难度也更大,因此「极速内测→快速发布」的路径可能不再适用。
当前业内的普遍判断是:3.0 大概率在 2026 年 Q3(7—9 月)完成全量发布,更激进的预测认为 Q2 末(6 月前后)可能会看到受邀用户层面的小范围开放。当然,这些都只是基于历史节奏的推测,实际情况以官方公告为准。
四、底层技术原理深度拆解:为什么 Seedance 能做到这些
这一章面向想彻底搞懂技术原理的读者,如果你是纯粹的实操用户,可以跳过本章直接看第五章。
4.1 扩散模型(Diffusion Model)的视频化应用
要理解 Seedance 的技术路径,首先要搞懂它所基于的核心范式——扩散模型。
扩散模型的工作原理,直观来说是一个「从噪声中恢复信号」的过程。训练阶段,模型学习如何把真实图像/视频一步步加噪声变成纯随机噪声,以及如何把这个过程反过来——从纯随机噪声出发,一步步去除噪声,最终恢复出一张图像。推理(生成)阶段,模型就从一张随机噪声开始,按照学到的去噪轨迹,在用户提示词的条件引导下,逐步「雕刻」出符合描述的视频内容。
把这套方法从图像扩展到视频,核心挑战在于时序一致性——每一帧不能独立去噪,必须保证相邻帧之间的连贯性。早期的视频扩散模型(如 Stable Video Diffusion)通过在帧间引入额外的时序注意力层来解决这个问题,但受限于计算复杂度,通常只能生成很短的片段。
DiT(Diffusion Transformer)架构将扩散模型的骨干网络从 U-Net 替换为 Transformer,利用注意力机制对帧间关系进行全局建模,使得模型能够处理更长的时序依赖。Seedance 2.0 在此基础上进一步演进为 DB-DiT(Dual-Branch),在模型内部将视频信息分解为「空间语义」和「时序动态」两条处理通路,分别建模「每帧画面内容」和「帧间如何变化」,最终在输出层重新融合。
4.2 条件引导机制:多模态是怎么「喂」给模型的
当用户上传一张图片、一段视频、一段音频,同时输入文字描述,模型如何把这四种不同模态的信息统一为一个生成指令?
答案是统一嵌入空间(Unified Embedding Space)。每种模态的信息都通过对应的编码器(图像用 CLIP/ViT,音频用专门的音频编码器,文本用语言模型的编码器)转换为固定维度的向量,然后通过一个多模态对齐层,将不同模态的向量投影到同一个语义空间中。
在这个统一空间里,「一个穿红衣服的女性正在奔跑」的文字描述,和「一张穿红衣服女性的图片」,以及「一段奔跑的视频」,在向量空间中应该是相互邻近的——它们描述的是同一种语义概念。模型在推理时,以这个统一的语义向量作为条件,引导扩散过程朝正确的方向去噪。
用户上传的参考视频中的「运镜风格」是如何被提取的?这涉及到光流(Optical Flow)估计和相机姿态估计(Camera Pose Estimation):模型从参考视频的连续帧中计算每个像素的运动方向和速度(光流),进而推算出虚拟摄像机的运动轨迹(平移、旋转、焦距变化),最终把这个摄像机运动参数序列作为额外的条件向量注入生成过程中,让新生成的视频「复刻」相同的运镜风格。
4.3 物理世界建模:AI 为什么越来越「合理」
Seedance 2.0 相比前代模型,在物理合理性上的提升让很多用户印象深刻——衣服飘动的褶皱更真实,水花溅射的物理轨迹更符合直觉,人物在地面行走时重心的转移更自然。
这背后并没有一套显式的「物理引擎」——模型不是在运行牛顿力学方程,而是通过大量真实世界视频的训练,隐式地内化了物理规律。这类似于一个孩子从来没有学过流体力学,但看了大量水流的画面之后,能够画出看起来符合物理的水流图案。
有研究者认为,这种能力实际上是 AI 视频模型迈向通用世界模型(World Model)的早期信号——模型开始「理解」现实世界的运作规律,而不只是「复制」表面的像素模式。Seedance 3.0 如果真的能实现长达 18 分钟的连续生成,那么对于场景物理一致性(比如光照随时间的自然变化、物体的持续运动与交互)的建模要求将大幅提升,这也是 3.0 在技术上最难攻克的方向之一。
4.4 3.0 可能的架构演进方向
基于以上技术背景,莫潇羽这里对 3.0 的架构演进方向做几个合理推测:
方向一:流式自回归生成(Streaming Autoregressive Generation)。 与扩散模型的整体去噪生成不同,自回归方式是一帧一帧地顺序生成,每次生成当前帧时都能「看到」前面所有帧的内容。结合高效的 KV-Cache(键值缓存)机制,这种方式在理论上可以实现无限长度的视频生成。代价是单帧的生成质量可能略低于扩散模型,但吞吐效率更高,更适合工业级批量生产场景。
方向二:混合架构(Hybrid Architecture)。 短片段(高质量关键帧/关键镜头)继续用扩散模型生成,中间过渡段用轻量级的自回归填充,「叙事记忆」模块负责在两者之间传递全局一致性信息。这种混合方案在工程实现上更灵活,但对模型的融合设计要求很高。
方向三:世界模型与视频生成的深度融合。 3.0 可能不再是纯粹的「视频生成模型」,而是一个内置了更深层世界物理知识和叙事常识的「视频世界模型」。它不只生成视频,还能在内部建模一个持续演化的「虚拟世界」,视频只是这个世界在某个时间段的「录像」。这是 AGI 研究方向上的重要探索,如果 3.0 真的往这个方向走,其意义将远超视频生成工具本身。
五、即梦 AI 完整实操指南:从零到出片
理论说够了,现在进入最重要的实操环节。这一部分以目前已公开的 Seedance 2.0 为操作基础,讲清楚如何在即梦 AI 上从零开始做出满意的 AI 视频。等 3.0 正式发布后,核心操作逻辑基本一致,只是能力边界会更大。
5.1 进入平台:找到你的入口
网页端入口: 打开浏览器,访问即梦 AI 官网 jimeng.jianying.com,使用抖音账号登录。登录后点击「视频生成」,选择 Seedance 2.0 模型即可开始使用。
移动端入口: 在手机上下载「即梦 AI」App 或「豆包」App,登录后在视频生成功能中选择对应模型。移动端目前支持「出镜」功能(需完成真人校验),适合想把自己形象带入 AI 视频的用户。
企业/开发者入口: 通过火山引擎(volcengine.com)申请 Seedance 2.0 API 权限,支持将视频生成能力集成到自有系统中,采用 token 计费方式,生成一段 15 秒视频约消耗 30.888 万 tokens。
关于会员和积分:网页端目前 Seedance 2.0 为会员专属功能,非会员每天有少量免费生成次数。即梦会员分多档,最基础的连续包月方案约每月数十元起。如果只是想体验而不想付费,可以先在豆包 App 或小云雀平台试用(小云雀每日签到赠送积分,用完当天清零)。
5.2 两种核心模式的选择逻辑
打开即梦的视频生成界面,你会看到两个主要的创作入口:首尾帧模式和全能参考模式。选哪个,取决于你手头的素材情况:
首尾帧模式:适合素材简单的快速出片场景。 当你只有一张首帧图(或者同时有首帧+尾帧)加上文字描述时,走这个入口。模型会以你提供的图作为视频的起始画面,按照提示词生成后续的动态内容。这是最快的使用路径,从上传图片到生成完成,整个流程不超过 5 分钟(不含排队等待时间)。
全能参考模式:适合对效果有精确控制需求的专业场景。 当你有多张图片(角色、场景、服装等参考图)、参考视频(运镜风格、动作参考)或音频素材时,走全能参考。这个模式的创作自由度最大,也最接近「导演式指挥」的使用体验,但对提示词的要求也相对更高。
一个简单的判断原则:素材只有一张图加文字,走首尾帧;超过一张图,或者有视频、音频参与,走全能参考。
5.3 素材准备的正确姿势
在上传素材之前,建议先在本地建好文件夹,按功能角色分类管理:
项目名/
├── 角色/ ← 人物参考图(正面、侧面、特写)
├── 场景/ ← 环境风格图、背景参考
├── 运镜参考/ ← 参考视频片段(提前剪到 15 秒以内)
├── 音频/ ← 配乐、音效、口播参考音频
└── 提示词草稿.txt ← 提前写好的 prompt
关于素材质量的几个关键要点,在实际操作中往往被忽略:
角色参考图尽量用正面高清图,避免侧脸、遮挡、强烈的光影变形。清晰的正脸图能帮助模型建立更稳定的「角色身份锚点」,后续跨镜头的一致性会好很多。
运镜参考视频不需要用长素材。如果你找到的参考视频有 30 秒,截取其中你最想复刻的那段 3-5 秒就够了——越短的参考序列,模型的注意力计算信噪比越高,参考精度反而更好。
音频参考如果是你想复刻节奏风格的音乐,也建议截取具有代表性的段落(前奏或高潮部分),而不是把完整的 5 分钟音乐全部上传。
素材数量不是越多越好。12 个文件的上限是物理限制,但实际上 4-6 个素材往往比 12 个效果更好,因为太多素材会分散模型的注意力,导致每个参考都只被「浅尝」一下,而不是深度参考。
5.4 提示词工程:让模型真正听懂你
Seedance 2.0 对自然语言的理解能力已经相当强,但这不意味着「怎么说都行」。以下是莫潇羽总结的高效提示词写法框架:
基础公式:主体 +