AI学习吧
📍 源码七号站 开源解码 从「写咒语」到「当制片人」:Seedance 2.0 Skill OS 深度拆解,一套把 AI 视频创作工业化的 Agent 操作系统

从「写咒语」到「当制片人」:Seedance 2.0 Skill OS 深度拆解,一套把 AI 视频创作工业化的 Agent 操作系统

摘要:AI视频模型越来越强,但大多数人用出来的质感上不去?问题不在模型,在工作流。本文拆解开源项目seedance-2.0,它把传统影视SOP翻译成23个Agent技能,告诉你如何从“碰运气的提示词”升级为“项目化生产”,让AI像制片人一样工作,真正拉开创作差距。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。

快速摘要

这篇文章解决一个问题:为什么 AI 视频模型一年比一年强,但大多数人用它做出来的东西,质感始终上不去?

核心结论先放在这里:问题不在模型,在工作流。 Seedance 2.0 已经把 SOTA 拉到了导演级——支持文字、图片、音频、视频四模态输入,原生 1080P,多镜头叙事自动衔接,音画同步在单次前向传播里同时完成。但 90% 的用户还在用 2024 年的方式使唤它:把所有期待塞进一句话,按下生成,碰运气,不满意就改几个形容词再来一次。真正能拉开差距的,是把"提示词"升级成"制作流程"——让 AI 像制片人那样工作,先想清楚要拍什么、给谁看、怎么拍、怎么交付,再去写服务于这个目标的提示词。 独立创作者 Emily2040 在 GitHub 上开源的 seedance-2.0 仓库——一个由 23 个子技能组成的 Agent Skill OS——做的就是这件事。

我自己折腾下来,最大的感受是:这套东西真正的价值,不是它有多少个 Skill,而是它把"AI 视频创作"从一项玄学,重新拉回到"项目管理"这条熟悉的轨道上。

想看完整拆解,往下翻。


一、AI 视频创作的真实困境:模型很强,工作流很弱

1.1 模型在以季度为单位进化,用户的姿势却停留在三年前

我自己是从 2023 年底开始追这一拨视频生成模型的。短短两年多时间,能数得出来的国产和海外 SOTA 已经换了好几茬。从最早的 Runway Gen-2,到 Pika、Sora、Veo、Kling,再到现在的 Seedance 2.0、Wan 2.6 这一批,画面质感、时长、物理合理性、音画同步几乎是按季度跳级。

但有意思的是,模型在飞速进化,用户使唤它的姿势却几乎没怎么变。

打开任何一个 AI 视频社群,最常见的求助帖永远是这几种:

  • "求大佬指点,我这条提示词怎么改才能生成更有电影感的画面?"
  • "为什么我同样的提示词,今天出来还可以,明天就崩了?"
  • "我让模型生成一个女孩在海边走路,结果第三秒她突然变成了另一张脸,怎么办?"

我把这些问题归纳成一句话:用户在用 2023 年的提示词姿势,去使唤 2026 年的模型。

什么叫 2023 年的提示词姿势?——就是那种"写一句长长的咒语,里面塞满 cinematic、ultra-detailed、8K、masterpiece,然后按下生成键,等命运的安排"的姿势。这种姿势在早期的扩散模型上还能蒙对,因为那时候模型理解力差,你扔什么进去它都生成得差不多。但是到了今天,模型已经强到可以理解"主体—动作—环境—镜头—光影—音效"分层结构的程度,再继续往里堆形容词,等于把一个法拉利当板车开。

1.2 两个被反复忽视的系统性问题

跟模型迭代速度无关,但每天都在折磨创作者的,其实是两个更底层的问题。

第一个问题:同一个模型、不同入口,规则完全不一样,信息严重孤岛。

就拿 Seedance 2.0 来说,光是字节系内部,能用到它的入口就有一大串:

  • 即梦 AI(Dreamina)的网页版和 App
  • 豆包移动端的视频生成入口
  • 小云雀(剪映生态里的创作工具)
  • 火山引擎方舟(Ark)的体验中心和正式 API
  • 海外侧的 BytePlus 平台
  • 第三方接入(比如 Runway 的 Seedance 路径、fal 等托管平台)

每个入口的限制——能上传几张参考图、单次生成的最长时长、能不能用 1080P、支不支持音频参考、灰度发放的范围、价格、区域权限——全都不一样。我有过好几次类似的经历:今天在某个网页上跑通的一个流程,第二天换一个入口,参数完全对不上,只能从头再摸一遍。

更要命的是,平台官方文档更新的节奏远远赶不上版本迭代的节奏,社区里流传的"教程"很大一部分发布的时候就已经是过时信息了。普通用户根本没办法靠自己维护一份"平台对照表"。

第二个问题:提示词玄学化,关键变量反而被淹没。

随便去搜一下"AI 视频提示词模板",你会看到铺天盖地的"通用咒语":

cinematic shot, ultra-detailed, 8K, masterpiece, best quality,
photorealistic, hyper-realistic, beautiful lighting, dramatic atmosphere...

这些词在很多人看来是"魔法咒语",但在模型 attention 的视角里,它们大多数是噪音。这些形容词没有指向任何具体的视觉特征,只是把"质感"这件事抽象成了一个语义模糊的方向标。模型在生成时不知道你要的"cinematic"是黑色电影那种低光高反差,还是新浪潮那种自然光、长镜头,还是好莱坞工业那种 ARRI Alexa 拍出来的油润色调。词越多,注意力被稀释得越严重,结果反而越不稳定。

真正决定画面一致性、运动合理性、剪辑可用度的,是那些容易被忽视的硬核参数

  • 角色绑定:通过参考图明确锁定"主角是谁",让多镜头里的同一个人不会变脸
  • 镜头语言:明确机位(高角度/低角度/平视)、景别(特写/中景/全景)、运动方式(推拉摇移、轨道、手持)
  • 运动节奏:用秒数节拍把动作切分成可控的"运动 beat",避免一个 5 秒画面里塞进 3 个动作
  • 首尾帧锁定:给定起始帧和结束帧,让中间过程变成一个"插值"问题而不是"创作"问题
  • 音画对齐:对于支持音频参考的模型,让节奏点(脚步、撞击、对白)和画面切换严格对齐

这些参数没有"cinematic"那么炫,但它们决定了你的视频能不能进剪辑台、能不能交付给客户。问题在于,绝大多数教程和社区,从来不教这些。

1.3 真正的瓶颈:缺一套可以共享的"工作流"

如果你只是个人爱好者,玩玩就行,上面这些问题忍一忍也就过去了。但如果你想把 AI 视频变成生产力——做短剧、做广告、做内容矩阵——你迟早会撞上一堵墙:没有可复用、可审计、可协作的工作流。

我自己踩过这个坑。早期我自己写了一堆"私人提示词模板",每次开新项目就翻一遍存档。但只要稍微复杂一点的项目,比如要做一个 8 镜头的短片,问题立刻冒出来:

  • 8 个镜头之间,主角的脸怎么保证一致?
  • 每个镜头之间的运镜怎么衔接?是硬切还是渐变?
  • 服装、道具、灯光的连续性怎么管理?
  • 万一中间某一镜需要重做,怎么保证不影响前后?
  • 项目交接给协作者,对方怎么快速看懂我的"私人模板"?

这些问题,每一个都对应着传统影视工业里非常成熟的解决方案——shot list(分镜表)、continuity report(连续性报告)、production bible(制作圣经)。但在 AI 视频这边,几乎没人在做这套基础设施。

这就是 seedance-2.0 这个仓库切入的点。它不发布新模型,不提供新接口,它做的是一件听起来不性感、但极其重要的事:把"AI 视频创作"这件事,重新装回"项目化生产"的轨道里。


二、Seedance 2.0 是什么:先把模型本身讲清楚

在拆解这套 Skill OS 之前,得先把 Seedance 2.0 本身讲清楚。不然你不知道这套技能包到底在伺候一个什么样的模型。

2.1 它的定位:视频生成赛道的当前 SOTA

Seedance 2.0 是字节跳动 SEED 团队在 2026 年 2 月正式发布的多模态视频生成模型。它不是字节第一代视频模型——前代是 2025 年 6 月发布的 Seedance 1.0,但 2.0 不是一次简单的参数升级,而是在架构、模态融合、物理建模、音画同步四个维度做了系统性重构。

公开的评测数据里,Seedance 2.0 在 Artificial Analysis Video Arena 上的综合 Elo 一度登顶,超过了 Google Veo 3、OpenAI Sora 2 和 Runway Gen-4.5。这个排名是动态的,所以"全球第一"这个说法本身有时效性,但它至少说明:Seedance 2.0 在当前这一档里,是经得起横向比较的。

我自己测下来的体感是:它最强的不是单帧质感(单帧上 Sora 2 和 Veo 3 也都很猛),而是在动作连续性、镜头切换、音画同步这几个"长镜头能力"上,明显比同代竞品更稳。

2.2 四模态输入:这才是"工业级"的入口

Seedance 2.0 的核心定位是多模态输入的视频生成。具体来说,它支持四种模态混合作为输入:

模态

数量上限(参考公开资料)

典型用途

文本(Text)

不限

描述场景、动作、情绪、镜头意图

图片(Image)

最多 9 张

角色一致性、风格参考、首尾帧、构图参考

视频(Video)

最多 3 段

运动参考、运镜参考、节奏参考

音频(Audio)

最多 3 段

对白、节奏点、环境音参考

这里要重点说一下"四模态"为什么重要。

以前的视频模型,绝大多数只接受"文字"或者"文字+一张图"。这种入口设计有个根本性的缺陷:你无法精确表达"我想要的运动是什么样的"。 你可以说"她跑过去然后回头",但模型不知道这个跑步的步频、节奏、回头的力度。如果你能扔进去一段参考视频,模型就能直接学到运动 pattern,这是文字怎么写都替代不了的。

音频参考也一样。比如你做一段武打戏,需要刀剑碰撞的节奏点和画面里的动作严格对齐——这种事用文字描述根本不可能,但用一段参考音频,模型就能知道在第 2.1 秒发出第一次碰撞、第 3.4 秒发出第二次。

这就是"工业级"和"玩具级"的本质差别。

2.3 原生 1080P 与音画同步:两个被低估的细节

2026 年 4 月,Seedance 2.0 正式支持了 1080P 全高清生成。这件事比表面看上去更重要。

很多人以为"超分一下不就行了",但超分和原生 1080P 是两回事。超分本质上是在拿一个 720P 的画面去猜更高分辨率的细节,猜得再准也是猜,皮肤纹理、布料质感、光影层次这些"高频信息"经不起放大。原生 1080P 意味着模型在 1080P 这个分辨率下直接构建画面,每一个像素都是"算"出来的,而不是"猜"出来的。

对于真人剧、漫改、广告这些下游场景,原生 1080P 的素材可以直接进入剪辑链路,省掉一整套二次超分的成本和质量损失。

另一个被低估的细节是音画同步。Seedance 2.0 的架构里有一个核心创新叫 Dual-Branch Diffusion Transformer(DB-DiT),简单理解就是:画面和声音不是分两步生成再拼起来,而是在同一次前向传播里同时算出来的。

这件事的意义在于:以前那种"先出画面,再做对口型,再加音效"的两步式流水线,永远存在时序漂移的问题。脚步声和脚踩在地上的画面差几帧,对白和嘴型差几帧——这些差异肉眼看着不明显,但观感会感觉"哪里怪怪的"。而 DB-DiT 这种联合生成的架构,从根上把这个问题摁住了。

2.4 它不是开源模型,这点必须先讲清楚

有一个细节必须澄清,避免后面理解 Skill OS 的时候搞混:Seedance 2.0 本身不是开源模型。

它是字节跳动 SEED 团队的商业专有技术,模型权重不对外公开,本地也跑不了(按它的体量推算,推理需要 H100/A100 级别的集群)。要用到它,路径只有几条:

  1. 即梦 AI / 豆包:消费级入口,网页或 App,按积分计费
  2. 火山引擎方舟(Ark):企业级入口,提供正式 API(模型 ID 为 doubao-seedance-2-0-260128
  3. BytePlus:面向海外市场的同源 API 服务
  4. 第三方托管:Runway 的 Seedance 路径、fal 等也接了

每条路径的能力边界、价格、配额、地域限制都不一样。这就是为什么 Emily2040 的 Skill OS 要专门维护一份"平台矩阵"参考文档——光是搞清楚"我现在用的这个入口能做什么、不能做什么"就需要一份持续更新的资料。

2.5 它能做什么:六种典型生成任务

Seedance 2.0 支持的生成任务可以分成下面这几类。后面拆解 Skill 模块的时候会反复用到这些术语,先把它们摆在这里:

  • T2V(Text-to-Video)文生视频:纯文字提示词生成视频,最经典的形态
  • I2V(Image-to-Video)图生视频:以一张图作为首帧(或锚点),生成后续动画
  • V2V(Video-to-Video)视频生视频:以一段参考视频作为运动/风格参考,生成新视频
  • R2V(Reference-to-Video)参考生视频:以图、视频、音频混合作为参考,控制角色、风格、运动、节奏
  • 首尾帧锁定(First/Last Frame):给定起始帧和结束帧,让模型"补全"中间过程
  • 音频感知生成(Audio-aware):以音频作为节奏锚点,画面切换、动作点严格跟音频对齐

这六种任务,每一种都对应着不同的提示词写法、参考素材组织方式和后处理流程。Skill OS 做的事情,本质上就是为每一种任务都准备好一份"标准作业指导书",让 Agent 知道在不同任务下应该怎么走流程。


三、为什么"提示词工程师"要开始像制片人思考

仓库首页上有一句标语:Direct the model. Don't micro-manage the frame. 直译过来是"指导模型,别去逐帧微调"。这句话在我看来,是这套 Skill OS 整个哲学的浓缩。

为了讲清楚这句话的份量,我得先聊一下"提示词工程师"这个职业在过去两年里走过的弯路。

3.1 "咒语派"的黄昏

2023 年左右,"提示词工程师"刚出现的时候,主流派别是"咒语派"。那个时候的玩法是:

  • 收集各种"魔法关键词"(hyperrealistic、cinematic、award-winning、trending on artstation……)
  • 拼成一长串"咒语"
  • 在不同模型之间复用同一套咒语,比较效果
  • 把跑通的咒语整理成"提示词模板"在社群里售卖

这种玩法在 2024 年还能挣到钱。但从 2025 年开始就越来越没用了。原因很简单:模型的语言理解能力越来越强,越来越能识别"这段提示词里哪些是噪音"。 当模型变聪明之后,堆砌形容词带来的收益几乎归零,甚至变成负收益——因为多余的形容词会拖累注意力分配。

到了 2026 年这个时间点,单纯依赖"魔法咒语"的提示词工程师,基本已经没有竞争力了。

3.2 "微调派"的瓶颈

第二个派别我叫它"微调派"。代表特征是:

  • 把一条提示词改了又改,每改一个词就重新生成一次
  • 试图通过提示词控制画面里每一个细节(光从哪边来、人物站在画面什么位置、第几秒做什么动作)
  • 不满意就再加约束词,再不满意就加更多约束词

这种姿势的瓶颈也很明显:视频生成模型是一个高度非线性的系统,你越想精确控制每一帧,它越容易在别的地方失控。 比如你拼命强调"光从左边打过来",模型可能为了满足这个约束,把人物的姿态搞崩了。

微调派的工作方式,本质上是在和模型"硬掰"。你掰得越用力,模型反弹得越厉害。

3.3 "制片人派"是怎么想的

seedance-2.0 这套 Skill OS 推动的,是第三种姿势——"制片人派"。这套姿势的核心信条只有一条:

别去逐帧微调。先想清楚你要拍的是什么,再去指导模型做这件事。

这听起来像废话,但落到实操层面,它意味着工作流的全面重组。我自己的实操体验是,"制片人姿势"和"咒语姿势"的差异,体现在下面这几个层面:

第一,先做"创意 brief",再写提示词。

传统咒语姿势:上来就写提示词。

制片人姿势:先回答几个问题——这条视频要解决什么需求?给谁看?要传达什么情绪?有没有参考素材可以用?有什么硬约束(时长、画幅、是否需要对白)?只有这些回答清楚了,才开始写提示词。

第二,先做"素材角色分配",再调用模型。

传统咒语姿势:把所有图都扔进去,希望模型自己看懂。

制片人姿势:每一张图、每一段视频、每一段音频,都明确分配一个"角色"——这张图是身份参考(用来锁定主角的脸),那张图是环境参考(用来锁定场景的色调),那段视频是运动参考(用来学习走路的姿态),那段音频是节奏参考(用来对齐镜头切换)。分配清楚了,模型才知道每个素材该怎么用。

第三,先做"镜头合同",再生成。

传统咒语姿势:在提示词里塞一句"电影感运镜"。

制片人姿势:明确写出"shot contract"——这是什么景别(特写/中景/全景),机位在哪里(高角度/低角度/平视),运动方式是什么(推/拉/摇/移/手持/轨道),运动节奏怎样(前 2 秒慢推,后 3 秒固定)。这套"合同"和模型签好了,画面才不会失控。

第四,先做"安全等价",再交付。

传统咒语姿势:用了某个 IP,发现被拦截,就换一个词再试,反复试探。

制片人姿势:在创作初期就做"权利地图",把所有受版权保护的元素(角色、品牌、名人、歌曲)替换成"安全等价表达"——保留创意功能,但去除法律风险。这件事不是事后补救,而是事前规划。

第五,每一次失败的生成,都进入"诊断流程"。

传统咒语姿势:失败了就改提示词重来。

制片人姿势:失败了先做诊断——是相机问题?是灯光问题?是运动问题?是角色绑定的问题?是时长太短?是构图冲突?是被安全策略拦截?找到一个变量,改一个变量,再试。 这才是工程化的迭代姿势。

3.4 从"个人手艺"到"团队 SOP"

把这五条姿势串起来看,你会发现:这已经不是一个"提示词工程师"的工作方式,而是一个小型制作公司的工作方式。

传统影视行业里有一整套早就跑通的 SOP:导演定方向,DP 管影像,制片管资源,剪辑师管节奏,调色师管色彩,声音团队管声场,本地化团队管市场,质检团队管交付。这套分工不是行业里某个人拍脑袋发明的,是几十年试错沉淀下来的"最佳实践"。

seedance-2.0 仓库做的事情,本质上是把这套传统影视的 SOP,翻译成 AI 视频时代的 Agent Skill。 让 AI 在不同的工作阶段,自动切换到对应的"岗位人格",按那个岗位的标准产出物去工作。

我自己用下来的体感是:当你不再把自己当成"魔法师",而是当成"项目经理"的时候,整个生产效率会上一个台阶。 因为你不再把希望寄托在"碰运气"上,而是把每一次失败都纳入"工程化迭代"的轨道。


四、Skill OS 的核心哲学:先有"生产对象",再有"提示词"

第三节讲了"制片人姿势"是什么。这一节讲一下这套姿势在 seedance-2.0 仓库里是怎么落地的。

4.1 一个被反复强调的反直觉原则

仓库里有一条原则被反复提到。我把它翻译成更白话的版本:

每个岗位产出的第一行,永远不是"提示词",而是"生产对象"。提示词只是那个生产对象的副产品。

这条原则在第一次读到的时候,反直觉得让我愣了一下。因为按我们过去的理解,"提示词工程师"的核心交付物就应该是提示词。

但 Emily2040 把这件事颠倒过来了。她说:你不是一个"写提示词的人",你是一个"产出导演笔记 / 镜头合同 / 调色意图 / 声音地图 / 交付清单"的人。提示词只是这些产出物在喂给模型时的"语言形态"。

这个颠倒非常关键。它的实操意义是:

当你被问"你做了什么"的时候,你不应该回答"我写了一条提示词",你应该回答"我交付了一份镜头合同 + 配套的 Seedance 提示词"。

这两种回答的区别在于:

  • 前者只交付了一段文字,团队没法复用、没法迭代、没法审计
  • 后者交付了一份结构化的"制作文档",文档里包含了所有的决策依据,提示词只是文档在某一个模型上的"实现"

如果有一天模型从 Seedance 2.0 换成了 Seedance 3.0,甚至换成了别家的模型,那份"镜头合同"依然有效,只需要重新写一遍提示词去匹配新模型就行了。

这就是"生产对象"和"提示词"的本质差别——生产对象是知识产权,提示词只是一次性消耗品。

4.2 从用户输入到提示词的四段流程

seedance-2.0 把"从模糊想法到可执行提示词"这件事,拆成了四个清晰的阶段:

flowchart LR
    A[用户的模糊想法] --> B[创意 brief]
    B --> C[素材角色分配]
    C --> D[生产对象]
    D --> E[Seedance 提示词]
    E --> F[生成结果]
    F --> G{满意?}
    G -->|否| H[诊断流程]
    H --> D
    G -->|是| I[交付]

我用一个具体的例子把这四个阶段串一下。

场景:用户说"我想做一个关于咖啡的短视频,氛围温暖一点。"

阶段一:创意 brief(由 seedance-interview 这个 Skill 主导)

Agent 不会立刻去写提示词,而是先问几个关键问题:

  • 这个短视频用在哪里?(朋友圈?小红书?官网?广告投放?)
  • 时长大概多长?(5 秒?10 秒?15 秒?)
  • 主角是什么?(一杯咖啡?一个喝咖啡的人?一个咖啡馆场景?)
  • 有没有参考素材?(你心目中的"温暖"长什么样?)
  • 有没有硬约束?(必须出现某个品牌?必须避开某些元素?)

只有把这些问题都问清楚,才进入下一阶段。

阶段二:素材角色分配(由 seedance-pipeline 这个 Skill 主导)

假设用户给了三张图:一张是手冲咖啡的特写、一张是咖啡馆的木质桌面、一张是从窗户洒进来的晨光。Agent 会给每张图分配明确的角色:

素材

角色

在提示词里的作用

手冲咖啡特写

主体参考

锁定主体的形态和质感

木质桌面

环境参考

锁定场景色调和材质

窗户晨光

光照参考

锁定主光源的方向和色温

这种"角色化"的素材管理方式,是和传统咒语姿势最大的区别之一。

阶段三:生产对象(由 seedance-camera、seedance-motion、seedance-lighting 等多个子 Skill 协作)

Agent 输出一份结构化的"镜头合同",长这样:

镜头合同 / Shot 01

景别:中近景(Medium Close-Up)
机位:略低于桌面,平视主体
运动:缓慢推近(约 0-3 秒),到 3 秒后固定
焦点:手冲壶的水流落入滤杯的瞬间
光影:右上方主光(暖色温 3200K),左侧补光(柔光)
节奏:5 秒,前 3 秒推进 + 后 2 秒静止特写
情绪:宁静、专注、温暖
音效(可选):水流声 + 远处隐约的对话声
锁定项:桌面材质 / 杯子的位置 / 光源方向 / 主体身份

注意:这份"镜头合同"本身是给人看的,不是给模型看的。 它的价值在于让创作者、协作者、审查者都能在同一份文档上对齐认知。

阶段四:Seedance 提示词(由 seedance-prompt 这个 Skill 主导)

最后,把上面那份"镜头合同"翻译成喂给 Seedance 2.0 的提示词。这一步反而是最简单的——因为所有的决策都已经在前面的阶段做完了,提示词只是把决策"翻译"成模型能听懂的语言。

而且,仓库特别强调一个原则:最终的提示词必须在平台的"提示词预算"内,删掉所有 filler(多余的形容词)。 这是对"咒语派"的彻底反叛——能用 30 个词说清楚的事情,绝不用 100 个词。

4.3 提示词的"长版"和"短版"

seedance-2.0 里有一个很务实的设计:每个 Skill 都有一个"长版"和一个"短版"。比如:

  • seedance-interview 是完整的导演访谈(适合从零开始的项目)
  • seedance-interview-short 是压缩版(30-100 字,适合用户已经想得差不多了)
  • seedance-prompt 是完整的提示词构建(适合复杂场景)
  • seedance-prompt-short 是压缩版(30-100 字,适合简单场景)

这个设计背后的智慧是:真实的创作场景里,并不是每一个项目都需要走完完整 SOP 的。 有些项目用户脑子里已经很清楚了,硬塞一套访谈流程反而是浪费时间。Agent 需要有判断力,根据用户的成熟度选择合适粒度的流程。

我个人用下来的体感是:"短版"的使用频率反而更高。 因为大多数日常生成需求其实没那么复杂,"长版"主要是给真正的项目化生产准备的。

4.4 "参考资料库"不是装饰,是事实来源

仓库里还有一个 references/ 目录,存放了各种参考文档:

  • 工作流(workflow)
  • 首尾帧指南(first/last frame guide)
  • 重拍协议(retake protocol)
  • 模型机制(model mechanics)
  • API 状态(API status)
  • 平台矩阵(platform matrix)
  • 模型命名(model naming)
  • 社区方法论(community methodology)
  • 多语言示例(multilingual examples)
  • 专业制片标准(professional production standards)
  • 镜头清单连续性(shot list continuity)
  • 交付与质检(delivery & QC)
  • Agent 兼容性(agent compatibility)

这些文档不是"可选读物"。它们是 Skill 在运行时会主动读取、交叉引用的"事实来源"。

为什么这件事重要?因为模型本身的知识是有截止日期的——Agent 不知道 Seedance 2.0 今天最新的 1080P 配额是多少、不知道哪几个 IP 最近被字节内部加了黑名单、不知道某个 API 端点上周改了路径。这些动态信息,必须靠"外置的参考资料库"来维护。

这也是 Skill OS 比"内置提示词模板"更有生命力的根本原因——模板是死的,参考资料库是活的。


五、八大岗位映射:把传统影视团队装进 Agent 的 SOP

这一节我们看看 seedance-2.0 是怎么把传统影视团队的分工"翻译"到 Agent 工作流里的。我自己第一次看到这张映射表的时候,最大的感受是:这套设计的作者一定是真在剧组待过的人。 普通的"提示词工程师"是写不出这种细节的。

5.1 八个岗位、八种产出物

仓库里有一张核心映射表。我把它整理成下面这种更直观的形式,每个岗位除了角色名,还标出了"它的产出物里第一行写的是什么"——这一点是上一节的"生产对象优先"原则在岗位层面的具体体现。

[导演 Director]
├── 处理稿(treatment)
├── 场景节拍(beats)
├── 表演意图(performance intent)
├── 覆盖镜头(coverage)
├── 镜头端点(shot endpoints)
└── 审查笔记(review notes)

[摄影指导 DP]
├── 镜头合同(shot contract)
├── 景别(shot size)
├── 镜头感(lens feel)
├── 机位支撑(camera support)
├── 运动(movement)
├── 演员走位(blocking)
└── 灯光连续性(lighting continuity)

[制片 / 代理公司]
├── 客户简报(client brief)
├── 权利地图(rights map)
├── 审批闸门(approval gates)
├── Campaign 变体(campaign variants)
├── 风险日志(risk log)
└── 审查包(review package)

[剪辑师]
├── 选片计划(selection plan)
├── 编辑 / 扩展决策(edit / extend decisions)
├── 连续性交接(continuity handoff)
├── 时间线把手(timeline handles)
├── 无文本素材需求(textless asset needs)
└── 套底笔记(conform notes)

[调色师]
├── 色彩意图(color intent)
├── ACES 感知交接(ACES-aware handoff)
├── 展示风格笔记(display style notes)
├── HDR/SDR 警告(HDR/SDR warnings)
└── 产品色彩检查(product color check)

[声音团队]
├── 对白地图(dialogue map)
├── 环境音 / 音效 / 音乐分层(ambience/SFX/music layers)
├── 同步线索(sync cues)
├── 分轨输出(stems)
├── M&E(Music & Effects 分轨)
├── 配音要求(VO requirements)
└── 响度要求(loudness requirements)

[本地化团队]
├── 字幕(subtitles)
├── SDH 字幕(SDH captions)
├── 强制叙事(forced narratives)
├── 配音指南(dubbing guide)
├── 市场文案(market copy)
└── 无文本素材(textless assets)

[交付 / 质检]
├── 帧率(frame rate)
├── 画幅比(aspect ratio)
├── 裁切(crops)
├── 色彩(color)
├── 响度(loudness)
├── 字幕(subtitles)
├── 元数据(metadata)
├── 命名规范(naming conventions)
└── 人工质检清单(QC checklist)

把这张表读完一遍,我有几个直观的感受。

5.2 第一个感受:粒度细到反常识

普通人对"做一条 AI 视频"的理解,可能就是"写提示词 → 生成 → 满意/不满意"。但你看看上面这张表里调色师那一栏:色彩意图、ACES 感知交接、展示风格笔记、HDR/SDR 警告、产品色彩检查……

这里面的每一项都是传统影视工业里非常专业的细分领域。比如 ACES(Academy Color Encoding System)是好莱坞工业的色彩标准,HDR/SDR 是高动态范围和标准动态范围的差别,"产品色彩检查"是广告片里特别重要的环节(你做了一个可乐广告,结果可乐变成了暗红色,客户直接拒收)。

普通用户根本想不到这些。 但如果你做的是商业项目,这些就是绕不开的。

仓库把这些细节列出来,不是为了让你每次都走完所有项,而是为了让 Agent 在面对一个真正商业级的需求时,知道有哪些"专业关卡"必须打通。它扮演的是一个"提醒清单"的角色。

5.3 第二个感受:它假设你迟早要走向"团队协作"

第二个让我印象深刻的细节是"剪辑师"那栏里的"无文本素材需求"和"本地化团队"那栏里的"无文本素材"。

这两项的意思是:你最终生成的视频,最好同时有一份"无字幕、无 logo、无文本"的纯净版本,因为下游剪辑师和本地化团队在做不同市场的版本时,会需要把字幕换成不同语言、把 logo 换成不同品牌。如果你在生成阶段就把这些"硬"在画面里,下游就没法处理了。

这个细节非常体现"工业化"思维——你做的不只是"一条视频",你做的是"一份可被复用的素材"。

仓库默认你迟早会从"个人创作"走向"团队协作",从"一次交付"走向"多版本派生",所以从一开始就把这些"后路"留好。

5.4 第三个感受:合规和版权被当成"独立岗位"

特别值得说一下的是"制片 / 代理公司"这一栏里的"权利地图(rights map)"和"风险日志(risk log)"。

seedance-2.0 把版权和合规当成了"独立的工作产物",而不是"事后补救的应急措施"。这一点和大多数 AI 视频工具的玩法完全相反。

大多数工具的玩法是:生成 → 被拦截 → 改提示词 → 再生成 → 再被拦截。这种事后试探的姿势既低效,又有合规风险(万一某次"试探"成功了,反而暴露了平台的安全漏洞)。

seedance-2.0 的姿势是:事前规划权利地图,把所有受版权保护的元素(IP、品牌、名人、歌曲)列出来,提前做"安全等价替换"。 比如客户想要"哈利波特风格的魔法世界",安全等价的写法可能是"一个有古典学院氛围、带魔法元素的奇幻世界,主角是穿着深色长袍的少年学者"。保留创意功能,去除法律风险。

这种思路在专门做商业项目的人眼里,是必须的。但在大多数业余玩家眼里,是"麻烦"。

仓库把它做成默认流程,意味着 Emily2040 写这套东西的时候,目标用户根本不是业余玩家,而是真的在做商业项目的独立创作者和小型工作室。


六、十几个 Skill 模块拆解:每个模块解决一个具体痛点

仓库的 skills/ 目录下有 20 多个子 Skill。我把它们按用途分组拆解一下,这样能更直观地看出这套 OS 在解决什么问题。

6.1 入口层:访谈和提

🔒
🔒 该内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
注册用户
注册用户
可见 70%
社区精英
社区精英
可见 100%
社区守护
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥9.9
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布0 篇
文章总数1247 篇
昨日发布3 篇
本月发布22 篇
建站时间383 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站长微语

联系站长

微信:165255185
AIGC 技术社区
致力于解码 AI前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码
友情推荐