本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
如果你只想花三十秒拿到结论,这里是全部要点:Agnes Video 2.5 视频模型(注意是视频模型,跟写代码的文本模型 Agnes 2.5-Flash 是两条产品线)已经接入国内可用的 Pavo 创作平台,免费 Flash 档支持 720p、4到12 秒、3RPM,标准版写稿时每天赠送 200 积分(约合 100 秒视频量),配合首尾帧生成、节点画布和主体资产,能大幅缓解"抽卡贵、角色变脸、推倒重来"三大痛点;Agent 模式还能把一句话故事自动拆成剧本、分镜和镜头。但注意两条红线:其一,所有价格、额度、速率都是写稿时的快照,随时会变,以官方页面为准;其二,AI 生成的视频在国内平台发布必须按规定主动标注"AI 生成",带货场景要求更严,别省这一步。
想看完整拆解——免费档的具体规则、画布工作流怎么搭、短剧从故事到成片的每一步怎么走、以及国内发布要躲的坑,往下翻。
我自己折腾 AI 视频有一阵子了,从最早的文生视频"一句话出片"开始玩,到后来慢慢明白一个道理:单条视频的效果早就不是瓶颈了,真正卡人的是三件套——生成成本、角色一致性、还有一整套工作流。你刷到的那些炫技短片,背后是别人成百上千次抽卡堆出来的,到你上手的时候,钱包和耐心先顶不住了。
最近圈子里讨论比较多的一件事,是 Agnes Video 2.5 视频模型接进了 Pavo 创作平台,其中 Flash 档位直接免费开放,标准版每天还给固定积分。消息出来后我立刻去平台上把免费档、积分档、画布、Agent 模式挨个摸了一遍,顺手把《人工智能生成合成内容标识办法》的相关要求也核对了一遍。这篇文章就是我这一轮完整实操的记录,从模型到底什么水平,到免费额度怎么用,再到一条短剧怎么从一句话走到成片,最后是国内发布的合规要点,全部摊开讲。
一、做一条 AI 视频,卡住普通人的到底是什么
先别急着看模型参数,得先把"卡点"说清楚,不然后面的工具都是空谈。我观察下来的结论是:单条视频的惊艳程度,早就不稀缺了。真正让普通创作者做不下去的,是另外三件事。
生成成本。 视频模型的计价方式普遍按秒算,一条 10 秒的镜头看着短,可一个镜头从来不是一次生成的。你得调提示词、换构图、试风格,一个镜头的满意率能到三成就算手气不错。这意味着一条 30 秒的短片,背后可能是几十次生成。按市场主流模型的公开价格粗略估算,几十次试错下来的花费,对个人创作者来说是实打实的负担。很多人的创作热情,就死在这个"每生成一次都肉疼"的阶段。
角色一致性。 短剧和叙事短片里,观众必须相信第 3 秒出场的主角和第 30 秒坐在桌边的主角是同一个人。但文生视频模型天然有随机性,同一段提示词跑十次,脸、发型、衣服颜色可能每次都不一样。过去解决这个问题的土办法是"疯狂抽卡直到撞出同款",效率极低;进阶一点的办法是固定参考图,但又面临参考图本身风格漂移的问题。一句话:一致性没解决,短剧就无从谈起。
工作流是碎的。 剧本在文档里,角色图在图库 App 里,生成的镜头散落在十几个文件夹里,改了第 5 个镜头,第 6、7、8 个镜头要不要跟着改?全凭脑子记。工具之间切来切去,每切一次都要重新"解释上下文",这个过程消耗的精力,比生成本身还多。
把这三件事摆在一起看,不同创作路线的差异就很直观了。我做了一张表,把常见路线拉出来对比:
|
路线 |
单镜头成本感受 |
角色一致性 |
工作流完整度 |
适合谁 |
|
传统实拍加后期 |
高,一次成型成本集中 |
天然一致 |
依赖团队分工 |
有设备有团队的内容组 |
|
纯文生视频盲抽 |
中高,试错次数多 |
差,靠运气 |
碎,全靠自己整理 |
做单条炫技短片的尝鲜玩家 |
|
参考图加关键帧 |
中,仍需多次试错 |
中,视参考图质量而定 |
中,需要外部工具配合 |
有一定经验的进阶玩家 |
|
首尾帧加节点画布加主体资产 |
低,免费档探路加积分出片 |
好,资产锁定形象 |
完整,全流程在一个环境内 |
想做连续叙事和短剧的个人创作者 |
这张表不是要论证哪条路线"正确",而是想说明:过去那条"文生视频盲抽"的路,对短剧这种连续叙事形态来说,从一开始就是错配的。短剧需要的不是"偶尔能出神片",而是"每条镜头都在及格线以上、且前后接得上"。
理解了这三个卡点,再去看 Agnes Video 2.5 这轮更新,很多东西就顺理成章了:免费 Flash 档对应的是成本问题,主体资产和首尾帧对应的是一致性问题,无限画布和 Agent 模式对应的是工作流问题。它是冲着这三个卡点来的,而不是单纯秀一条更炫的模型。
二、Agnes Video 2.5 视频模型是什么来头:用榜单与价格看懂模型档位
先交代一件容易看混的事:Agnes 系列里有一款文本模型叫 Agnes 2.5-Flash,专攻写代码和推理,跟视频生成没关系;本文通篇讲的"Flash 档位",指的是视频模型 Agnes Video 2.5(预览期对外叫 Agnes-Video-2.5-Preview)里的免费档。名字里都带"2.5"和"Flash",产品线却是两条,看到相关新闻时先确认说的是哪个。
判断一个视频模型处于什么档位,我的习惯是看两类公开信息:盲测榜单的成绩,和官方 API 定价。前者说明"水平",后者说明"厂商自己觉得值多少"。两者一拼,模型定位就清楚了。
盲测榜单是怎么打分的
先科普一下 AA 榜单(Artificial Analysis 的 Video Arena)的机制,不然分数就是天书。它的做法是:用户提交一个提示词,系统同时用两个匿名模型生成视频,用户不知道自己看到的是哪家模型,纯粹凭观感选一个更好的。投票结果按 Elo 积分制累计——这个 Elo 就是国际象棋那套等级分算法,赢的加分、输的扣分,对手越强赢一场加得越多。因为用户看不到模型名字,刷榜的动机就小了很多,分数相对可信。
榜单地址是 artificialanalysis.ai/video/leaderboard/text-to-video,想查实时排名的朋友可以直接去看,比我在这里贴任何一张截图都新。
此前公开评测中流传较广的一组数据是:Agnes Video 在 AA 盲测里的 Elo 从 2.0 版本的 917 涨到了 2.5 版本的 1082。这里说明一句:这组具体数字我未能在官方渠道找到原始出处,属于第三方评测文章的转述,只能当参考量级看,准确值以榜单页面实时数据为准。这个数字怎么看?给两个参照系就明白了:写稿时榜单头部模型(可灵、即梦 Seedance 这类国内厂商的旗舰,以及海外几家大厂的旗舰)的 Elo 普遍在 1200 到 1300 区间,而 1060 到 1080 这个位置站着一批"实用型"模型。说白了,1082 分意味着它已经从"尝鲜玩具"跨进了"能拿来干活"的区间,但离头部旗舰还有一档差距。60 分左右的 Elo 差距,在两两对决里大约对应 58% 到 59% 的胜率,这个换算关系可以帮你理解分数之间差多少才算"真差距"。
细分项成绩更能说明问题
总分之外,VBench 这类细分评测的公开数据也值得看。写稿时能查到的一组参考数据:Agnes-video-2.5 预览版在 VBench 综合得分约 59.94 分,作为参照的头部模型同榜单约 63 分出头。差距不大,但有两个细分项很关键:运镜一致性得分 52.72,超过了对标模型;物理规律表现约 78.82,接近头部水平。
这两个数字背后是实际体验的差异:运镜一致性好,意味着"缓慢推近""低角度环绕"这类镜头术语能被执行到位,且运动过程中主体不容易崩;物理表现过关,意味着水、烟、尘、碰撞这些特效场景不会一眼假。对短剧来说,这两项比画质参数重要得多——观众对"人物在动但背景在飘"的容忍度,比对"分辨率不够高"低得多。
顺带提一句合规问题:Agnes 系列模型属于境外团队开发的服务,相关信息我以公开资料和榜单数据为准做科普性质介绍,各位使用时请遵守国内网络与内容管理相关规定,以官方渠道和境内平台的接入方式为准。下面要讲的 Pavo 平台就是境内可访问的创作入口,模型能力通过平台层提供给用户。至于 Pavo 平台自身的数据存储位置、数据合规安排等细节,也请以平台官方说明为准,本文不作任何背书。
价格表比广告词诚实
Agnes Video 2.5 官方文档公开的 API 计费规则,写稿时大致如下:
|
输出规格 |
单价 |
|
720P 视频 |
0.025 美元 / 秒 |
|
960P 视频 |
0.040 美元 / 秒 |
|
2K 视频 |
0.055 美元 / 秒 |
|
输入图片第 6 张起 |
0.005 美元 / 张 |
|
Flash 档 720P |
0 美元(免费) |
前 5 张输入图不收费,输入视频时长也不单独计费。按 720P 档算,一分钟成片大约 1.5 美元,这也是不少评测文章里被反复引用的"每分钟参考价"。把它放到市场里横向看:不少同档次商业模型的价格在这个数字的两倍以上,而免费 Flash 档直接把试错成本清零。这也是为什么这轮更新在创作圈子里引起讨论——成本结构变了。
当然,AI 视频行业的价格和免费政策变动非常快,上面这些数字是写稿时的近似行情,模型档位、免费额度随时可能调整,请以官方定价页面和平台后台的实时数据为准。
把榜单和价格放在一起,Agnes Video 2.5 的定位就出来了:它不是"最猛的旗舰",而是"够用水平里最便宜的那一档"。这个定位对个人创作者反而友好——旗舰虽强,用不起也白搭;实用档加免费探路,才谈得上持续创作。
三、免费档 Flash 的规则逐条拆开:白用额度有多大
免费的东西,规则往往藏在细节里。这里再钉一次钉子:本章的 Flash 是视频模型 Agnes Video 2.5 的免费档,不是文本模型 Agnes 2.5-Flash。我把 Pavo 平台上这个视频 Flash 档的免费规则逐条实测了一遍,按"输入、画质、时长、速率"四个方面整理成表,省得你自己去翻公告:
|
项目 |
免费 Flash 档规则(写稿时口径) |
|
图片输入 |
单次可传 5 张以内参考图(首帧、尾帧、参考图都算) |
|
音频输入 |
支持,可配合口型与节奏参考 |
|
分辨率 |
720p |
|
单次时长 |
4 到 12 秒 |
|
速率 |
3 RPM(每分钟 3 次请求) |
|
费用 |
0 元 |
几个容易被忽略的细节值得单独说。
五张图的上限,用在哪很讲究。 首尾帧各占一张是常规用法;剩下的三张可以塞人物参考、道具参考、风格参考。注意是"单次请求"的限额,不是账号总限额,所以每次生成的输入组合可以重新搭配。
4到12秒的时长区间,对分镜设计有影响。 12 秒在短视频分镜里已经算"长镜头"了,足够一个完整动作或一次情绪转折。我的做法是优先按 6 到 8 秒设计镜头,因为 Flash 档是快速验证工具,镜头越短,验证点越单一,翻车时越容易定位问题。
3RPM 的速率限制,决定了 Flash 的用法。 每分钟 3 次,一小时理论上 180 次。听起来不多,但对"验证型"任务完全够用——验证提示词方向、验证构图、验证风格,每次生成之间本来就要留出思考和调整的时间。反过来说,它不适合拿来直接渲染成片素材,那会卡在速率上。免费档的正确定位是"探路",不是"跑量"。
用一段伪代码把免费档的使用策略写清楚,比啰嗦一百个字直观:
循环(每天创作时段):
1. 拿到一个新分镜需求
2. 用 Flash 免费档生成第一版,720p、8秒以内
3. 检查三个问题:
- 主体有没有崩?(脸、手、肢体)
- 运镜是否符合分镜意图?
- 首尾帧衔接是否自然?
4. 如果都不崩 → 记录提示词与种子 → 标记"可升档出片"
5. 如果崩 → 只改一个变量(提示词/参考图/时长),回到第 2 步
6. 同一镜头失败超过 6 次 → 说明分镜本身有问题,回改分镜
这套流程的核心思想就一句:免费档的意义不是"零成本出片",而是把"该不该继续投入"这个判断的成本降到零。一个镜头用免费档跑 6 次发现方向不对,省下的是标准档 6 次生成的额度。
顺带说明,Flash 与标准版是同一代模型体系下的两个档位,画质上限不同,但提示词习惯、首尾帧逻辑、参考图用法是相通的。也就是说,你在免费档上练出来的手感,直接可以平移到标准档,不存在"换了档位就重新学"的问题。
一次完整的免费档实测记录
光讲规则太干,我把自己某天下午用 Flash 免费档做的实测记录贴出来,原样呈现验证节奏。当天任务是为一个"雪夜山道"场景确认三个分镜方案,工具是 Flash 免费档,总耗时约四十分钟:
|
时间 |
动作 |
结果 |
判断 |
|
14:05 |
分镜 A 首版,提示词"巡线员踏雪穿过山道" |
动作自然,但背景枯枝变形 |
保留方向,待微调 |
|
14:12 |
分镜 A 第二版,补一句"背景树枝保持静止" |
树枝正常,人物行走轻微瞬移 |
时长从 8 秒降到 6 秒再试 |
|
14:19 |
分镜 A 第三版,6 秒 |
整体稳定 |
标记升档候选 |
|
14:25 |
分镜 B 首版,提示词"他停步抬头看路标" |
人物站位偏左,构图失衡 |
改用首尾帧模式,首帧接分镜 A 尾帧 |
|
14:33 |
分镜 B 第二版,首尾帧 |
衔接顺畅,构图正确 |
标记升档候选 |
|
14:38 |
分镜 C 首版,提示词"雪花从松枝滑落特写" |
雪花形态像塑料屑 |
放弃该分镜,改成分镜 D"雪打在肩头" |
|
14:44 |
分镜 D 首版 |
可用 |
标记升档候选 |
四十分钟里跑完七个镜头版本,零花费,两个分镜直接确认、一个分镜被推翻重设计。如果这段验证放在计费档做,同样的试错量对应的开销会非常具体。这就是免费档对创作节奏的真实意义——它买回的是"大胆试错"的心态。
四、标准版与每日积分的组合打法:免费探路、积分出片
Flash 免费,标准版不免费,写稿时 Pavo 平台显示每天给用户赠送 200 体验积分。这里得先把话说在前面:200 积分、每秒 2 积分这两个具体数字,我在公开渠道没有找到官方公告出处,属于写稿时平台内的展示口径,无法交叉验证,不同账号、不同时段看到的数值可能有出入。按照写稿时口径,200 积分每天约等于 100 秒标准档视频。100 秒是什么概念?一个常规短视频节奏的短剧片段,每镜 5 到 8 秒,100 秒能出 12 到 20 个镜头,够一条完整小短片的成片素材了。
两个档位怎么分工,先看对比表:
|
对比项 |
Flash 免费档 |
标准版(每日积分) |
|
单次费用 |
0 元 |
消耗积分(写稿时约 2 积分/秒) |
|
每日可用量 |
受 3RPM 速率限制 |
200 积分,约 100 秒 |
|
分辨率 |
720p |
更高画质输出 |
|
适合阶段 |
构图、提示词、风格验证 |
成片镜头渲染 |
|
用完以后 |
一直可用 |
当日积分耗尽需等次日或另购额度 |
这套组合的真实价值在于"把不确定性留在免费档,把确定性留给积分档"。具体流程我写成这样:
标准创作日流程:
上午:梳理当日要推进的分镜清单(按优先级排序)
逐镜头执行:
1. Flash 免费档:跑首版 → 调提示词 → 最多试到第 5 版
2. 检查"升档标准":
- 主体稳定、动作自然、衔接顺畅
- 构图与景别符合分镜表
3. 达标 → 标准版用积分渲染 1 次,作为候选成片
4. 积分渲染结果不满意 → 不要立刻重渲
先回 Flash 免费档微调,第二天积分刷新后再渲
收工前:把当日积分使用情况记在分镜表里,避免超支
有个心态问题值得说:积分档的每一次渲染,都应该是"有依据的下注",而不是"再赌一把"。我见过不少朋友拿到积分就连续渲同一个镜头五六次,积分烧完发现还不如第一版。正确的做法是,免费档把方案收敛到"只剩最后一两个不确定点"时,积分才出手。
关于积分的获取与消耗规则,不同时期的官方活动会有变化——比如新用户赠送、连续登录奖励、任务积分这些,写稿时平台口径是每日赠送 200,但额度、消耗单价、活动规则都可能调整,请以 Pavo 平台个人中心与官方公告的实时数据为准,别把这篇旧文里的数字当成长期承诺。
如果对画质有更高要求,标准版之上还有更高的输出规格,但消耗也随之增加,个人创作者按需选择即可,没必要盲目追最高档。
五、无限画布:节点化工作流怎么拆掉返工地狱
单个镜头生成得再好,也架不住"几十个镜头连成片"时的混乱。素材散落、人物跑偏、改了开头要重做结尾——这些才是短剧创作的真实日常。Pavo 的无限画布想解决的,就是这个问题。
先弄懂"节点"这个词
"节点"听起来像黑话,其实很好理解:把创作过程中的每一个产物——一段剧本文字、一张角色图、一个视频镜头——都当成一块"积木",这块积木就叫节点。节点之间可以连线,连线代表"谁基于谁生成"。画布就是摆积木的桌面,无限大,随便摆。
举个例子:你先在画布上放一个"角色设定"文本节点,基于它生成"角色立绘"图片节点,再基于立绘生成"角色动态视频"节点。三个节点连成一条线,哪个环节想改,就从这个节点往下重新生成,上游不动。
画布上的工作流长什么样
一张 Mermaid 图把典型短剧画布工作流画出来:
flowchart LR
A[故事梗概] --> B[剧本大纲]
B --> C[角色设定文本]
C --> D[角色立绘图]
D --> E[场景设定图]
E --> F[分镜1 首帧图]
E --> G[分镜2 首帧图]
F --> H[分镜1 尾帧图]
G --> I[分镜2 尾帧图]
F & H --> J[镜头1 视频]
G & I --> K[镜头2 视频]
D --> J
D --> K
J --> L[成片拼接]
K --> L
留意一个细节:D[角色立绘图] 同时连向 J 和 K 两个视频节点。这表示两个镜头都引用同一张角色立绘做参考——一致性就是靠这种"共享上游"实现的,而不是每个镜头重新描述一遍角色长相。
线性工作流和节点画布的差别
传统做法是一条流水线:剧本写完,生成角色图存文件夹;分镜画完,挨个生成视频存另一个文件夹;发现第 5 个镜头角色脸崩了,回头重新抽卡,第 6、7、8 镜全废。节点画布的做法是树状结构:每个镜头都是从公共资产节点长出来的分支,一条分支废了,剪掉重新长,其余分支不受影响。
|
场景 |
线性工作流 |
节点画布 |
|
修改单个镜头 |
局部重做,但要手动排查前后镜头是否受影响 |
只重做该节点及下游,上游资产不动 |
|
角色形象微调 |
全部镜头挨个检查、部分重做 |
改角色资产节点,下游镜头重新生成即可 |
|
多版本对比 |
文件命名加 v1、v2,靠记忆管理 |
不同版本作为并列节点保留在画布上 |
|
素材交接 |
导出打包,靠文件夹结构传达上下文 |
画布本身就是上下文,点开就能继续 |
|
中途换方向 |
前期成果基本作废 |
从任意上游节点拉出新的分支 |
我拿一个通用化的例子说明实际操作过程。假设做一支两分钟短片,讲"暴雪过后巡线员重启山顶信号塔,让山下小镇恢复联络"这类设定。我会先在画布上定四个主体资产:巡线员(角色)、工具包(道具)、雪中山道(场景)、信号塔(核心场景)。然后按剧情拆成六七个画面:雪停、出发、登山、检修、重启、信号恢复。每个画面先在画布上生成静态图,相邻两张静态图分别作为首帧和尾帧交给视频模型补中间动作。六七个镜头全部连在画布上,哪条镜头不满意就单独重跑那条,已经跑好的镜头完全不动。
这个流程里最爽的时刻是"局部返工":结尾想加一个"指示灯逐盏亮起"的细节,不需要从第一个镜头开始重做,只需要从"检修"节点之后拉出一条新分支,把结尾展开成两个镜头。前面五个镜头的成果原封不动。对比传统做法"推倒重来",这种局部手术式的迭代,才是把完整作品真正做出来的底气。
画布上的分支管理习惯
画布用久了会变"密恐现场",节点一多,管理就成了新问题。我给自己定了三条规矩:
- 一条主线永远在最上方。 把最终要用的镜头按顺序排在一条横线上,实验性的分支全部往下拉。主线干净,导出时不会漏镜、错序。
- 废弃分支不删,只降级。 跑废的版本保留在画布底部区域,标上"废"字。它们有时是宝贵参考——某次失败的分镜,过两天换个思路可能就是新片子的起点。
- 每天收工前拍一张画布截图。 画布是云端保存的,但截图是给自己看的"当日进展照片",方便第二天快速找回上下文,也方便回顾自己的决策轨迹。
这三条习惯看起来琐碎,实际是防止"画布反而变成新的文件夹地狱"的关键。工具的灵活性是双刃剑,没有管理习惯的人,会在一片无限大的画布上迷路。
(3D 导演台这类辅助功能也是画布体系的延伸,可以在生成前对人物站位、机位做预演,减少纯提示词的随机性。功能细节以平台实际版本为准。)
六、主体资产:让同一个角色跨镜头不变脸
画布解决"流程"问题,一致性则要靠"主体资产"这个机制。简单说:把一个角色的形象、一个道具的外观、一个场景的风格,固化成平台上可重复引用的资产,后续每个镜头都从这个资产出发生成,而不是每次用文字重新描述。
资产为什么要"固化"
设想你写了这样一段提示词:"深蓝工装、头戴黄色安全帽、背着工具包的巡线员"。你每次生成都复制粘贴这段话,理论上应该长一样吧?不会。模型的随机性会让第二版的脸型、工装色号、帽子样式全都不一样。文字描述是"近似约束",而资产是把某个已确定的形象"锁定"下来——后续生成直接引用这个锁定对象,随机性被压到最低。
这个原理和"参考图"类似,但比参考图更进一步:资产是存在平台上的、带名字的、可被所有后续步骤共享的对象,而不是每次手动上传一张图。
资产清单怎么列
动手做短片前,我习惯先拉一张资产清单,把"哪些东西必须跨镜头保持一致"列出来:
|
资产类型 |
例子 |
关键属性 |
跨镜头出现频率 |
|
主角 |
巡线员、教师、摊主 |
发型、脸型、服装颜色款式、标志性道具 |
几乎每镜 |
|
配角 |
门卫、同事、老住户 |
体型、年龄段、着装 |
部分镜头 |
|
关键道具 |
工具包、信物、旧相机 |
形状、颜色、磨损细节 |
剧情线索镜头 |
|
核心场景 |
山道、信号塔、老宅 |
建筑风格、光线时段、陈设 |
反复出现 |
|
风格基准 |
皮克斯风、水墨风、赛博风 |
整体色调、渲染质感 |
全片 |
建资产时几个要点,我一条条列出来:
- 一张定稿图胜过十段描述。 先集中火力把角色的定稿立绘做好——正面、干净背景、全身或半身——再以它作为资产源,别拿一张角度刁钻、光线复杂的剧照当资产,后续生成会被它的瑕疵带偏。
- 服装道具宁可简单。 复杂花纹、大量配饰会降低后续生成的稳定性。外套一个纯色加一个标志性细节(比如胸前口袋),比满身图案好控制得多。
- 给每个资产起固定名字。 角色叫"老周"还是"阿凯"不重要,重要的是全片统一。后续提示词里统一用名字引用,别一会儿"男主"一会儿"他"。
- 场景资产固定光线时段。 同一场景如果一会儿白天一会儿晚上,观众会出戏。要么固定时段,要么明确做成两个资产(山道·晴天、山道·雪夜)。
- 资产是可以更新的。 片子做到一半想给角色换件衣服,直接改资产再让下游镜头重新生成,比逐个镜头手改快得多。
一致性检验小技巧
资产建好后,怎么确认一致性达标?我的土办法是"同框测试":把两个不同镜头的成片帧并排截图,遮住背景只看人物,问自己三个问题——脸是同一个人吗?衣服是同一套吗?标志性道具在吗?三问全过,才算过关。这个检查虽然原始,但比任何自动评分都管用,因为观众就是用这套标准看出戏不出戏的。
主体资产加上首尾帧,一致性这条线才算完整:资产管"长得像不像",首尾帧管"动得对不对"。
七、首尾帧生成:把开盲盒变成可控拼接
"首尾帧生成"是我这一轮实测里最愿意反复用的能力。它的逻辑很朴素:你给模型两张静态图,一张作为镜头开始、一张作为镜头结束,模型负责补出中间的运动过程。结果就是从 A 状态"可控地"过渡到 B 状态,而不是让模型自由发挥。
为什么它比纯提示词可控
纯提示词生成像是"你说要一个苹果,模型给你一个随机品种的苹果";首尾帧生成像是"你把苹果和苹果派各拍一张照片,模型演示这颗苹果怎么变成派"。起点和终点被钉死了,模型自由发挥的空间只剩中间的运动方式,失控概率天然就低。
这个机制对分镜衔接尤其好用。上一镜的最后一帧画面,拿来做下一镜的首帧;下一镜的关键动作完成态,画出来做尾帧。镜头与镜头之间从"硬切"变成了"连续递进",叙事节奏顺滑很多。
首尾帧设计的分镜表
我给自己定了一张分镜表模板,每个镜头开跑之前先填完,能省掉大量无效生成:
|
分镜编号 |
画面内容 |
首帧来源 |
尾帧内容 |
机位与运镜 |
时长 |
|
S03 |
巡线员踏雪穿过山道 |
沿用 S02 尾帧 |
他停在塔基前摘下工具包 |
跟拍中景,轻微推近 |
8 秒 |
|
S04 |
开锁进塔到检查配电箱 |
沿用 S03 尾帧 |
箱门打开,指示灯灭 |
固定机位正打 |
6 秒 |
|
S05 |
抬头看塔顶的检修点 |
沿用 S04 尾帧 |
他戴上头灯向上看 |
仰角,缓慢推近 |
6 秒 |
填这张表时盯住两件事:一是"首帧来源"尽量写"沿用上一镜尾帧",让全片首尾相接;二是同一场戏里机位别乱跳,跳轴会让观众懵。
生成与失败重试的策略
对每个分镜:
1. 确认首帧、尾帧两张图已定稿(风格统一、主体一致)
2. 第一次生成:写最简提示词,只描述"动作"和"情绪"
(例:他踏雪穿过山道,停在塔基前,摘下工具包)
3. 检查三个失败类型:
a. 主体崩坏(脸、手变形)→ 检查资产引用是否生效
b. 运动不合理(瞬移、倒放)→ 把动作拆成更小的两段
c. 首尾对不上(跳帧)→ 缩短时长,或让首尾帧差异变小
4. 成功 → 存进画布,接下一镜
5. 失败 → 只改一个变量重试,最多 6 次,仍失败回改分镜
有一个反直觉的经验:首尾帧差异越大,模型"自由发挥"越多,也越容易出怪东西。所以相邻两帧的动作跨度要克制——首帧是"抬手",尾帧就定在"手碰到开关",而不是直接从"站在门口"跳到"门已大开"。跨度拆小,成功率肉眼可见地上升。这正是分镜拆解的意义:一个动作复杂的长镜头,先拆成两三个短镜头,每个短镜头的首尾帧差异都在模型舒适区里。
还有一点,首尾帧的静态图可以先用图片生成功能做,风格与主体资产保持统一。图定稿了再进视频生成,别让"图的随机性"和"视频的随机性"叠加在一起。
首尾帧提示词模板
首尾帧模式下,提示词只负责"中间过程",不用再描述起点和终点。我总结了几组常用句式,直接套用能明显提高首版成功率:
|
镜头类型 |
提示词句式示例 |
|
移动 |
「人物从首帧位置走向尾帧位置,动作自然,速度平稳」 |
|
转场 |
「镜头从首帧画面平滑过渡到尾帧画面,过渡自然不生硬」 |
|
情绪递进 |
「人物神情由平静转为喜悦,变化细腻,动作幅度克制」 |
|
环境变化 |
「光影从首帧状态渐变到尾帧状态,色彩过渡柔和」 |
|
动作衔接 |
「人物完成从起手到落定的完整动作,过程连贯不跳帧」 |
几个附带经验:句式里写"自然""平稳""克制"这类词,比堆砌风格形容词有用;负向约束(比如"不要出现人物变形")在部分模型上效果有限,与其写否定句,不如把动作描述写得更具体;时长参数和首尾帧差异要匹配——差异大就缩短时长,差异小可以拉长到 10 秒以上,让中间过程有足够的呼吸空间。