本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
先说结论:AI视频做不真,九成不是模型不够强,而是你缺一套"从人物资产到成片"的顺序。 这篇长文把我自己折腾下来觉得最有用的东西整理成一条完整链路:先用三视图和微距纹理把人物资产做扎实,再用"正向词 + 负向词"把皮肤质感调到真人档位,然后用"起始表情、变化过程、终点表情、保持条件"四段式把情绪写成一条时间轴,最后只给一条视频安排一个主运镜,并用一份排查清单把人物、服装、场景、光线、镜头语言五类一致性逐项锁死。
文中我给了可直接复制的提示词模板(三视图、皮肤优化、表情过渡、运镜公式、首尾帧衔接),也给了成本控制、抽卡止损、平台合规(AI生成内容标识、肖像授权、商用素材授权)这几件容易被忽略、但迟早要面对的事。新手最该记住的一句话是:人物先稳住,再谈场景;场景先稳住,再谈动作;一个镜头只做一个主运镜。 顺序错了,你会把算力全烧在返工上。
想看完整拆解,往下翻。
第一章 一条AI视频为什么"一眼假":先用眼睛做质检
很多人刚接触AI视频的时候,都会经历同一个瞬间:刷到别人的作品,觉得"这也太真了";自己上手跑了一条,发出去没两分钟就有点后悔——点赞的人不少,评论区却总有那么一两条"这脸是AI吧"。
同行之间也常聊这个事。有人归因于模型不行,有人归因于自己的提示词不够长,还有人干脆归因于运气。我自己折腾了小半年,慢慢意识到一件事:"一眼假"其实不是一个毛病,而是五个断层叠在一起的结果。
1.1 把"假"拆开看:五个断层
我把常见的失败场景归了归类,做成了下面这张表。你可以对照自己的作品,看看卡在哪一层。
|
断层 |
观众看到的现象 |
常见的错误归因 |
真正的原因 |
修复入口 |
|
皮肤断层 |
脸像蜡像、像磨皮过度的滤镜 |
"模型画不好脸" |
缺少毛孔、瑕疵、绒毛、单根发丝这类真人细节描述 |
用皮肤质感正负词做一次定向优化 |
|
身份断层 |
上一个镜头和下一个镜头像换了个人 |
"AI就是不稳定" |
人物资产没做齐全,没有多角度参考 |
补齐三视图与细节组,绑参考图 |
|
动作断层 |
人动起来僵硬、像纸片在飘 |
"提示词写得不够多" |
没有写清动作的起点、过程、收尾 |
把动作写成分段的时间轴 |
|
画面断层 |
前后光线、色调、景别全对不上 |
"平台抽卡随机" |
没有锁定光线、构图、镜头语言 |
给出光线与镜头的一致性约束 |
|
叙事断层 |
单张图都好看,连起来没故事 |
"得多做几个镜头" |
前期没设计"这个画面为什么存在" |
从分镜倒推画面,而不是从画面凑分镜 |
这五个断层里,只有第一个跟模型能力有关,剩下四个全是流程问题。所以我给自己的判断标准是:如果一个作品看起来假,先去查流程,别急着换工具。
1.2 新手最常踩的第一个误区:把工具当成答案
我接触过不少刚入门的朋友,问的问题高度一致:"哪个工具最好用?""哪个模型画人最像?"
这个问题本身没有错,但它排错了优先级。业内有一种说法很形象:工具是杠铃,流程才是动作。杠铃换得更贵,动作不对,照样练不出东西。AI视频同理——真正拉开差距的,是你能不能把一个普通想法,稳定地拆成人物、场景、动作、情绪、镜头这几块,并让它们前后咬得住。
现在的平台上确实有一句话生成分镜、再自动连成多镜头的能力,用起来很爽。但只要你观察得够细,就会发现它的短板也很明显:镜头与镜头之间的人物关联偏弱,上一段和下一段的身份、发型、服装经常会飘。这不是我一个人的感受,公开的评测里也反复提到"跨镜头的角色一致性"仍然是各家模型的重点攻坚方向。
所以我的选择是:先把可控的手动流程跑通,再回头用自动化能力提效。 顺序反过来,你会一直不知道自己错在哪一步。
1.3 我平时用的"四问质检法"
每次成片导出之前,我都会问自己四个问题。问题很糙,但很管用:
- 脸还认得出是同一个人吗? 把第一镜和最后一镜并排放,遮住衣服只看脸。
- 动作有没有起点和收尾? 如果人物的运动是均匀、匀速、从头到尾一个速度,那基本是AI味。
- 光线有没有偷偷变? 同一场戏里,柔光变硬光、暖调变冷调,观众一眼就能察觉。
- 每个画面是否都为了讲同一件事? 把分镜按顺序默读一遍,读不出因果关系的画面,就该删。
这四个问题背后,其实是一条完整的链路:人物资产、质感、情绪、运镜、节奏。接下来我就按这条链路的顺序,把每一步的原理和操作展开讲。
1.4 顺手说说选平台的三个判断维度
总有人让我推荐工具,我的回答一直没变:先看三件事,再看具体是哪一家。
- 第一看一致性能力:有没有角色绑定、多图参考、首尾帧控制这几项功能,它们直接决定你能不能做多镜头的内容;
- 第二看成本结构:按秒计费还是按次计费、有没有更经济的档位、失败重试怎么算,这些细节长期下来差距不小;
- 第三看它是否在你已有的工作链路上:能不能和你在用的工具打通,导出格式是否方便继续剪辑。
拿这一两年的变化来说,可灵在镜头语言理解和微表情上的进步比较明显(公开评测里,3.0 这一代已经能比较稳地还原推近、拉焦这类镜头语言),即梦体系在画面稳定性和首尾帧控制上的口碑不错(Seedance 系列这两年也在持续迭代),哩布哩布这类平台的优势是把多个模型和画布式工作流聚合在一起,新片场旗下的 Shotlab 则把 AI 画布做成了节点式的工作空间,把一个项目从分镜到成片都装进同一张画布。这些平台都能在国内环境里正常访问和使用,具体功能建议直接去官网看当天的版本说明。
境外的一些图像与视频模型,能力上确实有独到之处,但境外模型使用需遵守国内网络与内容管理相关规定,同时还要考虑素材上传与数据安全的问题。如果你的项目对合规性要求高,优先选国内合规平台提供的同类能力,通常会省心很多。
最后一句话提醒:功能、价格、模型版本变得太快,我上面说的只是我写稿时的体感,请以官方文档和平台公告为准,不要拿任何一篇教程当长期有效的说明书。
第二章 人物资产底座:三视图、微距纹理与四到六张细节组
如果只能保留一条心得,我会留这条:人物一致性不是一个提示词问题,而是一个资产问题。
你手里的参考图越完整,后面越省力。只有一张正面照,模型就只能靠"脑补"侧面和背面;等镜头一转,脸型、发型、发际线立刻开始飘。反过来,如果你有一整套正面到背面的角度图、有五官的微距细节、有服装和配饰的多角度图,模型就有了足够的信息去"照着做",而不是"猜着做"。
2.1 先建一张资产清单,别急着出片
我把人物资产分成六类,做项目的时候按这个清单收集,缺一块就补一块。
|
资产类型 |
建议数量 |
主要作用 |
用在哪一步 |
|
全身三视图 |
1张(1×3横向排版) |
锁身形、比例、整体服装 |
全景、走路、站姿镜头 |
|
中景三视图 |
1张(正面、侧面、背面) |
锁上半身结构、肩颈线条 |
半身表演、对话镜头 |
|
近景三视图 |
1张(正面、45度侧、90度侧) |
锁脸型、五官、发际线 |
近景、表情戏 |
|
五官微距纹理图 |
4到6张 |
锁皮肤质感、发丝、妆感 |
特写、皮肤优化参考 |
|
身体局部细节图 |
4到6张 |
锁手臂、腿部、手部结构 |
肢体特写、动作镜头 |
|
服装与配饰图 |
4到6张 |
锁面料、版型、鞋子、袜子 |
换装、电商展示 |
顺序上我的习惯是:全身三视图先出,它是最重要的那张"底片";然后再补中景、近景,最后做微距纹理。原因很简单,全身图决定了比例,比例错了,后面所有的细节都白做。
2.2 三视图提示词的写法:把"一致性"写成明文约束
三视图的提示词不需要华丽,需要的是把约束一条条写清楚。下面这个模板是我改过很多版之后留下的,你直接替换描述就行。
生成人物全身三视图角色参考图,纯白背景,1×3横向排版。
左:正面全身站立;中:90度侧面全身站立;右:背面全身站立。
同一张脸、同一肤色、同一发型、同一身材比例、同一套服装、同一双鞋。
人物自然直立,双臂自然下垂,肩颈放松,全身完整入画,头顶到脚底都在画面内。
高级电商白底摄影风格,画面干净无杂物。
超写实真人质感:皮肤有毛孔、轻微瑕疵、细小绒毛,头发有单根发丝和自然碎发,
服装有真实布料纹理,真实棚拍光影,高清4K。
近景版本只需要把构图范围改成"头部到胸口",再把重点换成"脸型轮廓、眼睛、眉毛、鼻子、嘴唇、下颌线、耳朵、发际线、发丝层次、皮肤纹理与妆感"。
这里有个特别容易翻车的细节:生成 1×3 的横向网格时,画面比例一定要选横构图。我早期图省事用了竖向比例,结果三格里的人物全被裁掉了半条腿,拿去做参考的时候,模型学到的就是"这个人没有脚"。凡是排版类提示词,构图比例和排版方式要配套想清楚。