本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
人物解说类短视频要做出爆款,核心不是剪辑炫技,而是"提示词指令 → 文案脚本 → AI配音 → 剪映拼接 → 转场音效 → AE调色"这一整套链路的每个环节都对得上节奏。 本文从我自己实践这套流程下来踩过的坑出发,把每一关掰开揉碎讲清楚:提示词怎么写AI才不会偷懒、文案如何在前三秒钉住观众、AI克隆配音合规边界在哪、剪映拼接为什么要循着鼓点走、转场音效的"上升+重击"组合拳怎么打、AE锐化和曲线柔光的参数到底设多少。整个流程跑通之后,普通人也能搬出有节奏、有情绪、有质感的人物解说视频,而不是只能模仿模板做寡淡无奇的"内容流水线"。
想看完整拆解,往下翻。
一、写在前面:为什么人物解说类视频值得专门拆一次
最近这两年,人物解说类的短视频在抖音和视频号上呈现出一种奇怪的两极分化——同样讲一个企业家、一个历史人物,有的账号几十万粉丝起步,单条破百万播放;有的账号每条视频都像在念百度百科,三千播放量都嫌多。差距在哪?
我自己折腾这个赛道也有一段时间了,刚开始也是各种碰壁。后来反复拆解头部账号,慢慢摸清了一件事:人物解说类视频的胜负,从你打开AI的那一刻就已经决定了大半。你给AI的提示词写得稀里糊涂,文案出来就是大风暴一样的稀糊状;你的脚本节奏没卡好,配音再好听也救不回来;你的剪辑只会硬切,再贵的音效素材都白搭。
这条赛道之所以值得专门拆一次,是因为它不是单一技能能撑起来的。它要求你既懂一点商业判断、又懂一点说书人的叙事张力、还要懂一点剪辑和音效的节奏感。任何一环掉链子,最后视频出来都是温吞水。市面上讲剪辑的、讲文案的、讲AI写作的教程其实都不少,但能把整条链路串起来讲清楚的几乎没有。莫潇羽这次想做的就是这件事:把链路上每一个关键节点的"为什么"和"怎么做"一次性讲透。
为了让你心里先有个全貌,我把整个生产流程画成一张图:
flowchart LR
A[第一步<br/>角色定义] --> B[第二步<br/>任务语境]
B --> C[第三步<br/>执行指令<br/>七步法]
C --> D[第四步<br/>边界限制]
D --> E[AI生成<br/>文案脚本]
E --> F[AI克隆配音<br/>合规生成]
F --> G[剪映拼接<br/>卡音乐鼓点]
G --> H[转场+音效<br/>上升+重击]
H --> I[AE调色<br/>锐化+曲线]
I --> J[导出mov<br/>AI补帧修复]
J --> K[成片发布]
后面九个章节,就是把这张图里每个方块拆到底。读完之后你不光知道"应该这么做",更知道"为什么必须这么做"。
读这篇文章之前,先调整一下心态:这不是一篇能让你五分钟看完就上手出爆款的速成文。短视频这件事,本质上和健身、和写作、和任何技艺一样,是有肌肉记忆的。你看完一遍只会觉得"哦原来还可以这样",真要做出第一条像样的成片,至少得自己跑两三遍流程,把每个环节的参数感觉刻进手指头。莫潇羽@源码七号站 也是这么一条条试错过来的,没有什么捷径。
接下来咱们就从最底层的提示词开始讲起。这一关是大部分人摔得最惨的,但也是最值得花时间打磨的——因为它一旦稳定下来,后面所有环节都会顺得不可思议。
二、第一关:把"角色定义"写到位,AI就不会胡说八道
很多人用AI写文案的第一句话是这样的:"帮我写一篇某某企业家的发家史文案。" 然后等了二十秒,AI啪啦啪啦给你吐出一千多字,看完只想问候作者全家——通篇都是百度百科的味道,节奏稀烂,毫无情绪。
这不是AI不行,是你给的指令太弱。AI的工作原理本质上是基于你给的上下文做条件概率推演,你给的角色定义越模糊,它推出来的东西就越平均化、越没有辨识度。角色定义这一关,决定了AI接下来生成的所有内容的"性格"。
2.1 角色定义要回答的三个问题
我自己写角色定义的时候,会强制自己回答三个问题,缺一不可。
第一个问题:这个角色的人物身份是什么。 不能写"你是一个文案高手"这种废话,AI对"文案高手"的理解可能是任何东西。正确的写法是把场景、平台、垂直领域都框死。比如:你是一位深耕短视频平台、专注商业人物发家史叙事的财经类博主。一下子就把范围收到很窄的一条赛道里。
第二个问题:这个角色的能力结构是什么。 也就是他擅长什么、不擅长什么。一个商业人物解说博主需要的能力,至少包括极强的商业分析能力、说书人般的叙事张力、对数据真实性的洁癖。这几条要明确写出来,让AI知道在生成内容时往哪个方向使劲。
第三个问题:这个角色的语言风格是什么。 这是最容易写得太抽象的部分。"幽默风趣"四个字AI听不懂,它需要更具体的方向。比如:融合脱口秀的松弛感、节奏感强的语言爆发力、财经评论的锐度。三个方向一锁定,AI就知道这不是要写严肃论文,也不是要写新概念英语作文。
2.2 一个完整的角色定义示例
为了让你看得更清楚,我把自己常用的一段角色定义贴出来。这一段贴进AI对话框作为第一段提示词,后面跟具体任务,效果通常比裸问要好上一个量级:
【角色定义】
你是一位深耕短视频平台、专注商业人物发家史叙事的财经类博主,
拥有极强的商业分析能力和说书人般的叙事张力。
你的核心人设是:幽默风趣、妙语连珠、谈笑风生,
能在轻松调侃之间让观众产生"原来如此"的顿悟感。
你的语言风格融合了脱口秀的松弛感、节奏感强的语言爆发力、
财经评论的锐度,是市面上独一无二的押韵财经说书人。
你有自己鲜明的商业判断和观点,从不说废话,从不灌鸡汤,
每一句话都有据可查、有理可依。
你的句子是说出来的话,不是写出来的字,读起来有画面感、有节奏感、有温度。
里面有几个细节值得展开讲一下。
"独一无二的押韵财经说书人" —— 这一句的作用是给AI一个清晰的差异化定位。你不加这句话,AI会习惯性地往"通用财经博主"上靠,写出来的东西和小绿、小红、小蓝差不多。加了这句,AI会主动避开那些已经被用烂的句式。
"有据可查、有理可依" —— 这一句是最重要的合规护栏。AI天生有幻觉问题,你不约束它,它能给你编出一堆从来没发生过的事。明确写上这一句之后,AI在生成数据、引用事件的时候会自动收敛,至少不会瞎编大数字。
"说出来的话,不是写出来的字" —— 这一句直接决定文案能不能用来配音。AI默认的语言风格是书面腔,长句一堆、连接词一堆,配音念出来又拗口又拖沓。给它这个指令之后,它会自动把长句拆成短句、把书面词换成口语词,配音念出来才有那种"人在跟你说话"的感觉。
2.3 角色定义不要省字数
很多人觉得提示词写长了浪费时间,能省则省。这是大错特错的。
AI是个挺聪明的"懒鬼"。你给的指令越短、越含糊,它越会偷懒,因为节省算力对它来说是本能。你给的指令越具体、越细致,它越会调动更多的"注意力"去生成符合要求的内容。这就和招聘一样:你给员工的JD只写"做事认真"四个字,员工就只能按自己的理解发挥;你给的JD是十条具体的KPI,员工就会逐条对照执行。
我见过有人把角色定义浓缩到三十个字,然后抱怨AI写得不行。换我看,三十个字能给AI什么?连个像样的人设都立不起来。我自己写的角色定义都在两百字以上,复杂任务甚至能写到五百字。看起来啰嗦,但生成质量的差距是肉眼可见的。
讲到这里你大概明白了:角色定义这一关,本质上是在用语言给AI"塑形"。你塑得越像一个真人博主,它输出的内容就越像一个真人博主写的东西。这一关搞砸了,后面所有的努力都是给一座地基歪了的楼加层数,加得越高塌得越快。
下一章咱们聊任务语境——也就是告诉AI:你写出来的这些东西,到底要给谁看。
三、第二关:任务语境与对标——告诉AI你写给谁看
写完角色定义,第二步要交代清楚的是任务语境。这一关讲的不是"你是谁",而是"你写给谁看,他们想看什么,看完会怎么想"。
很多人跳过这一步直接进入指令环节,生成出来的文案就会出现一个共性问题:风格漂浮,不知道在跟谁说话。一会儿像在跟商学院学生讲案例分析,一会儿像在跟初中生讲科普故事,前后语气割不齐。原因就是AI不知道目标观众是谁,只能在自己的训练数据里抓一个"平均值"出来用。
3.1 目标观众的精细画像
我自己写任务语境时,通常会从三个维度给观众画像。
第一个维度是人群标签。 比如人物解说类视频的核心观众,大致是这几类人:在短视频平台上感到迷茫的年轻人、还没想清楚方向的初创业者、被工作磨得有点钝的打工人、对商业故事天然好奇的普通大众。把这几类人清清楚楚地列出来,AI在选词造句时就会自动调整难度——不会用太晦涩的金融术语,也不会写得像幼儿园读物。
第二个维度是观众的心理状态。 这一点比人群标签更重要。同样是"年轻打工人",刷视频时的心理状态可能是疲惫、可能是焦虑、可能是想找点乐子、可能是想看点不一样的东西放松一下。我会在任务语境里写明:他们不需要教科书,也不需要说教,他们需要的是一个能让他们血液变热、忍不住转发、看完之后觉得"原来还可以这样活"的故事。
这一段加上之后,AI生成的文案立刻就不一样了。它会自动避开任何带"你应该""你必须"句式的内容,转而用"他当时是这样的""你想象一下"这种带入式的表达。
第三个维度是观看场景。 平台是抖音、视频号还是B站,这一点必须明确写出来。因为不同平台的内容偏好天差地别。抖音是竖屏快节奏、前三秒决定生死;B站是横屏中长内容、可以慢慢铺垫;视频号是熟人社交、需要更稳重的腔调。我做的是抖音赛道,所以任务语境里会明确写"平台是抖音"和"前三秒决定生死",并且加一句"视频时长两到三分钟,文案约一千字"。这一句话直接锁定了文案的体量和节奏。
关于"前三秒决定生死"这件事,搜索引擎里随便一搜都能看到大量数据印证。短视频前3秒决定80%的流量命运,数据分析发现:72%的用户在第3秒前划走,而爆款视频的前3秒必有"即时价值钩子"。完播率、点赞、分享、关注这几个关键点决定了系统给你的流量分配,所以一开场你必须搞个钩子勾住观众。这不是玄学,是平台算法的硬指标。
3.2 对标账号的妙用
任务语境里,我还会专门留一段写"对标风格"。也就是告诉AI:你写出来的东西,语感上应该接近哪几个已经验证过的成功账号。
很多人会问:那我直接让AI模仿某某账号不行吗?为什么要列三个?
原因有两个。第一个原因是单一对标容易导致同质化。 你让AI完全模仿一个人,它写出来的东西可能就成了那个人的"低配复制品",观众一眼就识破。第二个原因是多个对标可以做风格融合。 我自己常用的对标组合是:一个偏信息密度高的账号、一个偏亲切感强的账号、一个偏商业锐度足的账号。三个一起列出来,AI会自动在三者之间找一个平衡点,生成出来的内容既有信息量又有人味儿,商业判断也不会软塌塌。
写对标的时候有个小技巧:不要只写名字,要写清楚每个对标账号的核心特征。 比如不要只写"对标某账号",而是写"对标某账号的信息密度、某账号的亲切感、某账号的商业锐度,但在押韵密度和幽默层次上全面超越这三者"。最后那句"全面超越"很重要,它会驱使AI去做创新,而不是简单复刻。
3.3 任务语境的完整模板
把上面这些点串起来,一段合格的任务语境大概是这样的:
【任务语境】
你的观众是抖音平台上迷茫的年轻人、还没想清楚方向的初创业者、
被生活磨得有点钝的打工人,以及对商业故事天然好奇的泛大众。
他们不需要教科书,不需要说教,
他们需要的是一个能让他们热血沸腾、忍不住转发、
看完之后觉得"原来还可以这样活"的故事。
你的视频时长2到3分钟,每篇文案约1000字,平台是抖音,
前3秒决定生死。
对标风格是A账号的信息密度、B账号的亲切感、C账号的商业锐度,
但在押韵密度和幽默层次上全面超越这三者。
这段一贴上去,AI生成的文案语气基本就稳了。后面只需要在执行指令环节告诉它具体怎么干,它就会按这个语境去执行,不会跑偏。
讲到这里,角色和任务两关都搞定了。下一章是整个提示词工程里最核心、也最难写好的一关——执行指令。这一关写得好不好,直接决定了你的视频是有节奏、有钩子、有金句的爆款,还是平淡如水的流水账。
四、第三关:执行指令的七步法,决定文案是爆款还是流水账
如果说角色定义是给AI塑形、任务语境是给AI定位,那执行指令就是给AI规定动作。这一关是整个提示词工程里最长、最细、也最有挑战的一段。我自己迭代了不下十几个版本,才稳定下来这套七步法。
这七步法不是凭空设计的,每一步都对应着抖音短视频的一个关键算法指标或者观众心理节点。下面逐步拆解。
4.1 第一步:开场钩子,前三句必须完成三件事
抖音的算法机制里有个硬指标叫"两秒跳出率",还有个"五秒完播率"。简单说就是:如果观众在两秒之内划走了,你的视频基本就被打入冷宫了。所以开场这三句话,必须像炸弹一样炸开。
我给AI的指令是这样的:前3句话内必须同时完成三件事——抛出一个让人瞠目结舌的悬疑数字或极端处境,紧接一个颠覆常识的反问句或强冲突场景,再用一句让人产生强烈好奇心的悬念收住,把观众钉在屏幕前。三个元素必须全部到位,顺序可以灵活调整,但必须在3句之内完成。
这里有几个细节值得展开。
"瞠目结舌的悬疑数字" —— 数字是天然的注意力捕获器。"他三年烧光了三百亿"这种句子比"他经历过失败"有冲击力得多。要让AI优先用具体数字开场。
"颠覆常识的反问句" —— 反问句的作用是把观众从被动观看变成主动思考。"你能想象一个连工资都发不出来的人,后来怎么造火箭吗?" 这种句式会推动观众多停留几秒。
"产生好奇心的悬念" —— 悬念不能是答案,必须是问题。"接下来发生的事,改变了整个行业的格局。" 这种句式让观众的大脑产生"必须知道答案"的渴望。
特别强调一句:不能铺垫,不能预告,要直接引爆。很多新手会让AI写"接下来我要给大家讲一个故事",这种开场基本等于自杀。
4.2 第二步:主体叙事,悬念开场加起伏结构
开场抓住观众之后,接下来的两分多钟怎么撑下去?核心就两个字:起伏。
我给AI的指令是:主体叙事采用悬念开场加起伏叙事的双轨融合结构,沿人物真实历史时间线推进,必须包含至少5个明显的情绪低谷时刻和5个对应的情绪爆发时刻。
为什么是五个低谷加五个爆发?因为一千字左右的文案,大概对应两到三分钟的视频时长,平均每十几秒就需要一个情绪波动点。这就和坐过山车一样:你不可能让观众一路平地走两分钟,得给他高低起伏的刺激。
graph LR
A[开场<br/>悬念钩子] --> B[低谷1]
B --> C[爆发1]
C --> D[低谷2]
D --> E[爆发2]
E --> F[低谷3]
F --> G[爆发3]
G --> H[低谷4]
H --> I[爆发4]
I --> J[低谷5]
J --> K[爆发5]
K --> L[结尾<br/>升华金句]
我还会在指令里强调:低谷必须具体、真实,能让观众产生强烈代入感,不能只是"他很惨"的模糊描述。爆发必须有真实数据和事件支撑,不能靠煽情词汇堆出来。
"必须真实"这四个字看起来废话,但其实非常关键。AI在生成内容时有个习惯,就是为了情绪渲染,会把场景写得很夸张:"他当时连吃饭的钱都没有,只能靠捡垃圾度日。" 这种描述如果不是真的,生成出来的文案就是营销号味儿,平台一审核就被扔进冷启动池子里出不来。所以指令里必须明确要求"具体、真实"。
4.3 第三步:循序渐进的情绪蓄力
很多AI生成的文案有个通病:高潮来得太突然。前一秒还在讲人物的日常,后一秒突然就"成功了""失败了""崩溃了"。观众的情绪根本没跟上,看着就觉得突兀。
我给AI的指令是:叙事推进必须循序渐进,高潮点不能凭空出现,每个爆发时刻到来之前必须经过至少2到3句的情绪蓄力和事实铺垫,让观众在情绪刚刚积累到顶点的时候被点燃。
这里有个我自己琢磨出来的小技巧:三句一反转,三句一梗。每三句话给一次小转折,每三句话给一个小梗,节奏感会出奇地舒服。这个技巧你可以加在指令里,也可以在生成完之后手动调整。
4.4 第四步:高潮节点的节奏爆发模式
到了情绪爆发节点,文案就需要切换到一种更密集、更有冲击力的语言节奏。这就是为什么很多头部账号会在关键节点用押韵、用排比、用短句轰炸。
我给AI的指令是:每到高潮爆发节点,切换为密集押韵或节奏爆发模式,连续押韵或排比3到4句,押韵必须服务于内容逻辑和情绪爆发,押韵的每一句都必须比上一句情绪更重、信息更实,绝对禁止为凑韵脚而牺牲信息准确性。押韵结束后必须自然丝滑地切回脱口秀叙事节奏。
这里有两个坑要避开。
第一个坑:押韵不能为了押韵。 AI在被要求押韵时,经常会为了凑韵脚而瞎编内容。比如它会写"他一年涨了一千万,他笑得真叫狂",后面那句完全是为了押"光""狂"硬凑出来的。所以指令里必须明确"禁止为凑韵脚而牺牲信息准确性"。
第二个坑:押韵之后不能生硬切换。 押完三四句突然切回平淡叙述,观众会觉得很别扭。所以要让AI"自然丝滑地切回脱口秀叙事节奏",中间最好用一句过渡句,让节奏自然落下来。
4.5 第五步:幽默感的四个来源
人物解说类视频里,幽默感是把观众从"被动接受信息"变成"主动喜欢看你"的关键。但幽默不是说"加一个搞笑梗"那么简单,它需要明确的来源。
我给AI的指令是,幽默感必须来自四个来源:
第一个来源是真实反差——现实与预期的落差感。比如一个亿万富翁,你以为他的烦恼是怎么花钱,结果他的