本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
这是一份写给所有 AI 漫剧 / AI 短视频创作者的提示词长文教程。如果你只想要一句结论:AI 视频生成的真正本质,是"图片打底 + 提示词驱动",而所有高质量画面,都建立在三件事之上——氛围感、互动感、节奏感。其中氛围感是画面的"呼吸",互动感是画面的"骨架",节奏感是画面的"心跳"。再配合"总分总"的写作公式 + 合理的运镜调度,海螺、可灵、即梦、通义万相这类国产视频模型,你完全可以用同一套思路把效果做到接近顶配水准,而不必盲目追逐最贵的模型。下面这篇 13000 字长文,会从底层原理、三大要素、运镜、首尾帧、避坑、多工具适配、进阶思维七个维度,给你一份足够实操的拆解。
下文会从底层原理讲到具体落地公式,再到不同主流工具的语法偏好,以及 莫潇羽@源码七号站 自己长期实操中总结的小心得,想看完整拆解,往下翻。
一、写在最前:提示词,才是 AI 视频真正的胜负手
很多刚入门的朋友,一上来就掉进了一个非常典型的认知陷阱——觉得"画面不够好"是因为"模型不够强",所以拼命去抢最新、最贵的视频模型,以为只要换上更高规格的工具,作品自然就能跃升一个档次。
我在 源码七号站 接触过不少创作者,有人在工具订阅上砸了几千上万块,做出来的片子跟身边用免费工具的朋友比,几乎没有本质差距,甚至画面观感还不如别人。问题到底出在哪里?答案非常简单——不是模型不够强,是提示词功底太薄。
AI 视频模型,本质上只是一个调度工具。它根据你提供的图片和文字,在有限范围内做"延续推理"。换句话说,它从来不"凭空创造",它只会"延续输入"。如果你输入的是一张静态图片,这张图其实已经把风格、造型、动态趋势、环境基调全部锁死了;模型唯一能做的,就是根据你给的提示词,把这张图"动起来"。
所以你会发现一个非常关键的底层规律:
- 图片决定你画面的下限
- 提示词决定你画面的上限
这个认知,是所有进阶讨论的起点。
我在团队内部分享时反复强调一句话:工具会迭代,模型会更新,价格会波动,但提示词的底层逻辑几乎是稳定的。无论今天用的是海螺、可灵、即梦,还是明天突然冒出来的新模型,它们对中文语义的理解、对画面元素的调度方法,已经趋于趋同。你今天把这套底层方法论吃透了,明天换工具也只是换个壳。
理解到这一层,我们才能开始正式聊提示词。
二、AI 视频生成的底层原理:图片是地基,提示词是指令
抛开所有花哨的概念,AI 视频生成只做两件事:
2.1 第一件事:图片决定了画面的"美术设定稿"
不管你是先文生图再图生视频,还是直接喂图给模型,画面里的风格、构图、人物服饰、场景基调,几乎都已经被这张图锁死了。它就像一部电影开拍前的"美术设定稿",定下了全片的视觉调性。
风格 → 卡通/写实/二次元/水墨/赛博朋克
构图 → 主体位置/景别/视角
基调 → 冷色/暖色/对比度/光感
人物 → 服饰/造型/比例
环境 → 室内/室外/季节/天气
这些维度,提示词后面几乎都改不了——你的图里是一个穿白衣的少年站在崖边,提示词写一万遍"穿黑衣"也大概率没用,模型会顽固地坚持图里的造型。
2.2 第二件事:提示词是"调度指令"
既然图片已经把大半内容定死了,提示词还能做什么?答案是——调度画面里所有"动"的部分。
这个调度,包含三个层面:
- 让什么动起来(主体)
- 怎么动、动到哪里去(动作 + 运镜)
- 动出什么气氛(氛围 + 反馈)
这三层做不好,你的视频就是一段"会动的图片";三层都做到位,你的视频就有了所谓的"导演感"。
2.3 视频的本质,就是"连续静态图片"
讲一个绕不开的常识:所有视频都是由一帧一帧静态图片组合而成。AI 视频生成的工作原理,本质上是基于首帧画面做连续推演,补出后面每一帧——这就是为什么"图片"才是地基,而不是"模型多贵"。如果首帧本身有问题(构图歪、主体不清),后面的推演只会把问题放大,而不是修复。
所以我的工作流第一原则是:先把图打磨到合格线,再用提示词去冲击上限。一图未平、又赶着做视频,是新手最容易走的弯路。
三、三大核心要素之一:氛围感(Atmosphere)
讲完底层原理,正式进入提示词的三大核心要素。我把它们排序为:氛围感 → 互动感 → 节奏感。三者缺一不可,但氛围感放在最前,是因为它最容易被忽视,也最能把一段视频"质感"拉开。
3.1 什么是氛围感
氛围感,是覆盖整张画面的"气氛附加层"。它不是某个角色的情绪,也不是某个动作的延伸,而是整段画面的"空气"。
经常会有反馈说一段视频"过得去,但看着干干的"、"少了点东西"——这少的东西,十有八九就是氛围感。
举个最直白的例子。同样一张人物站在山崖边的图:
- 只让人物动一下 → 一段"会动的图"
- 加风从右侧吹来,把披风掀起,带起脚下尘沙 → 画面立刻有了苍茫感
- 再加一束阳光斜射、远处云雾缓缓移动 → 层次感再上一个台阶
这就是氛围感的力量。它不是噱头,是给画面注入"呼吸"的关键一步。
3.2 外景氛围:自然元素的强度分级表
外景的氛围词,几乎可以全部归到"自然元素"上——风、雨、雷、电、火、雾、烟、沙、雪、光。每一种元素都可以按强度划分梯度,强度不同,画面反馈完全不同。
我把它整理成一张分级表,可以直接当做写氛围词的"取词表":
|
元素 |
弱 |
中 |
强 |
极强 |
|
风 |
微风吹动发丝 |
大风掀起衣袂 |
狂风飞沙走石 |
飓风卷起重物 |
|
雨 |
细雨蒙蒙 |
雨点斜打青石 |
暴雨倾盆 |
暴风骤雨 |
|
雷电 |
远处闷雷 |
雷光闪烁 |
雷霆轰击 |
紫电连珠 |
|
雪 |
薄雪轻飘 |
鹅毛大雪 |
暴风雪 |
雪崩 |
|
雾 |
薄雾弥漫 |
浓雾笼罩 |
雾气翻涌 |
妖雾蔽日 |
|
火 |
火星跳动 |
火焰窜起 |
烈焰冲天 |
熔岩奔涌 |
|
光 |
日光斜照 |
金光普照 |
光芒万丈 |
光柱破云 |
写氛围的时候,把"动作主体" + "对应强度的元素反馈"组合起来,基本就能保证画面的厚度。
3.3 氛围词不是"堆形容词",是写"看得见的轨迹"
这是新手最容易踩的坑——以为氛围感就是堆一堆抽象形容词:"凄美的氛围"、"史诗级的震撼"、"令人窒息的紧张感"。
AI 看不懂这些词。或者更准确地说,它看得懂,但生成不出对应的画面,因为这些词没有具体的视觉信号。
正确的写法,是把抽象氛围翻译成看得见的轨迹和反馈:
- 风看不见,但你可以写:吹起的尘埃从画面左下飘向右上,扬起一片细沙
- 雷电写一道惨白色雷光从云端劈下,瞬间照亮山谷,比写"雷声轰鸣"有用十倍
- 雨写豆大的雨点斜着砸在青石板上,溅起白色水花,比写"瓢泼大雨"具体得多
记住一句话:风、雨、雷、电是看不见的,但它们的轨迹是看得见的。AI 模型只对看得见的轨迹做反应。
3.4 室内场景:光、尘、物三件套
很多人到了室内场景就懵——没风没雨,氛围怎么写?
我教你一个最简单的"画面联想法":闭上眼睛,回忆你小时候第一次走进祖父书房翻开一本旧书的画面——你会看到什么?
是不是会看到斜射进窗的光柱里,微微飘荡的灰尘在缓缓打转?
这,就是室内氛围感的核心。室内的氛围词,重心永远落在三处:
- 光:斜射的阳光、烛光、月光透过窗棂、灯影摇曳
- 尘:浮动的微尘、灰尘在光柱中打转、被翻动衣物时扬起的细灰
- 物:腐朽的木桌、泛黄的纸张、悬挂的旧布、墙角的蛛网
切忌不要写"尘土飞扬"——那不是氛围,那是工地。要写"微微的尘埃在光中飘零",画面立刻就活了。
3.5 氛围感是"一镜一切换",不是写一次就够
特别提醒一点:氛围感不是写在开头就万事大吉,它要在整段提示词里反复穿插。当你的镜头切换、人物动作发生变化、场景视角不同时,氛围词都要相应调整。
举个例子,假设你的视频前半段是"主角在风沙中艰难前行",后半段是"主角到达山顶,遭遇巨型异兽"——前半段的氛围词是"狂风、飞沙、衣袂猎猎",但到了后半段,氛围词就要切换为"异兽出现时空气压抑、远处雷声滚动、地面微微颤动"。两段氛围如果不切换,画面就会失去层次,看起来像同一种气氛被拖到底,非常平庸。
莫潇羽@源码七号站 团队的内部口诀就是:一镜一氛围,一段一切换。视频里有几个动作切换点,就应该有几次氛围词的切换。
3.6 氛围词写不出来怎么办
不少朋友会问:我语文不好,描述氛围的形容词总是写不出来。这是个非常常见的问题,但解决起来其实非常简单。
用大模型当你的"氛围词字典"。直接在豆包、Kimi、通义这类对话式 AI 里输入一句话:
"请帮我写出'雷电交加 + 人物惊恐'的画面氛围描述,要求用具体的视觉元素,不要用抽象形容词。"
它会直接吐给你一段可用的氛围词。
更进阶一点的玩法是反向操作——找一段你看中的电影画面,截图丢给豆包或通义,让它帮你"反推"氛围描述。这种"截图反推法"是新手快速积累氛围词库最有效的办法之一。
按 莫潇羽@源码七号站 的实操经验,氛围词的积累不是靠背诵,而是**"反推电影 + AI 辅助生成"两步走**。坚持一两个月,你脑海里就能存下几百个可复用的氛围模板。
3.7 进阶技巧:氛围的"前中后景"分层
最后再补充一个进阶用法——氛围是可以分层呈现的。一个高级画面,往往同时具备前景氛围、中景氛围、背景氛围三层。
以一个雪山场景为例:
- 前景:飘落的雪花在镜头前缓缓飞舞
- 中景:主角踏雪前行,每一步都留下深深的脚印
- 背景:远处山峰被风雪笼罩,隐约可见黑色岩石
三层叠加在一起,画面立刻具备立体感和纵深感。这是好莱坞级画面的标配。
当你的画面看起来"扁平"、"单薄",往往就是只写了一层氛围。下一次写提示词的时候,可以刻意提醒自己——前景、中景、背景,各给一点氛围词。
四、三大核心要素之二:互动感(Interaction)
如果说氛围感给画面"大地",那么互动感就是画面的"骨架"。
4.1 什么是互动
互动指的是两个或多个对象之间的反应关系。它的形式非常多样:
- 人 ↔ 环境:被风吹得后退、被火烤得后撤、踩塌地面
- 人 ↔ 物体:手抚过桌面、掀起书卷、握紧剑柄
- 人 ↔ 人:追逐、攻防、对视
- 物 ↔ 物:剑刃相撞、巨石滚落、藤蔓断裂
没有互动的画面,是死的。我经常对刚入门的朋友说:你画面里有一个人站着不动,这个人就是"死的"——不是真的死,而是没有"灵性"。AI 视频的灵性,几乎全部来自互动。
4.2 写互动的"四要素法":来龙、去脉、过程、反馈
一段好的互动提示词,本质上是在回答四个问题。我习惯把它叫做"四要素法":
|
维度 |
含义 |
例子(以一道雷电为主体) |
|
来龙 |
这个动作/元素从哪里来? |
从乌云密布的天空中 |
|
去脉 |
它要到哪里去? |
劈向悬崖边的石头 |
|
过程 |
中间发生了什么? |
碎石飞溅,地面震颤 |
|
反馈 |
带来了什么后果? |
主角被惊得倒退,伸手遮挡眼睛 |
把这四问串起来,就是一段非常完整的互动提示词。AI 看到这种描述,立刻就有了画面,因为它清晰地知道每一个元素的运动方向和因果关系。
4.3 互动会"自然带出"动作
一旦你给出第一个氛围或动作刺激(比如"狂风吹来"),人物的反应几乎是被自然推导出来的:
- 狂风吹来 → 人物不断后退、用手遮挡眼睛、披风被吹得猎猎作响
- 雷电劈下 → 人物惊恐跳起、瞳孔放大、身体反射性后撤
- 大火扑面 → 人物侧身闪避、衣袖遮挡口鼻、脚下后退
也就是说,你写提示词的时候,不必把每一个动作都从头细写一遍。你只需要给出环境的"刺激源",再补一两个关键反应词,AI 就能联想出一连串符合逻辑的反馈动作。这是一个非常高效的写法。
4.4 三版对照演示:从"会动"到"有戏"
我们做一个完整的对照演示。假设画面里是一名江湖少年站在悬崖边,天空乌云密布。
第一版(只写环境):
悬崖之上,乌云密布,一道雷电从云端劈下。
这一版会出来一道雷电的画面,但人物几乎没反应,只是一个会动的背景板。
第二版(环境 + 互动反馈):
悬崖之上,乌云密布,狂风呼啸,
一道雷电从云端劈下落在悬崖边缘,碎石飞溅,
少年被风吹得不断后退,
右手抬起遮挡眼睛,
惊恐地睁大双眼。
这一版画面立刻活了——你交代了风、雷电、人物反应、表情变化,整张画面有了灵魂。
第三版(环境 + 互动 + 表情强化 + 动态走位):
悬崖之上,乌云密布,狂风呼啸,
一道惨白色雷电从云端急速劈下,
轰击在悬崖边缘,碎石飞溅,地面震颤,
少年在崖边快速跳跃躲闪,
身后是不断坠落的雷光,
他惊恐地瞪大双眼,
神情慌乱中带着一丝倔强。
第三版已经具备了出片水准。氛围(雷电、风、乌云)、互动(轰击、跳跃、躲闪)、反馈(震颤、飞溅、惊恐表情),环环相扣。
4.5 进阶技巧:让动作"串成一条因果链"
更进阶一点的写法,是把一系列动作串成因果链——一个动作引发下一个动作,下一个动作再引发下一个反应,环环相扣。这种写法会带来强烈的"叙事感"。
举个例子:
少年轻轻踩上腐朽的木板,
木板瞬间断裂,
他重心不稳向前栽倒,
顺势抓住身旁的藤蔓,
藤蔓在他的重量下剧烈摇晃,
惊起一群停在崖壁的飞鸟。
这一段提示词只有 6 个动作,但因果关系清晰——踩塌 → 栽倒 → 抓藤 → 摇晃 → 惊鸟。每一个动作既是上一个的"结果",也是下一个的"原因"。AI 模型最喜欢这种因果链清晰的写法,因为它能极大降低 AI 的"猜测成本"。
这是高质量漫剧的标配写法之一。同样的镜头数,加入因果链思维,画面观感能直接提升一个档次。
4.6 别忽视表情:最廉价的"灵性来源"
新手写互动,最容易只盯着大动作(跳起、闪避、出拳),忘掉表情。但表情是画面里最廉价的灵性来源——它不消耗 AI 太多算力,又能让画面瞬间有戏。
记住几组高频表情组合,组合起来效果非常稳:
- 惊恐 + 瞳孔放大 + 嘴角颤抖 → 极度恐惧
- 凝重 + 眉头紧锁 + 嘴角紧抿 → 严肃决断
- 冷笑 + 嘴角微扬 + 眼神锐利 → 反派气场
- 错愕 + 嘴巴半张 + 双眼瞪大 → 难以置信
- 释然 + 眉头舒展 + 嘴角微弯 → 大战之后的轻松
写互动的时候,把这些"表情组合"穿插进动作中间,情绪就出来了。
五、三大核心要素之三:节奏感(Rhythm)
节奏感是三大要素里最容易被忽略,也是最能拉开档次的一个。它指的是一段视频里画面的快慢变化。
5.1 节奏的本质:快慢的对比与切换
一段没有节奏的 AI 视频,会让人看到"一镜到底匀速跑",画面再精致也会显得平庸。而有节奏的视频,会让观众在不知不觉中跟着情绪走——快的地方紧张,慢的地方屏息,定格的地方屏住呼吸。
节奏的核心不是"快"也不是"慢",而是对比。一段 10 秒视频里:
- 前 2 秒慢镜头 + 特写(情绪铺垫)
- 中间 4 秒中景 + 主体动作(主戏)
- 后 2 秒快速拉远 + 环境收尾(留白)
这就是一个非常标准的节奏起伏曲线。
5.2 一个万能的"慢动作触发公式"
如果你用的是海螺一类擅长 3D 动作戏的模型,记住一个万能写法:
快速推进 + 仰视特写 + 细节呈现 → 紧接着 → 镜头环绕拉远
这套写法的本质,是通过**"先细后大"或"先大后细"的反差,逼出慢动作**。AI 在一个 10 秒视频里要决定"哪里慢、哪里快",而你提供的细节量级,就是它判断的依据——细节越浓密的位置,AI 会自然把镜头拖慢,以确保细节呈现完整。
举个例子:
镜头快速推进,仰视特写,
少年惊恐睁大眼睛,
瞳孔急速放大,泪光在眼眶中颤动,
紧接着镜头环绕拉远,
呈现整个悬崖被雷电劈中的全貌。
前半段"特写 + 细节"会自动触发慢镜头,因为 AI 要把惊恐的表情完整展现给你;后半段"环绕拉远"会触发快速运镜。两者一对比,节奏感就出来了。
5.3 一字之差:"细节呈现"≠"细节拍摄"
这是个非常精微的差别,但极其重要:
|
写法 |
效果 |
适用场景 |
|
细节呈现 |
画面停下来给观众看,动作几乎暂停(类似定格) |
关键瞬间、轰击瞬间、变身瞬间 |
|
细节拍摄 |
镜头继续动,但聚焦在一个点上(动作仍在持续) |
奔跑追踪、行走特写 |
例子:
少年的腿部细节呈现:
雷霆轰击过后腿部断裂,
透明的骨骼特效效果,
缓缓显现。
这段会让画面在那一刻明显慢下来,几乎定格。
少年的腿部细节拍摄:
快速奔跑中,腿部肌肉紧绷,
脚下尘埃飞起。
这段画面会持续动,但镜头始终对准腿部。
如果你要做"轰击瞬间的慢动作特效",用"细节呈现";如果你要做"奔跑中的腿部追踪",用"细节拍摄"。两个词差一个字,差出十秒画面。
5.4 节奏要靠运镜撑出来,不是形容词堆出来的
节奏感不是写一堆"快、慢、急、缓"就能搞定的。它必须靠运镜的真实变化来撑。
举个反例,有人会这么写:
画面快速运动,然后慢下来,
然后又快速运动,最后定格。
这种写法 AI 几乎理解不了,它无法把"快慢"翻译成具体的镜头动作。
正确的写法是把"快慢"翻译成具体的运镜:
镜头快速推进至少年脸部特写,
紧接着环绕拉远展示战场全景。
"快速推进"和"环绕拉远"是 AI 能直接执行的运镜指令,自带快慢对比。
5.5 节奏感的"音乐感"
你有没有注意到,一段优秀的电影预告片,画面节奏几乎和背景音乐节拍同步?这不是巧合——好的导演剪辑画面时,心里是有节拍的。
写 AI 视频提示词时,我建议你也培养这种"节拍感"。可以在脑海里先哼一段背景音乐,然后让画面节奏跟着音乐走