AI学习吧
📍 源码七号站 AI自媒体 AI漫剧提示词深度拆解:图片是基础,提示词是指令,三要素一公式打通所有视频模型

AI漫剧提示词深度拆解:图片是基础,提示词是指令,三要素一公式打通所有视频模型

摘要:本文深度拆解AI视频创作的核心方法论,指出“图片定下限、提示词定上限”,并提炼三大核心要素——氛围感、互动感、节奏感,配合“总分总”写作公式、运镜调度与首尾帧技巧,适用于海螺、可灵、即梦等主流模型,帮助创作者用底层逻辑实现高质量出片,避免盲追昂贵工具。
字号 100%
行距 2.05
当前可见 35% 的内容
本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。

快速摘要

这是一份写给所有 AI 漫剧 / AI 短视频创作者的提示词长文教程。如果你只想要一句结论:AI 视频生成的真正本质,是"图片打底 + 提示词驱动",而所有高质量画面,都建立在三件事之上——氛围感、互动感、节奏感。其中氛围感是画面的"呼吸",互动感是画面的"骨架",节奏感是画面的"心跳"。再配合"总分总"的写作公式 + 合理的运镜调度,海螺、可灵、即梦、通义万相这类国产视频模型,你完全可以用同一套思路把效果做到接近顶配水准,而不必盲目追逐最贵的模型。下面这篇 13000 字长文,会从底层原理、三大要素、运镜、首尾帧、避坑、多工具适配、进阶思维七个维度,给你一份足够实操的拆解。

下文会从底层原理讲到具体落地公式,再到不同主流工具的语法偏好,以及 莫潇羽@源码七号站 自己长期实操中总结的小心得,想看完整拆解,往下翻


一、写在最前:提示词,才是 AI 视频真正的胜负手

很多刚入门的朋友,一上来就掉进了一个非常典型的认知陷阱——觉得"画面不够好"是因为"模型不够强",所以拼命去抢最新、最贵的视频模型,以为只要换上更高规格的工具,作品自然就能跃升一个档次。

我在 源码七号站 接触过不少创作者,有人在工具订阅上砸了几千上万块,做出来的片子跟身边用免费工具的朋友比,几乎没有本质差距,甚至画面观感还不如别人。问题到底出在哪里?答案非常简单——不是模型不够强,是提示词功底太薄

AI 视频模型,本质上只是一个调度工具。它根据你提供的图片和文字,在有限范围内做"延续推理"。换句话说,它从来不"凭空创造",它只会"延续输入"。如果你输入的是一张静态图片,这张图其实已经把风格、造型、动态趋势、环境基调全部锁死了;模型唯一能做的,就是根据你给的提示词,把这张图"动起来"。

所以你会发现一个非常关键的底层规律:

  • 图片决定你画面的下限
  • 提示词决定你画面的上限

这个认知,是所有进阶讨论的起点。

我在团队内部分享时反复强调一句话:工具会迭代,模型会更新,价格会波动,但提示词的底层逻辑几乎是稳定的。无论今天用的是海螺、可灵、即梦,还是明天突然冒出来的新模型,它们对中文语义的理解、对画面元素的调度方法,已经趋于趋同。你今天把这套底层方法论吃透了,明天换工具也只是换个壳。

理解到这一层,我们才能开始正式聊提示词。

二、AI 视频生成的底层原理:图片是地基,提示词是指令

抛开所有花哨的概念,AI 视频生成只做两件事:

2.1 第一件事:图片决定了画面的"美术设定稿"

不管你是先文生图再图生视频,还是直接喂图给模型,画面里的风格、构图、人物服饰、场景基调,几乎都已经被这张图锁死了。它就像一部电影开拍前的"美术设定稿",定下了全片的视觉调性。

风格 → 卡通/写实/二次元/水墨/赛博朋克
构图 → 主体位置/景别/视角
基调 → 冷色/暖色/对比度/光感
人物 → 服饰/造型/比例
环境 → 室内/室外/季节/天气

这些维度,提示词后面几乎都改不了——你的图里是一个穿白衣的少年站在崖边,提示词写一万遍"穿黑衣"也大概率没用,模型会顽固地坚持图里的造型。

2.2 第二件事:提示词是"调度指令"

既然图片已经把大半内容定死了,提示词还能做什么?答案是——调度画面里所有"动"的部分

这个调度,包含三个层面:

  1. 让什么动起来(主体)
  2. 怎么动、动到哪里去(动作 + 运镜)
  3. 动出什么气氛(氛围 + 反馈)

这三层做不好,你的视频就是一段"会动的图片";三层都做到位,你的视频就有了所谓的"导演感"。

2.3 视频的本质,就是"连续静态图片"

讲一个绕不开的常识:所有视频都是由一帧一帧静态图片组合而成。AI 视频生成的工作原理,本质上是基于首帧画面做连续推演,补出后面每一帧——这就是为什么"图片"才是地基,而不是"模型多贵"。如果首帧本身有问题(构图歪、主体不清),后面的推演只会把问题放大,而不是修复。

所以我的工作流第一原则是:先把图打磨到合格线,再用提示词去冲击上限。一图未平、又赶着做视频,是新手最容易走的弯路。

三、三大核心要素之一:氛围感(Atmosphere)

讲完底层原理,正式进入提示词的三大核心要素。我把它们排序为:氛围感 → 互动感 → 节奏感。三者缺一不可,但氛围感放在最前,是因为它最容易被忽视,也最能把一段视频"质感"拉开。

3.1 什么是氛围感

氛围感,是覆盖整张画面的"气氛附加层"。它不是某个角色的情绪,也不是某个动作的延伸,而是整段画面的"空气"。

经常会有反馈说一段视频"过得去,但看着干干的"、"少了点东西"——这少的东西,十有八九就是氛围感。

举个最直白的例子。同样一张人物站在山崖边的图:

  • 只让人物动一下 → 一段"会动的图"
  • 加风从右侧吹来,把披风掀起,带起脚下尘沙 → 画面立刻有了苍茫感
  • 再加一束阳光斜射、远处云雾缓缓移动 → 层次感再上一个台阶

这就是氛围感的力量。它不是噱头,是给画面注入"呼吸"的关键一步。

3.2 外景氛围:自然元素的强度分级表

外景的氛围词,几乎可以全部归到"自然元素"上——风、雨、雷、电、火、雾、烟、沙、雪、光。每一种元素都可以按强度划分梯度,强度不同,画面反馈完全不同

我把它整理成一张分级表,可以直接当做写氛围词的"取词表":

元素

极强

微风吹动发丝

大风掀起衣袂

狂风飞沙走石

飓风卷起重物

细雨蒙蒙

雨点斜打青石

暴雨倾盆

暴风骤雨

雷电

远处闷雷

雷光闪烁

雷霆轰击

紫电连珠

薄雪轻飘

鹅毛大雪

暴风雪

雪崩

薄雾弥漫

浓雾笼罩

雾气翻涌

妖雾蔽日

火星跳动

火焰窜起

烈焰冲天

熔岩奔涌

日光斜照

金光普照

光芒万丈

光柱破云

写氛围的时候,把"动作主体" + "对应强度的元素反馈"组合起来,基本就能保证画面的厚度。

3.3 氛围词不是"堆形容词",是写"看得见的轨迹"

这是新手最容易踩的坑——以为氛围感就是堆一堆抽象形容词:"凄美的氛围"、"史诗级的震撼"、"令人窒息的紧张感"。

AI 看不懂这些词。或者更准确地说,它看得懂,但生成不出对应的画面,因为这些词没有具体的视觉信号。

正确的写法,是把抽象氛围翻译成看得见的轨迹和反馈:

  • 风看不见,但你可以写:吹起的尘埃从画面左下飘向右上,扬起一片细沙
  • 雷电写一道惨白色雷光从云端劈下,瞬间照亮山谷,比写"雷声轰鸣"有用十倍
  • 雨写豆大的雨点斜着砸在青石板上,溅起白色水花,比写"瓢泼大雨"具体得多

记住一句话:风、雨、雷、电是看不见的,但它们的轨迹是看得见的。AI 模型只对看得见的轨迹做反应。

3.4 室内场景:光、尘、物三件套

很多人到了室内场景就懵——没风没雨,氛围怎么写?

我教你一个最简单的"画面联想法":闭上眼睛,回忆你小时候第一次走进祖父书房翻开一本旧书的画面——你会看到什么?

是不是会看到斜射进窗的光柱里,微微飘荡的灰尘在缓缓打转?

这,就是室内氛围感的核心。室内的氛围词,重心永远落在三处:

  • :斜射的阳光、烛光、月光透过窗棂、灯影摇曳
  • :浮动的微尘、灰尘在光柱中打转、被翻动衣物时扬起的细灰
  • :腐朽的木桌、泛黄的纸张、悬挂的旧布、墙角的蛛网

切忌不要写"尘土飞扬"——那不是氛围,那是工地。要写"微微的尘埃在光中飘零",画面立刻就活了。

3.5 氛围感是"一镜一切换",不是写一次就够

特别提醒一点:氛围感不是写在开头就万事大吉,它要在整段提示词里反复穿插。当你的镜头切换、人物动作发生变化、场景视角不同时,氛围词都要相应调整。

举个例子,假设你的视频前半段是"主角在风沙中艰难前行",后半段是"主角到达山顶,遭遇巨型异兽"——前半段的氛围词是"狂风、飞沙、衣袂猎猎",但到了后半段,氛围词就要切换为"异兽出现时空气压抑、远处雷声滚动、地面微微颤动"。两段氛围如果不切换,画面就会失去层次,看起来像同一种气氛被拖到底,非常平庸。

莫潇羽@源码七号站 团队的内部口诀就是:一镜一氛围,一段一切换。视频里有几个动作切换点,就应该有几次氛围词的切换。

3.6 氛围词写不出来怎么办

不少朋友会问:我语文不好,描述氛围的形容词总是写不出来。这是个非常常见的问题,但解决起来其实非常简单。

用大模型当你的"氛围词字典"。直接在豆包、Kimi、通义这类对话式 AI 里输入一句话:

"请帮我写出'雷电交加 + 人物惊恐'的画面氛围描述,要求用具体的视觉元素,不要用抽象形容词。"

它会直接吐给你一段可用的氛围词。

更进阶一点的玩法是反向操作——找一段你看中的电影画面,截图丢给豆包或通义,让它帮你"反推"氛围描述。这种"截图反推法"是新手快速积累氛围词库最有效的办法之一。

莫潇羽@源码七号站 的实操经验,氛围词的积累不是靠背诵,而是**"反推电影 + AI 辅助生成"两步走**。坚持一两个月,你脑海里就能存下几百个可复用的氛围模板。

3.7 进阶技巧:氛围的"前中后景"分层

最后再补充一个进阶用法——氛围是可以分层呈现的。一个高级画面,往往同时具备前景氛围、中景氛围、背景氛围三层。

以一个雪山场景为例:

  1. 前景:飘落的雪花在镜头前缓缓飞舞
  2. 中景:主角踏雪前行,每一步都留下深深的脚印
  3. 背景:远处山峰被风雪笼罩,隐约可见黑色岩石

三层叠加在一起,画面立刻具备立体感和纵深感。这是好莱坞级画面的标配。

当你的画面看起来"扁平"、"单薄",往往就是只写了一层氛围。下一次写提示词的时候,可以刻意提醒自己——前景、中景、背景,各给一点氛围词。

四、三大核心要素之二:互动感(Interaction)

如果说氛围感给画面"大地",那么互动感就是画面的"骨架"。

4.1 什么是互动

互动指的是两个或多个对象之间的反应关系。它的形式非常多样:

  • 环境:被风吹得后退、被火烤得后撤、踩塌地面
  • 物体:手抚过桌面、掀起书卷、握紧剑柄
  • 人:追逐、攻防、对视
  • 物:剑刃相撞、巨石滚落、藤蔓断裂

没有互动的画面,是死的。我经常对刚入门的朋友说:你画面里有一个人站着不动,这个人就是"死的"——不是真的死,而是没有"灵性"。AI 视频的灵性,几乎全部来自互动

4.2 写互动的"四要素法":来龙、去脉、过程、反馈

一段好的互动提示词,本质上是在回答四个问题。我习惯把它叫做"四要素法":

维度

含义

例子(以一道雷电为主体)

来龙

这个动作/元素从哪里来?

从乌云密布的天空中

去脉

它要到哪里去?

劈向悬崖边的石头

过程

中间发生了什么?

碎石飞溅,地面震颤

反馈

带来了什么后果?

主角被惊得倒退,伸手遮挡眼睛

把这四问串起来,就是一段非常完整的互动提示词。AI 看到这种描述,立刻就有了画面,因为它清晰地知道每一个元素的运动方向和因果关系。

4.3 互动会"自然带出"动作

一旦你给出第一个氛围或动作刺激(比如"狂风吹来"),人物的反应几乎是被自然推导出来的:

  • 狂风吹来 → 人物不断后退、用手遮挡眼睛、披风被吹得猎猎作响
  • 雷电劈下 → 人物惊恐跳起、瞳孔放大、身体反射性后撤
  • 大火扑面 → 人物侧身闪避、衣袖遮挡口鼻、脚下后退

也就是说,你写提示词的时候,不必把每一个动作都从头细写一遍。你只需要给出环境的"刺激源",再补一两个关键反应词,AI 就能联想出一连串符合逻辑的反馈动作。这是一个非常高效的写法。

4.4 三版对照演示:从"会动"到"有戏"

我们做一个完整的对照演示。假设画面里是一名江湖少年站在悬崖边,天空乌云密布。

第一版(只写环境):

悬崖之上,乌云密布,一道雷电从云端劈下。

这一版会出来一道雷电的画面,但人物几乎没反应,只是一个会动的背景板。

第二版(环境 + 互动反馈):

悬崖之上,乌云密布,狂风呼啸,
一道雷电从云端劈下落在悬崖边缘,碎石飞溅,
少年被风吹得不断后退,
右手抬起遮挡眼睛,
惊恐地睁大双眼。

这一版画面立刻活了——你交代了风、雷电、人物反应、表情变化,整张画面有了灵魂。

第三版(环境 + 互动 + 表情强化 + 动态走位):

悬崖之上,乌云密布,狂风呼啸,
一道惨白色雷电从云端急速劈下,
轰击在悬崖边缘,碎石飞溅,地面震颤,
少年在崖边快速跳跃躲闪,
身后是不断坠落的雷光,
他惊恐地瞪大双眼,
神情慌乱中带着一丝倔强。

第三版已经具备了出片水准。氛围(雷电、风、乌云)、互动(轰击、跳跃、躲闪)、反馈(震颤、飞溅、惊恐表情),环环相扣。

4.5 进阶技巧:让动作"串成一条因果链"

更进阶一点的写法,是把一系列动作串成因果链——一个动作引发下一个动作,下一个动作再引发下一个反应,环环相扣。这种写法会带来强烈的"叙事感"。

举个例子:

少年轻轻踩上腐朽的木板,
木板瞬间断裂,
他重心不稳向前栽倒,
顺势抓住身旁的藤蔓,
藤蔓在他的重量下剧烈摇晃,
惊起一群停在崖壁的飞鸟。

这一段提示词只有 6 个动作,但因果关系清晰——踩塌 → 栽倒 → 抓藤 → 摇晃 → 惊鸟。每一个动作既是上一个的"结果",也是下一个的"原因"。AI 模型最喜欢这种因果链清晰的写法,因为它能极大降低 AI 的"猜测成本"。

这是高质量漫剧的标配写法之一。同样的镜头数,加入因果链思维,画面观感能直接提升一个档次。

4.6 别忽视表情:最廉价的"灵性来源"

新手写互动,最容易只盯着大动作(跳起、闪避、出拳),忘掉表情。但表情是画面里最廉价的灵性来源——它不消耗 AI 太多算力,又能让画面瞬间有戏。

记住几组高频表情组合,组合起来效果非常稳:

  • 惊恐 + 瞳孔放大 + 嘴角颤抖 → 极度恐惧
  • 凝重 + 眉头紧锁 + 嘴角紧抿 → 严肃决断
  • 冷笑 + 嘴角微扬 + 眼神锐利 → 反派气场
  • 错愕 + 嘴巴半张 + 双眼瞪大 → 难以置信
  • 释然 + 眉头舒展 + 嘴角微弯 → 大战之后的轻松

写互动的时候,把这些"表情组合"穿插进动作中间,情绪就出来了。

五、三大核心要素之三:节奏感(Rhythm)

节奏感是三大要素里最容易被忽略,也是最能拉开档次的一个。它指的是一段视频里画面的快慢变化

5.1 节奏的本质:快慢的对比与切换

一段没有节奏的 AI 视频,会让人看到"一镜到底匀速跑",画面再精致也会显得平庸。而有节奏的视频,会让观众在不知不觉中跟着情绪走——快的地方紧张,慢的地方屏息,定格的地方屏住呼吸。

节奏的核心不是"快"也不是"慢",而是对比。一段 10 秒视频里:

  • 前 2 秒慢镜头 + 特写(情绪铺垫)
  • 中间 4 秒中景 + 主体动作(主戏)
  • 后 2 秒快速拉远 + 环境收尾(留白)

这就是一个非常标准的节奏起伏曲线。

5.2 一个万能的"慢动作触发公式"

如果你用的是海螺一类擅长 3D 动作戏的模型,记住一个万能写法:

快速推进 + 仰视特写 + 细节呈现 → 紧接着 → 镜头环绕拉远

这套写法的本质,是通过**"先细后大"或"先大后细"的反差,逼出慢动作**。AI 在一个 10 秒视频里要决定"哪里慢、哪里快",而你提供的细节量级,就是它判断的依据——细节越浓密的位置,AI 会自然把镜头拖慢,以确保细节呈现完整。

举个例子:

镜头快速推进,仰视特写,
少年惊恐睁大眼睛,
瞳孔急速放大,泪光在眼眶中颤动,
紧接着镜头环绕拉远,
呈现整个悬崖被雷电劈中的全貌。

前半段"特写 + 细节"会自动触发慢镜头,因为 AI 要把惊恐的表情完整展现给你;后半段"环绕拉远"会触发快速运镜。两者一对比,节奏感就出来了。

5.3 一字之差:"细节呈现"≠"细节拍摄"

这是个非常精微的差别,但极其重要:

写法

效果

适用场景

细节呈现

画面停下来给观众看,动作几乎暂停(类似定格)

关键瞬间、轰击瞬间、变身瞬间

细节拍摄

镜头继续动,但聚焦在一个点上(动作仍在持续)

奔跑追踪、行走特写

例子:

少年的腿部细节呈现:
雷霆轰击过后腿部断裂,
透明的骨骼特效效果,
缓缓显现。

这段会让画面在那一刻明显慢下来,几乎定格。

少年的腿部细节拍摄:
快速奔跑中,腿部肌肉紧绷,
脚下尘埃飞起。

这段画面会持续动,但镜头始终对准腿部。

如果你要做"轰击瞬间的慢动作特效",用"细节呈现";如果你要做"奔跑中的腿部追踪",用"细节拍摄"。两个词差一个字,差出十秒画面

5.4 节奏要靠运镜撑出来,不是形容词堆出来的

节奏感不是写一堆"快、慢、急、缓"就能搞定的。它必须靠运镜的真实变化来撑

举个反例,有人会这么写:

画面快速运动,然后慢下来,
然后又快速运动,最后定格。

这种写法 AI 几乎理解不了,它无法把"快慢"翻译成具体的镜头动作。

正确的写法是把"快慢"翻译成具体的运镜:

镜头快速推进至少年脸部特写,
紧接着环绕拉远展示战场全景。

"快速推进"和"环绕拉远"是 AI 能直接执行的运镜指令,自带快慢对比。

5.5 节奏感的"音乐感"

你有没有注意到,一段优秀的电影预告片,画面节奏几乎和背景音乐节拍同步?这不是巧合——好的导演剪辑画面时,心里是有节拍的

写 AI 视频提示词时,我建议你也培养这种"节拍感"。可以在脑海里先哼一段背景音乐,然后让画面节奏跟着音乐走

🔒
🔒 该内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 35% 内容 · 升级至 注册用户 可见 45%
👀
游客
可见 35%
✓ 当前
注册用户
注册用户
可见 45%
社区精英
社区精英
可见 100%
社区守护
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥9.9
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布0 篇
文章总数1248 篇
昨日发布1 篇
本月发布23 篇
建站时间384 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站长微语

联系站长

微信:165255185
AIGC 技术社区
致力于解码 AI前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码
友情推荐