本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
想让 AI 出图从"开盲盒"变成"按图施工",核心只有一句话:先建立"底模 + 提示词 + 参数"这套黄金三角的全局认知,再用即梦的"智能参考"把边缘、姿态、景深、风格逐项锁死。 我自己折腾即梦这套精细控图体系下来,最大的体感是——决定一张图成败的从来不是运气,而是你有没有把"内容"和"风格"这两层拆开来管:底模决定画风基因,提示词决定画面内容,参数(画面比例 + 参考强度)决定可控边界;而真正让构图、轮廓、姿态、虚化"听话"的,是智能参考里那几种参考方式。把这五件事的逻辑捋顺,新手也能稳定产出电商主图、3D 渲染、写实人像、创意海报这类专业级成片。
这篇我会从底层原理一路讲到边缘控制、姿态控制、景深控制、局部重绘、智能扩图、风格迁移,再到电商换装和创意海报的完整落地流程,每一节都配了操作拆解、对照表和流程图。想看完整拆解,往下翻。
一、先想明白:为什么你的 AI 出图总是"不受控"
我接触 AI 绘画工具这两年,被问得最多的一句话是:"为什么同样一段描述,别人出来是大片,我出来是废片?"
答案其实很朴素。文生图这种玩法,本质上是把一段文字丢给模型,让它在一个巨大的可能性空间里"自由发挥"。你给的信息越模糊,模型自由发挥的空间就越大,出图的随机性也就越高。新手最容易踩的坑,就是把全部希望寄托在"写一段好提示词"上,却忽略了一个事实:决定画面长什么样的因素远不止文字这一项。
我自己的做法,是先把出图这件事拆成两个完全不同的维度来看——一是"画面里有什么"(内容),二是"画面长什么调性"(风格)。这两件事在传统认知里是混在一起的,但在精细控图的世界里必须分开管理。内容靠提示词和参考图来约束,风格靠底模和风格迁移来约束。一旦你能把这两层在脑子里分开,很多"出图玄学"立刻就变成了可以拆解、可以复现的工程问题。
这里值得多停一下,把"模型为什么会出废片"讲透,因为想明白这一层,后面所有的控图手段你都能秒懂。AI 出图的内部过程,简单说是从一团随机噪声出发,按照你给的文字一步步把噪声"去掉",逐渐还原出一张图。这个还原过程里有大量的随机性:噪声的初始形态是随机的,模型在每一步选择"该往哪个方向画"时也带着概率。你给的约束信息越少,这些随机选择就越自由,于是同样一句话,今天给你一张构图、明天给你另一张构图,全凭运气。
所谓"精细控图",做的事情就一件——往这个随机过程里塞进更多确定信息,把模型乱跑的空间一点点压小。文字是一种确定信息,参考图是更强的确定信息,参考强度则决定这股约束力有多大。等你建立起"控图 = 压缩不确定性"这个直觉,你会发现这篇文章后面讲的每一个功能,本质上都是在回答同一个问题:我还能再多给模型一点什么确定信息?
即梦 AI 是字节跳动旗下的一站式视觉创作平台(官网 jimeng.jianying.com),集文字绘图、文字生成视频、图片生成视频于一体,支持移动端和网页端双端使用,登录方式也很灵活,手机号、第三方账号授权都行。它最让我看重的一点,是把"可控生成"做得相当完整:智能画布支持在生成的图片基础上进行扩图、局部重绘、消除抠图和高清放大等二次创作,再叠加智能参考里的边缘、深度、姿态控制,基本覆盖了从概念到成品的全链路。它还内建了创意社区,里面有个"做同款"功能,能直接复用别人作品的提示词来生成相似风格——我自己学新风格的时候经常去社区扒思路,比闷头试错快得多。这篇攻略,我就用源码七号站站长莫潇羽一贯的"先讲原理、再上手实操"的路子,把这套控图体系彻底讲透。
二、出图的黄金三角:底模 + 提示词 + 参数
如果只让我留一个认知给新手,那一定是这个公式:
[
\text{底模} + \text{提示词} + \text{参数} = \text{最终成图}
]
这三者缺一不可,且各管一摊。我见过太多人把全部注意力压在提示词上,反复打磨措辞,却始终对底模和参数视而不见——这就像一个厨师只盯着菜谱,却不管用的是什么灶、火开多大,菜自然炒不好。出一张好图,从来是这三件事协同的结果,任何一环掉链子,另外两环再用力也白搭。下面这张图能帮你建立直觉:
graph TD
A[最终成图] --> B[底模 · 画风基因]
A --> C[提示词 · 内容指令]
A --> D[参数 · 可控边界]
B --> B1[决定写实/卡通/国风/海报等整体气质]
C --> C1[决定画面里有什么主体、场景、光影]
D --> D1[画面比例]
D --> D2[参考强度/精细度]
2.1 底模——AI 的"画风基因"
底模你可以理解成 AI 的"画画功底"或者"出身画派"。同一段提示词,换一个底模,出来的东西可能天差地别。我做过一个很直观的实验:把完全相同的一段描述,分别丢给写实向和设计向两个底模,一个给我的是皮肤纹理清晰、光影自然的真人质感,另一个给我的是色彩鲜艳、造型夸张的潮玩公仔感。文字一个字没改,气质完全两个世界——这就是底模在起作用。
所以选底模这一步,本质上是在为整张图"定调"。你想要的是杂志写真,还是 3D 手办,还是水墨国风,第一步就该在这里做决定,而不是指望后面用提示词硬掰。
我打个比方你就懂了:底模像是请来给你画图的"画师"。你请的是一位专攻写实油画的画师,跟你请的是一位专攻日系动漫的画师,哪怕给的是同一份需求文档,交付的作品风格也必然不同。提示词只是那份需求文档——它能规定画里有什么人、什么场景,却没法把一位写实画师强行掰成动漫画师。这就是为什么我反复强调"先选模型、再写词":顺序反了,你会在提示词上耗费大量精力却始终拧巴。
2.2 提示词——给 AI 的精准指令
提示词是你给 AI 的"口头指令"。它不负责画风(那是底模的活儿),只负责告诉模型"画面里到底要有什么"。这一块我在后面第四节会专门展开,这里先记住它在三角里的定位:内容的来源。
2.3 参数——出图的"微调旋钮"
参数是即梦的"作画设置",新手阶段你只需要重点抓两个:
第一个是画面比例,它决定输出图片的形状。横版 16:9 适合电脑壁纸、视频封面;竖版 9:16 是抖音、小红书这类移动端信息流的主力尺寸;1:1 则常用于电商组图和头像。
第二个是参考强度(有些场景里也叫精细度),这是精细控图的灵魂参数。在即梦图片生成里导入参考图之后,除了识别主体、人像写真、人像合影这几个模式之外,其它功能都带有"参考强度"这个调节项。数值越高,成图就越贴近参考图;数值越低,模型自由发挥的空间就越大。理解这个旋钮,你后面所有的控图操作都会顺很多。
关于参考强度,我再给你几个我自己摸出来的经验区间,省得你瞎试。要"严格照搬结构"(比如线稿转 3D、必须 100% 还原轮廓)时,往 80—100 拉;要"参考着发挥"(比如借姿态但允许人物长相、服装融合调整)时,放在 50—70;要"只取一点神韵、大部分让模型自由"时,压到 30 以下。没有标准答案,但记住这条规律——强度和"还原度"正相关,和"创意自由度"负相关,你就不会调错方向。我做商业稿讲究稳定复现,一般偏高;做创意探索图想要惊喜,一般偏低。
把三者放进一张表里对照,逻辑就清晰了:
|
维度 |
管的是什么 |
怎么调 |
新手常见误区 |
|
底模 |
画风基因(整体气质) |
按场景选模型 |
用错模型还怪提示词 |
|
提示词 |
画面内容(有什么) |
套用结构化公式 |
写得太空泛、太短 |
|
画面比例 |
画幅形状 |
按发布平台选 |
一律默认 1:1 |
|
参考强度 |
贴合参考图的程度 |
0—100 区间滑动 |
不知道这个旋钮存在 |
三、读懂即梦的模型矩阵:什么场景配什么底模
选模型这件事,我建议你别背参数,而是记"场景对应关系"。把"我要做什么"和"该用哪个模型"绑在一起记,上手最快。下面这张选型表是我自己实测后整理的常用对照,供你直接抄作业。
|
出图诉求 |
推荐方向 |
我的实测体感 |
|
写实人像、商业写真 |
新版写实向模型(如 4.x 系列) |
皮肤纹理真实、光影自然,几乎看不出 AI 痕迹 |
|
3D 潮玩、设计感公仔 |
设计向模型(如 4.0) |
造型饱满、色彩鲜艳 |