本文由 莫潇羽@源码七号站(www.fuyuan7.com) 撰写,转载请注明出处。
快速摘要
这是一份基于个人长期实践整理的 Midjourney 中文操作笔记,重点解决三件事:第一,把关键词「主体 + 风格 + 环境 + 视角 + 灯光 + 附加词 + 尾缀」这套公式讲透;第二,把 --ar、--s、--no、--iw、--cref、--sref 等高频参数的语法、取值范围和踩坑点列清楚;第三,沿着「白底图 → 三视图 → 动作图 → 场景图 → 表情包」的链路,把一套系列 IP 的完整生成流程拆给你看。
如果你只想要一个速记结论:Midjourney 出图的核心是「短语化关键词 + 合规尾缀格式」,关键词不超过 70 个英文单词,全英文逗号分隔;尾缀写在最末尾,每个尾缀之间必须有空格;垫图链接必须放在关键词之前,而 --cref / --sref 引用图链接必须放在最末尾。把这条铁律记住,已经能解决八成的报错问题。
想看完整拆解,往下翻就行。 我会顺手把以前踩过的坑都标出来。
一、Midjourney 关键词输入的标准公式
很多人刚上手时打开 Discord,斜杠一敲 /imagine,然后脑子里一片空白,憋了半天写了个 a girl,再憋半天又加了句 beautiful,最后出来的图当然不会好看。原因不在 AI,在于你没有给 AI 一个可以解析的结构。
1.1 七段式公式
我自己用得最顺手的一套公式,是把整条 prompt 拆成七段:
主体 + 风格 + 环境 + 视角 + 灯光 + 附加词 + 尾缀
- 主体:画面里最核心的那个东西,名词为主。比如
a sports car、an electric bicycle、a vacuum cleaner。 - 风格:你希望整体观感偏向哪一类,比如
futuristic、cyberpunk、minimalist、Japanese ukiyo-e。 - 环境:主体物所处的场景,比如
on a city street、in a living room、in deep space。 - 视角:用什么镜头看它,比如
front view、three-quarter view、close-up shot。 - 灯光:氛围塑造的关键,比如
cinematic lighting、studio lighting、golden hour sunlight。 - 附加词:补充质感、画质、风格定语,比如
octane render、8k、hyper detailed。 - 尾缀:以
--开头的参数,控制比例、模型、权重等,比如--ar 16:9 --v 6.1。
环境和风格、视角和灯光之间的位置其实可以互换,AI 不会因为顺序差异而拒绝识别,但主体一定放在最前——因为越靠前的词,权重越高。
1.2 描述长度有上限
老学员有个误区:以为关键词写得越长越细,AI 越听话。莫潇羽在源码七号站做过几十轮 A/B 测试,结论恰恰相反:关键词总长度尽量控制在 60 到 70 个英文单词以内,超过这个量,AI 反而会顾此失彼,权重被稀释,画面就开始崩。
更关键的一点:不要写自然语言。我们日常说的「一只穿着红色卫衣坐在窗边喝咖啡的猫」这种主谓宾完整的长句,对 Midjourney 是巨大的翻译负担。AI 内部要先把中文翻成英文,再把英文映射到它的向量空间里,每一次转换都会损失语义。
正确的写法是短语化:
a cat, red hoodie, sitting by window, drinking coffee, cinematic lighting
每一段就是一个独立的关键词单元,用英文逗号断开,AI 拿到之后逐段对齐到自己的特征库里,扭曲度最小。
1.3 大小写无所谓,但有一种情况例外
Midjourney 不区分大小写,Sony 和 sony 对它来说是同一个词。所以品牌名、人名你不用刻意全大写——除非你自己想看得清楚,方便核对。
但有一种情况要注意:当你引用某位艺术家的风格时,名字要写英文不要写中文。比如想要席德·米德的概念设计风,请写 by Syd Mead,而不要写「席德米德的风格」。AI 对中文人名的识别能力非常差,对著名英文人名反而很灵。
1.4 一个示例:从需求到完整 prompt
假设你要给一台立式吸尘器做产品设计图,先把脑子里的画面拆成关键词:
upright vacuum cleaner, sleek minimalist design,
black and white and grey color scheme, plastic + metal + glass material,
in a modern living room, sofa and coffee table in the background,
some scattered dust on the floor,
product photography, three-quarter view,
natural sunlight from window, studio lighting,
octane render, 8k, hyper detailed
--ar 3:4 --v 6.1
这就是一条干净的、AI 能读懂的 prompt。后面所有的章节,本质上都是在教你把这条公式的每一段写到位。
二、标点、引用与表情符号的实战用法
这一节看起来很基础,但它是新手报错率最高的地方。
2.1 三种最常用的标点
Midjourney 的 prompt 体系里,真正会被解析的标点其实就三种:英文逗号、加号、英文方括号。
|
标点 |
作用 |
示例 |
|
|
隔开不同类型的关键词 |
|
|
|
把相同类型的并列词组合在一起 |
|
|
|
在同一画面中区分多个对象 |
|
一定要用英文标点。中文逗号「,」、中文方括号「【】」对 Midjourney 来说等同于没写。我自己以前刚上手时,因为输入法没切回来,整条 prompt 全是中文逗号,AI 直接把所有词当成一个超长短语来处理,出来的图离题十万八千里。
2.2 加号的妙用
加号最常用的场景是做产品三视图。你单独写一个 front view,AI 给你一张正视图;你单独写 side view,AI 给你一张侧视图。但你想让一张图里同时呈现这三种视角呢?
three view + front view + side view + rear view
AI 看到这串并列的视角词,会自动把它们识别成同一类属性的多重表达,画面里就会同时出现三个不同朝向的产品。
类似的还有摄影风格的并列:
shot by Sony + Nikon + Hasselblad
就算你担心 AI 不认识某些品牌,把几个并列写在一起,总有一个能被识别,画面整体感会更稳。
2.3 方括号的对象隔离
方括号在多角色画面里非常有用。比如你想生成「一只戴白帽子的猫 + 一只戴围巾的狗」,如果你直接写 a cat wearing a white hat and a dog wearing a scarf,AI 很可能会把帽子戴到狗身上,把围巾系到猫脖子上。
加上方括号就稳了:
[a cat wearing a white hat], [a dog wearing a scarf], simple background
方括号告诉 AI:括号里的属性是绑定的,不要跨对象混淆。
2.4 艺术家与设计师的引用
写设计稿、概念图的时候,引用一位行业大师能直接拉高画面质感。语法非常简单,把名字放在 prompt 里就行:
... designed by Syd Mead, concept art style
... in the style of Studio Ghibli
... inspired by Dieter Rams
我自己做产品设计草图,最常用的是 Syd Mead(赛博朋克概念设计)、Dieter Rams(极简工业设计)、Naoto Fukasawa(深泽直人,无意识设计)这几位。
需要注意两点:第一,AI 不认识太冷门的设计师,找名字时尽量挑业界耳熟能详的;第二,AI 不会实时更新,今年刚火的设计师它可能根本没收录过。
2.5 表情符号也能当 prompt
这是 Midjourney 一个被严重低估的功能。打开 Discord 的表情面板,搜索关键词,比如 dog,会出来一堆狗相关的 emoji。把 emoji 直接贴进 prompt 里,AI 也能识别成「狗」这个概念。
🐕 wearing a hoodie, running in a forest, golden hour
emoji 的好处是简短、视觉化,对一些常见名词比直接写英文还快。但缺点是 AI 对复杂或抽象的 emoji 识别率不高,比如那种特别拟人化的、特别新潮的表情,它可能就只能猜个大概。
三、用 CMF + 5W 把主体物描述写到位
主体物怎么形容才算到位?这件事看似没有标准答案,但莫潇羽在源码七号站讲课的时候,会反复推这套「CMF + 5W」的描述模型。这是从工业设计的语言里借来的,套到 prompt 写作上意外地好用。
3.1 什么是 CMF
CMF 是 Color、Material、Finish 三个英文单词的首字母缩写,工业设计行业里专门描述一件产品的「外观感官属性」用的。
- Color(颜色):主色 + 辅色 + 点缀色。
- Material(材质):金属、塑料、玻璃、皮革、亚克力、碳纤维……
- Finish(表面工艺):拉丝、磨砂、抛光、电镀、打孔、压花……
举个例子,同样是「一支耳机」,下面两条 prompt 出来的图完全不一样:
prompt A: a pair of headphones
prompt B: a pair of headphones, matte black + brushed metal accents,
carbon fiber headband, premium leather earcups, fine grain finish
A 给 AI 一片想象空间,B 直接把质感锁死。如果你是要做产品的方案设计或者电商主图,CMF 必须写到位。
新手提示:表面工艺(Finish)写不出来没关系,颜色和材质先写到位就有八成效果。
3.2 什么是 5W
5W 是新闻写作里的 When、Where、Who、What、Why,套到 prompt 里同样能照单使用:
- When(时间):通过灯光体现。
golden hour、night scene、blue hour、midday sun。 - Where(地点):通过环境体现。
in a modern kitchen、on a snowy mountain、inside a sci-fi spaceship。 - Who(人物):画面里的辅助人物。产品设计里大多省略,人像类必写。
- What(事件):画面里发生了什么。
drinking coffee、running、looking through a window。 - Why(原因):很少直接写,更多是隐含在画面氛围里。
我自己写产品类 prompt,5W 里通常只写 Where(环境)和 When(灯光时间),其它能省就省,因为产品就是主角,太多人物干扰反而抢戏。人像类则相反,Who、What、Why 都要交代。
3.3 一个完整的填空示范
假设要做一辆概念电动自行车的设计草图,按照 CMF + 5W 填出来是这样:
flowchart LR
A[主体: electric bicycle, concept design] --> B[CMF: green + grey color,
carbon fiber + plastic + metal material, glossy finish]
B --> C[5W-Where: white background, clean studio]
C --> D[5W-When: studio lighting]
D --> E[视角: side view, product photography]
E --> F[引用: by Syd Mead]
F --> G[尾缀: --ar 16:9 --v 6.1]
完整 prompt:
electric bicycle, concept design, streamlined frame, ergonomic seat,
green and grey color scheme, carbon fiber + metal + plastic material, glossy finish,
white background, clean studio, studio lighting,
side view, product photography, octane render,
by Syd Mead, concept design sketch
--ar 16:9 --v 6.1
这套结构的好处是:写的时候有顺序可循,不会忘东西;读的时候 AI 也好解析。
3.4 不要写「特别简洁」
新手最容易犯的另一个错:怕写错,干脆只写一个 electric bicycle,结果就赌运气。这种「抽卡式」prompt 不是不能用,但它需要你抽到够多的卡才能撞上一张好图,效率特别低。
我的建议:能写上的全写上,按你脑子里的画面尽量丰富它。哪怕有些词 AI 不认识,它也会自动忽略,不会因为你写多了而报错。
四、视角与景别——把镜头语言讲清楚
视角和景别这两块儿,决定了你出来的图是远景大场面,还是产品的特写细节。
4.1 五种最常用的视角
|
视角英文 |
中文含义 |
用途 |
|
|
正视图 |
产品三视图、人像正面照 |
|
|
侧视图 |
自行车、汽车的侧轮廓 |
|
|
后视图 |
产品背面、人物背影 |
|
|
3/4 视角 |
最常用的产品展示角度 |
|
|
俯视图 |
桌面摆件、地图视角 |
3/4 视角是产品摄影的「万金油」——既能看到正面,又能看到侧面的厚度感,比纯正面或纯侧面更立体。
4.2 仰视、俯视与平视
除了产品三视图,还有两个角度词非常实用:
low angle shot(仰视/低角度拍摄):让物体看起来更高大、更有压迫感。汽车、建筑、英雄人物经常用。high angle shot(俯视/高角度拍摄):让物体显得弱小、可爱,或者用来呈现全局信息。盲盒、小动物、桌面布置经常用。ey