本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要 · 三十秒看完核心结论
GPT-Image 2 是 OpenAI 在 2026 年 4 月推出的新一代图像生成模型,已经集成进 ChatGPT 主对话框。它最厉害的不是「画得更漂亮」,而是把「文字渲染、版式排版、多图一致性、PSD 分层导出、Photoshop 调用」这五件事全部捏在了一个对话框里。 对商业视觉创作者来说,这意味着海报、详情页、Logo、品牌手册、UI 界面、PPT、表情包、舞蹈分镜——这些过去需要在 Figma、PS、AI、剪映之间反复横跳的活儿,现在可以靠一段提示词加几张参考图直出。
本文整理了我自己在过去一个多月里反复跑通的 十一套实战流程:从一张海报拆成可编辑 PSD,到 IP 角色四季延展,再到长图详情页一次八连发,最后还有 16 宫格分镜动作图直接接 Sora 2 出视频。每个流程都附带可复用的提示词模板、关键参数、避坑要点和真实使用感受。
想看完整拆解,往下翻就行——每个案例独立成章,按需阅读。
第一章 为什么 GPT-Image 2 值得每个商业视觉创作者认真对待
很多人第一反应是「不就是个画图模型嘛,又一个 Midjourney 的对手」。我一开始也这么想,直到把它放到工作流里压了一周。结论是:它和我们以前用过的所有图像模型都不一样。
差异在哪里?说几个能直接落到工作里的点。
第一,它内置了 Thinking Mode 推理机制,在生成前先做构图与语义推理,所以你给一段长指令,它不会再像 DALL-E 时代那样「读一半画一半」。它会先把你想要的整体结构想清楚,再下笔。
第二,文字渲染能力是质变级的。以前做中文海报、UI 界面、信息图,模型一遇到中文就糊,要么乱码要么变成抽象笔画。现在 GPT-Image 2 直接把中文当一等公民对待——表盘上的真实时间、品牌名、价格标签、按钮文案,都能写得清清楚楚。
第三,支持单次提示生成最多 8 张相关联图像,系统会保持角色、风格与物体一致性。这一条是商业落地的关键。做详情页要 6 张主图一脉相承,做 IP 表情包要 12 个动作神态一致,做品牌物料要全套色系统一——以前都靠 ControlNet + LoRA 反复折腾,现在一句话就够。
第四,它和 Adobe Photoshop 通过 MCP 服务器深度集成,可以直接在 ChatGPT 里调用 PS 能力,把生成的扁平图实时拆成可编辑的 PSD 分层。这件事我后面会专门展开,因为它直接抹平了「AI 出图」和「手动精修」之间的那道沟。
第五,多模态上下文。你可以一边对话一边修改图片,让它「把这张换成深色调」「保留人物把背景换成沙漠」「色调要和参考图一致」,每一次都是在已有图的基础上微调,不用从零再来。这种「连续对话」式的出图体验,是过去任何独立图像模型都做不到的。
把这五点合起来,GPT-Image 2 不再是「灵感板生成器」,而是真正的「商用素材生产线」。莫潇羽折腾了这一个月,对它的总评是:能用、敢用、好用。
1.1 横向对比一下,它到底强在哪里
为了让感受更具体,我把市面上常被拿来比较的几个主流图像模型,按商业视觉创作的几个关键维度做了一个对比表。
|
维度 |
GPT-Image 2 |
Midjourney v7 |
Nano Banana 2 |
Flux 1.1 Pro |
|
中文文字渲染 |
⭐⭐⭐⭐⭐ 几乎不出错 |
⭐⭐ 经常乱码 |
⭐⭐⭐⭐ 较稳 |
⭐⭐ 中文弱 |
|
单次多图一致性 |
⭐⭐⭐⭐⭐ 最多 8 张 |
⭐⭐⭐ 需要 sref |
⭐⭐⭐⭐ 较稳 |
⭐⭐⭐ 一般 |
|
思考模式 |
⭐⭐⭐⭐⭐ 原生支持 |
⭐⭐ 无 |
⭐⭐⭐ 部分 |
⭐⭐ 无 |
|
复杂版式排版 |
⭐⭐⭐⭐⭐ 商业级 |
⭐⭐⭐ 偏艺术 |
⭐⭐⭐⭐ 商业向 |
⭐⭐⭐ 偏写实 |
|
PSD 分层导出 |
⭐⭐⭐⭐⭐ 原生 |
❌ 不支持 |
❌ 不支持 |
❌ 不支持 |
|
连续对话编辑 |
⭐⭐⭐⭐⭐ 极强 |
⭐⭐ 一般 |
⭐⭐⭐ 较好 |
⭐⭐ 一般 |
|
适合人群 |
商业视觉、电商、自媒体 |
艺术创作、概念图 |
通用商用 |
写实摄影、人像 |
这张表不是给 GPT-Image 2 当吹捧用的——它在「艺术性创作」「极端写实人像」这种特定细分场景里并不一定打得过 Midjourney 或 Flux。但在我们日常的商业视觉生产场景下,它综合得分确实是目前最高的。
1.2 它适合谁,不适合谁
最后给个直白的判断:
✅ 强烈推荐使用 GPT-Image 2 的人群:
- 自媒体作者、内容创作者
- 电商运营、淘宝美工、独立品牌主
- 产品经理、独立开发者(做原型与 mockup)
- 中小品牌策划者(缺设计资源)
- 学习 AI 视觉的初学者
⚠ 不太推荐主力依赖它的人群:
- 追求极致写实人像与摄影质感的影楼摄影师
- 需要矢量源文件交付的专业设计公司
- 出版级印刷品的细节把控岗位
理解清楚自己是不是它的目标用户,比单纯听别人说「好用」要靠谱得多。下面进入实操部分。
第二章 写在动手之前:把 ChatGPT 调到正确的姿势
在跑任何一个案例之前,有几个最容易被忽视的设置,先统一交代清楚。这些细节不到位,后面再厉害的提示词都白搭。
2.1 模型选必须选「最新版」
GPT-Image 2 是绑定到具体模型版本上的能力。只有切到当前最新的 GPT-5.x 模型,图像生成和图层拆分这些进阶功能才会被激活。 如果你切到老模型(比如 GPT-4o、GPT-4),加号菜单里那些「创建图片」「Photoshop」按钮要么消失,要么点了没反应。
我自己的习惯:每次新建窗口前,先扫一眼左上角的模型选择器,确认是不是最新版。这一步不到位,后面所有功能都用不上。
2.2 思考程度调到「进阶 / Thinking」
ChatGPT 的对话框上方一般会有「思考程度」或「Reasoning」开关。做图像任务必须切到「进阶」或「Thinking」档,不要用「标准」。原因很直接:
标准模式 → 模型快速反应,画面凑合,分层任务大概率失败
进阶模式 → 先思考构图、再下笔生成,分层、文字、版式才能稳
特别是当你要做 PSD 拆分、详情页连贯、品牌视觉手册这类涉及多步推理的活儿,Thinking 模式是刚需,不是选配。必须开思考功能,这是最容易漏的,在 ChatGPT 里确保 Reasoning(思考模式)是打开的。
2.3 创建图片入口 + 宽高比强制
加号菜单里有个「创建图片」选项,点进去会出来一组宽高比预设:1:1、3:4、4:3、9:16、16:9、2:3 等等。建议每次都通过这个入口启动出图,而不是裸提示词。
为什么?因为你不强制指定比例,模型会按上一次的输出比例默认延续,经常和你想要的不一样。竖版海报硬给你出成横屏,详情页一屏一屏明明要 9:16 又跳成 4:3。每次创建图片入口走一遍,比例就被锁死。
莫潇羽的私房习惯:竖版手机海报固定走 9:16,详情页固定 3:4,公众号封面 16:9,朋友圈海报 1:1,PPT 4:3 或 16:9。
2.4 应用连接:Photoshop 一定要先 Connect
后面的 PSD 分层流程需要 ChatGPT 调用 Adobe Photoshop。这功能目前只有网页版能用,打开 ChatGPT 网页版后点击左下角个人头像,再点设置,进入「应用程序」,点右上角「新增更多」,找到 Photoshop 并完成连线。
连线只要做一次,后面所有窗口都能用。连完之后你会发现,加号菜单里多了一个 Adobe Photoshop 图标,每次需要拆 PSD 都得手动切到这里。
✅ 准备清单
[ ] 模型切到最新版 GPT-5.x
[ ] 思考程度选「进阶 / Thinking」
[ ] 出图走「创建图片」入口
[ ] Adobe Photoshop 已 Connect
[ ] 提示词准备好,参考图准备好
前置工作就这些。下面正式进入十一套实战流程。
第三章 案例一 · 一张海报拆成 PSD 分层,AI 出图不再是「死稿」
这是我个人觉得整套 GPT-Image 2 里最颠覆的一个能力。以前 AI 出图最大的痛点就一个字——「死」。出来一张图,看着挺顺眼,但客户说「文字往左挪 5 像素」「促销价改成 ¥199」「背景换个色」,你就只能整张重生。
GPT-Image 2 解决了这个问题。它能把生成的扁平海报直接拆成 Photoshop 可编辑的 PSD 分层文件,每个元素一个独立图层,拿到 PS 里随便挪、随便改。
3.1 拆分背后的原理
先讲一下原理,免得后面操作时一头雾水。GPT 生成 PSD 分层文件的本质,并不是真正"理解设计源文件",而是调用内部 Agent 对图片进行抠图、拆解和重新合成。具体来说:
graph LR
A[扁平海报] --> B[语义分割识别元素]
B --> C[逐个元素抠图保留位置]
C --> D[Python psd-tools 写文件]
D --> E[Photoshop 可读 PSD]
也就是说,这是「生图 + 图像分割 + 写代码」三件事一起干。所以为什么必须开 Thinking 模式?因为模型得先看懂画面结构,想好怎么拆,再写代码执行。
3.2 完整流程(三段提示词,照着抄)
整个流程分三步,每一步配一段提示词,顺序不能乱。
第一步:先正常出一张海报。
模型:最新版 GPT-5.x
思考程度:进阶
入口:加号 → 创建图片 → 选 9:16 或 3:4
提示词:你的常规海报提示词,例如:
「生成一张运动品牌运动鞋海报,画面运动感强烈,
包含产品主体、品牌文字、促销信息、装饰元素,
专业电商风格。」
第二步:让它把海报拆成若干独立图像。 直接在同一窗口追加:
接下来,我要把这张图改成 PSD 导入 Photoshop 做编辑。请你先把生成的这张海报拆成若干个图像,每个元素拆成独立成分,不要改变相对位置,底色为白色。
模型会重新输出一张「拆解版」,画面里能看到所有元素被白色背