本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
这是一篇写给纯小白看的 AI 绘画长教程。 全文围绕一条主线展开:先用「主体 + 场景 + 综述」这条万能三段式破冰,再补上风格、环境、主体、光影、质感这五个维度让画面饱满,最后借助大模型把简短想法扩写成完整的提示词。 工具上我选了字节跳动旗下的即梦 AI(官网 https://jimeng.jianying.com/),底层模型是 Seedream 系列——2025 年 9 月发布的 4.0 版本统一了文生图与图像编辑,单次最高支持 4K 输出、推理速度比 3.0 提升 10 倍以上,到 2026 年初又先后推出了 4.1、4.5 与 5.0 Lite。新手认真看完这一篇,足以独立完成第一张能拿得出手的作品。想看完整拆解,往下翻。 莫潇羽@源码七号站,下面正文开始。
一、为什么是现在:AI 画图进入"普通人能玩"的时间窗
先把一件事说清楚:AI 绘画并不是一个新东西。2022 年那波 Stable Diffusion、Midjourney 火出圈的时候,技术门槛其实挺高,自己部署一套 SD 要折腾显卡、装环境、下模型、改配置;Midjourney 则要在 Discord 里输入复杂指令、还得习惯英文提示词。那个阶段,AI 绘画属于"少数人的玩具"。
真正的拐点发生在 2024—2025 年。国内一批中文 AI 绘画产品集中爆发:即梦 AI、文心一格、可灵、堆友、Liblib、奇域、星流……它们把"装环境""学英文""背命令"全部收进了云端,普通用户登录账号、点几下就能出图。我把这个阶段叫做"自来水时代"——你不用懂水管怎么走,拧开龙头就有水。
从模型能力的角度看,2025 年前后是国产模型反超的关键节点。字节跳动 Seed 团队的 Seedream 系列,从 2.0 的中英双语图像生成,到 3.0 的高分辨率与文字渲染,再到 4.0 的"文生图 + 图像编辑 + 多图组合"一体化,国产模型在中文语义理解、东方审美、文字版式三个维度都已经追到了海外第一梯队的水平,甚至在中文场景里有反超的趋势。这种节奏决定了一件事:对中文用户来说,今天入门 AI 绘画,留在国内主流平台就能玩得很尽兴。
为什么我反复强调"时间窗"?因为这扇窗不会一直敞着。再过两年,AI 绘画大概率会像短视频剪辑一样,从"少数人能玩"变成"人人都会",到那时,会画 AI 图本身就不再是稀缺技能。真正能拉开差距的,是你对"如何描述画面"的能力——这种能力既包括艺术审美,也包括把审美翻译成提示词的语言能力。这恰恰是这篇博文想帮你建立的底层素养。
接下来的内容,我会带你从工具选型出发,把入门 AI 绘画需要的每一步拆开讲清楚。整篇文章的脉络是:选对工具 → 看懂界面 → 摸清模型 → 写好提示词 → 玩转融合 → 学会后期 → 提升审美 → 形成闭环。读完这一遍,你应该能独立产出一张"拿到朋友圈不丢人"的图。
二、工具选型这件事,到底该看什么
经常有读者来源码七号站问我:"莫潇羽,市面上这么多 AI 画图工具,我该用哪一款?" 这个问题没有"标准答案",但有"判断标准"。我自己挑工具的时候,会顺着下面这条思路走。
选工具的四个维度
把 AI 绘画工具放在一个坐标系里看,大致有四个维度需要权衡。
第一个维度是语义理解。中文用户写"江南烟雨""国风工笔""敦煌飞天",工具能不能听懂?海外模型在英文场景下基本无敌,但一旦切到中文,要么把"江南"画成欧式小镇,要么把"汉服"画成韩服。国产模型在这件事上有天然优势,因为训练数据里中文语料的比例本来就高。
第二个维度是工作流闭环。文生图能不能在同一个平台里直接做后期?要不要再跳去 PS、Figma、剪映拼接?工具链越长,新手越容易在某个环节卡住放弃。
第三个维度是学习曲线。打开第一眼是不是就知道按钮干嘛?术语解释是不是友好?犯错之后能不能找回上一步?这些细节决定了一个工具是"前两小时就能上手"还是"前两周都在摸索"。
第四个维度是成本结构。免费额度够不够新手练手?付费的性价比怎么样?有没有"按量付费"和"包月"两种灵活方案?
我为什么把即梦 AI 当作第一站
把这四把尺子套到即梦 AI 上,匹配度相当高。
即梦 AI 是字节跳动旗下的一站式 AI 创作平台,前身是 2024 年 3 月内测的 Dreamina,2024 年 5 月正式更名为「即梦」,官网地址是 https://jimeng.jianying.com/,手机端在各大应用商店都能搜到,登录方式直接绑定抖音账号或抖音绑定的手机号,几乎零门槛。
中文语义这块,即梦背后的 Seedream 系列模型从 2.0 时代就主打中英双语,到了 4.0 已经在多个公开评测里进入业界前列。 你写"撑着油纸伞走在青石板路上的水墨少女",它能比较准确抓到"江南"的味道,而不是把场景渲染成威尼斯。
工作流这块,即梦把"文生图、图生图、智能画布、图生视频、对口型数字人、动作模仿、Agent 模式"塞进了同一个平台。我(莫潇羽)自己用下来的体感是:从灵感冒出来到成片导出,95% 的步骤都能在一个标签页里搞定,不用频繁跳来跳去。
学习曲线上,即梦的界面相当"不绕"。中央就是一个提示词输入框,下面排着模型、比例、清晰度几个核心参数——这是新手最容易上手的布局。我以前教家里长辈用,老人看两遍就能自己输入提示词、选比例、点生成。
成本这块,普通用户每天会获得当日的免费灵感值(积分),足够生成基础数量的图片。如果你只是周末出几张壁纸、社交媒体配图,免费额度其实够用。重度用户再考虑付费会员,按月或包年都有,丰俭由人。
即梦不是"唯一解"
我必须把这一点摆清楚:没有任何一款 AI 画图工具是"全能选手"。即梦在国风、东方写实、电商场景图、文字海报上很强,但碰到一些极致的西式奇幻、暗黑风、机械废土,海外模型有时候反而更对味。我自己的工作流是:即梦做主力,必要时切到其他模型补足风格。
不过对纯小白来说,"集邮十款工具"远不如"把一款用透"。你前面三个月就专心把即梦摸熟,等到提示词肌肉记忆建立起来之后,再去拓展其他工具会非常快。
三、即梦 AI 网页端与移动端的功能地图
打开 https://jimeng.jianying.com/ 登录之后,新手最常见的反应是:"这一堆按钮都是干嘛的?" 这一节我把界面拆开来讲。
网页端的核心功能区
网页版的布局可以简单理解为"左边导航 + 中间主创作区 + 右边历史记录"。
左侧侧边栏从上到下排着这几个功能:
灵感 —— 创意社区广场,逛别人的作品 + 偷师提示词
生成 —— 你的历史记录,时间倒序排列
资产 —— 生成过的所有图片视频,统一归档
画布 —— 智能画布,多图层编辑器(网页端独有)
Agent —— 自然语言对话式创作,新功能
灵感值 —— 当前积分余额
这里专门提一句:画布功能目前是网页版独有的入口,移动端 App 暂时没有,所以如果你的需求里涉及多图层、扩图、抠图、局部重绘,那基本默认要在电脑上操作。
中央的主创作区,最上方是模式切换:「图片生成 / 视频生成 / 数字人 / 动作模仿」。新手前期 90% 的时间都泡在「图片生成」里,其他三项等熟悉之后再玩。
中间是一个大文本框,把你的提示词敲进去就行。文本框下方依次是几个参数:
|
参数 |
选项 |
新手建议 |
|
模型 |
3.0 / 3.1 / 4.0 / 4.1 / 4.5 |
国风奇幻选 3.1,写实选 4.0 起步 |
|
比例 |
1:1 / 9:16 / 16:9 / 3:4 / 4:3 等 |
壁纸 9:16,封面 16:9,发圈 1:1 |
|
清晰度 |
标清 1K / 高清 2K(4K 部分会员) |
一般高清 2K 够用 |
|
文字增强 |
开关 |
画面里有中英文字时开 |
参数确认之后,点生成按钮,几秒到十几秒就能出 4 张图。
移动端 App 的差异
手机端 App 在功能布局上跟网页版有几处不一样的地方。
第一是底部 Tab 结构:首页(创作)、社区(灵感)、消息、我的,更像一个手机原生应用的形态。
第二是右下角的"灵感向导":这是手机端独有的辅助写提示词功能,进入文生图界面后,右下角会看到一颗小星星图标,点开后输入简短关键词,就能自动扩写成完整的提示词。这个功能在第六章会专门讲。
第三是没有画布入口:再说一次,多图层、扩图、抠图、局部重绘这些操作都需要电脑端完成。
第四是支持拍照即用:手机端的相机入口允许你直接拍照上传当参考图,做"老照片复活""真人 IP 形象"这类玩法的时候会很方便。
几个新手最容易走错的入口
第一个坑,"灵感"和"生成"经常搞混。"灵感"是别人的作品广场,"生成"才是你自己的历史记录。新手有时候在灵感里找不到自己昨天的作品,就是走错了入口。
第二个坑,"画布"和"图片生成"是两条独立的路径。文生图属于"图片生成"模块,是从空白开始;画布是后期编辑,需要先有图(生成或上传)才能进去操作。这个流程理顺了,你就不会在"为什么扩图选项找不到"这类问题上耗时间。
第三个坑,模型切换在每次生成前都可以单独选。很多人以为模型是"账号级"设置,其实它是"任务级"——你每次跑图都可以选不同模型对比效果,这恰恰是后面我会讲到的"双开比对"的前提。
四、模型版本选哪个:3.1、4.0、4.1、4.5 各有所长
即梦 AI 同时挂着好几个版本的模型,新手最大的疑问就是"我该选哪个?" 这一节先把每个版本的脾性讲清楚,再给一份选型表。
Seedream 系列的演进脉络
按时间顺序梳理一下:
- Seedream 2.0:中英双语图像生成基础版本,文字渲染开始具备实用性。
- Seedream 3.0:2025 年 4 月落地即梦与豆包,原生支持高分辨率,文本排版、视觉美感、推理速度全面升级。
- Seedream 3.1:在 3.0 基础上针对国风、动漫、人像审美做了进一步调优。
- Seedream 4.0:2025 年 9 月 9 日正式发布,把"文生图 + 图像编辑 + 多图组合"统一进同一个 DiT 架构,原生支持最高 4K 输出、推理速度比 3.0 提升 10 倍以上,单次最多支持 10 张参考图输入、最多输出 15 张相关联的图像。
- Seedream 4.1(Design):在 4.0 基础上对平面设计能力做了强化,海报编辑、影视分镜场景表现更突出。
- Seedream 4.5:在人像、场景、美观度维度有显著改善,画面美感与推理能力进一步提升。
- Seedream 5.0 Lite:2026 年初推出的轻量版本,引入实时检索能力,让模型能根据时效性内容生成图(比如根据当天天气生成城市海报)。
模型迭代节奏非常快,几乎每个季度都会有新版本。这对使用者意味着两件事:第一,你今天学的提示词技巧三个月后可能需要微调;第二,遇到"新版本上线"的时候不要立刻抛弃旧版本,因为有些版本对特定风格的支持反而更好。
我的选型表
下面这份表是我(莫潇羽@源码七号站)反复测试后的经验,新手可以直接拿去用。
|
创作题材 |
优先模型 |
备选 |
原因 |
|
国风、二次元、奇幻、漫画 |
3.1 |
4.5 |
3.1 偏意境与手绘感 |
|
写实人像、商业摄影 |
4.0 / 4.5 |
3.0 |
4.5 在人像上有进一步优化 |
|
海报、文字渲染、电商场景 |
4.0 / 4.1 |
— |
4.1 专门强化平面设计 |
|
多图融合、换脸、合影 |
4.0 |
— |
多图编辑能力是 4.0 起步 |
|
快速概念稿、批量出图 |
3.0 |
3.1 |
3.0 速度最快 |
|
4K 高清成品 |
4.0 |
4.5 |
原生支持 4K |
双开比对:少走半年弯路的小习惯
同一句提示词在 3.1 和 4.0 上的成片可能差异很大。3.1 偏二次元手绘感,4.0 偏写实甚至 3D 卡通建模感。新手最容易犯的错是"选错模型怪自己提示词写得不好",反复改提示词依然没改善。
我的做法是:每写一段提示词,先用 3.1 跑一次,再用 4.0 跑一次,对比看哪个更接近预期。这种"双开比对"的习惯一旦建立,你会很快摸到每个模型的脾气,下次新题材直接就知道用哪个版本。
类似的对比逻辑也适用于 4.0 与 4.5 之间的微调,4.5 的人像更"耐看",4.0 的细节更"硬",做古风全身像的时候 4.5 经常给出更舒服的氛围。
五、提示词的五个维度:把画面要素拆开来描述
工具讲完,进入这门课的真正干货:到底怎么写,AI 才听得懂。
我把提示词的核心要素压缩成五个维度——风格、环境、主体、光影、质感。这五个维度不是必须全写齐才能跑图,但你越能把这五个维度都写全,AI 的可控性就越高。下面一一拆开讲。
风格(Style)
风格决定画面整体的"视觉语系",也就是这张画看上去像什么类型的作品。它会全局影响后面所有元素的渲染方式,所以风格词通常放在提示词的开头或末尾的显眼位置。
常见的风格词有这些类别:
- 写实类:写实摄影、商业人像、电影质感、纪实摄影、胶片、宝丽来。
- 动漫类:日系动漫、新海诚、宫崎骏、京阿尼、吉卜力、二次元、赛璐璐、漫画风。
- 绘画类:油画、水彩、水墨、工笔、写意、版画、素描、彩铅、丙烯、波普艺术。
- 3D 类:皮克斯风、迪士尼 3D、卡通渲染、Octane 渲染、C4D 质感。
- 国风类:宋代工笔、敦煌壁画、青绿山水、唐风、明制汉服、国风奇幻、古风摄影。
- 科幻类:赛博朋克、蒸汽朋克、太空歌剧、机械废土、未来都市。
- 其他:像素画、剪纸、毛毡、粘土动画、刺绣、玻璃艺术。
一句话写不下太多风格词,新手前期挑一个主风格 + 一个次风格组合就够了,比如"日系动漫风格,参考新海诚的色彩"。
环境与背景(Environment)
主体所处的空间、时间、天气。环境词不仅决定背景画什么,还会反过来影响主体身上的光线方向、阴影投射、色彩基调——这一点新手往往忽略。
环境可以从这几个维度铺:
- 自然环境:森林、雪山、湖泊、海岛、沙漠、草原。
- 城市环境:摩天大楼、雨夜街道、地铁站、咖啡馆、复古书店。
- 室内环境:阁楼、图书馆、阳光房、艺术展厅、儿童房。
- 特殊环境:古代宫殿、未来科技都市、童话森林、太空站、深海。
- 时间维度:清晨、黄金时刻、正午、傍晚、夜晚、深夜、午夜。
- 天气维度:晴朗、阴天、雨天、雪天、雾天、雷暴、风沙。
环境越具体,画面就越"有戏"。"森林里"远不如"被晨雾笼罩的针叶林边缘,地面铺满金色落叶,远处有一束阳光刺破树冠"。
主体(Subject)
主体是画面里最醒目、最想被观众看到的那个东西。可以是人物、动物、植物、物品、文字、抽象图形。
主体的描述应该尽可能具体——不是"一个女生",而是"一位身着白色棉麻长裙、马尾辫、手持竹编篮的清秀少女"。具体程度直接决定 AI 的可控性。
主体描述的展开顺序,我建议按"是什么 → 长什么样 → 在做什么"三步走:
- 先说主体类别(女孩 / 男人 / 猫 / 机甲 / 物件)。
- 再补外观特征(年龄、发型、穿着、配饰、姿态、表情、手里拿着什么)。
- 最后加情境("站在宇宙飞船舱口""坐在油菜花田中央微笑")。
光影与氛围(Mood & Lighting)
这是从摄影美学借来的维度,也是新手最容易忽略、但最能拉开图片质感差距的部分。
常见的光影氛围词:
光线方向:正面光、侧光、逆光、顶光、伦勃朗光、轮廓光、剪影
光源类型:自然光、阳光、月光、烛光、霓虹光、火光、丁达尔光、体积光
光线特质:柔光、漫射光、硬光、高光、低光、电影级布光、阴影对比强烈
情绪氛围:温馨、梦幻、宁静、肃杀、孤独、史诗感、紧张、神秘、忧郁、治愈
光影词的威力远超你想象。同一个主体(少女在森林里),加上"金色夕阳暖光,温馨梦幻"就是治愈系;换成"月光冷光,沉静肃杀"立刻变成悬疑日漫。AI 会根据这两个词同步调整色温、对比度、阴影方向,相当于给你画了一张完全不同情绪的图。
清晰度与质感(Detail & Texture)
这是收尾的"修饰词",告诉模型这张图要多精细。常见的有:
- 画质词:超清、4K、8K 分辨率、电影级渲染、HDR、专业摄影、获奖作品。
- 细节词:细节丰富、皮肤纹理细腻、毛发清晰可见、丝绸质感、金属反光。
- 景深词:浅景深、虚化背景、清晰前景、慢门、长曝光、运动模糊。
质感词放在提示词的末尾就行,AI 会把它当成"全局质量参数"。
五维全齐的最小示例
把这五个维度串起来看一个最简单的例子:
插画风(风格)+ 夜市灯光下的梦幻背景(环境)+ 猫耳少女(主体)
+ 柔和暖光(光影)+ 超清(质感)
合并成一句话:
插画风,夜市灯光下的梦幻背景,猫耳少女,柔和暖光,超清
把这句话扔进即梦 AI,选 9:16 比例、3.1 模型,几秒后就能拿到一张像样的国风二次元少女。
莫潇羽的小贴士:写不出五大要素全齐的提示词没关系,先从两个开始("风格 + 主体"),跑出来看看;不满意再加第三个、第四个。这是一个迭代过程,不是一次性写到位的考试。
六、万能三段式:主体 + 场景 + 综述
五维拆解听上去多,写起来还是会卡壳。我把它进一步压缩成一条更顺口的公式:
万能提示词 = 主体 + 场景 + 综述
主体描述"画面里有什么",场景描述"它在哪儿、什么时候",综述把剩下的风格、光影、镜头、画质统一塞进去。这条公式的好处是结构稳定、顺序清晰、AI 解析最不容易跑偏。
主体怎么写
主体的展开分三步:
第一步,先把"它是什么"说清楚:一位戴博士帽的教授、一只蹲在窗台的橘猫、一台复古打字机。这一步如果含糊,整张图就会偏离。
第二步,补充外观特征:年龄、性别、发型、穿着、姿态、表情、配饰、手里拿着什么、身体朝向。比如"一位穿白色实验室外套、戴金丝眼镜的年轻女科学家,正侧身低头看试管"。
第三步,加情境信息:"站在宇宙飞船舱口的宇航员""坐在油菜花田中央微笑的少女"。情境词同时也起到承接主体和