本文由 莫潇羽@源码七号站(www.fuyuan7.com) 撰写,转载请注明出处。
快速摘要
这篇文章把 2025 年下半年到 2026 年上半年我个人在做 PPT 这件事上跑通的四条 AI 工作流,从原理到工具组合到实操步骤一次性讲清楚。
核心结论先放在前面:
1. 现阶段把 AI 用在 PPT 上,主流的工作流就这四条——AI生成大纲 + 套模板、AI生成大纲 + AI生图复刻、HTML 型 AI 一键生成、NotebookLM 出图型一键生成。
2. 这四条路线没有"绝对最优",它们对应的场景完全不一样:套模板路线最稳,适合大多数日常稿件;AI生图复刻路线最适合"视觉感拉满"的封面、章节页和精美 PPT;HTML 型一键生成胜在结果可直接编辑;NotebookLM 出图型一键生成胜在成稿质量最高,但后期改起来最麻烦。
3. 真正的破局点不是某一个工具,而是"用大模型搭骨架 + 用图像模型铺皮肤 + 用 PPT 软件做最后的可编辑层"这种分层思路。理解了这一点,工具版本怎么更新都不影响你的产出节奏。
4. 不管走哪条路线,"手动微调"这一关现阶段一定逃不掉,所谓"AI 全自动出 PPT"今年还做不到完全替代人类,但把人均效率拉到原来的 3 到 5 倍是没有问题的。
5. 配套技巧很关键:模板选型、抠图去水印、PDF 转可编辑 PPT、HTML 在线可视化编辑、母版统一署名,这些都是写出来"看起来像出自资深设计师之手"的细节。
下面,我会把每一条工作流从思路到工具到提示词到避坑点拆开来讲,并且尽量配上图表和示意,让新手看完就能照着做。想看完整拆解,往下翻。
一、为什么我要专门写这一篇
做 PPT 这件事在过去半年其实经历了一次比较剧烈的变化。
变化的起点是 Google 在 2025 年下半年陆续把 Gemini 3 Pro、Nano Banana Pro、NotebookLM 的演示文稿模块更新上线。再往前是国内的天工 AI、月之暗面的 Kimi、字节的即梦持续往多模态方向迭代。这一系列更新堆在一起的结果就是——以前那种"AI 一键生成的 PPT 九成是垃圾"的局面,被实实在在地撕开了一道口子。
我自己折腾下来的体感是:现在的 AI 已经能稳定承担 PPT 制作里"信息梳理 + 视觉表达"两块大头工作,只剩下"细节微调 + 客户对齐"留给人来做。如果你还在用 2023 年的那一套思路看待 AI 做 PPT,那确实是会感觉效率没有任何提升;但如果你愿意把工作流重新拆一遍,效率提升是肉眼可见的。
之所以我把这四条路线放在一起对比着写,是因为很多新同学一上手就纠结一个问题:到底哪个工具最好?这个问题问错了。做 PPT 真正决定效率的不是工具,而是工作流。 同一个 PPT 需求,按不同工作流去拆,会用到完全不同的工具组合,出来的成品形态也完全不一样。
下面这篇文章,我会按下面这个顺序往下展开:
- 先用一张图把四条工作流的全貌讲清楚;
- 然后按顺序把每条工作流的思路、工具、提示词、实操细节拆开讲;
- 接着做一次横向对比,告诉你哪种场景该选哪条;
- 最后甩出一份个人踩坑笔记,避免你走我走过的弯路。
后面所有内容都是我自己 莫潇羽@源码七号站 反复跑过、踩过坑、改过提示词以后总结出来的,不是看了几个测评视频就抄出来的二手知识。
二、AI做PPT的四条主流路线总览
我们先用一张表把四条路线的核心差异立起来。
|
路线 |
核心组合 |
输出形态 |
可编辑性 |
视觉质量 |
适用场景 |
|
路线一 |
大模型生成大纲 + PPT 软件套模板 |
标准 .pptx |
⭐⭐⭐⭐⭐ |
⭐⭐⭐ |
90% 的日常稿件、汇报稿 |
|
路线二 |
大模型生成大纲 + AI 生图复刻 |
半图半矢量 |
⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
封面、章节页、视觉重点页 |
|
路线三 |
大模型一键生成 HTML 型 PPT |
HTML / 可导出 .pptx |
⭐⭐⭐⭐ |
⭐⭐ |
快速出粗稿、初稿 |
|
路线四 |
NotebookLM 一键出图型 PPT |
PDF 图像稿 → PPT |
⭐⭐ |
⭐⭐⭐⭐⭐ |
成稿质量高、改动不多的场景 |
四条路线背后的取舍其实就一句话:视觉质量和可编辑性是反向相关的。 这也是为什么我反复强调"没有最优路线,只有最匹配的路线"。
我们再用一张 Mermaid 图把整体决策路径画出来:
flowchart TD
A[拿到一个PPT需求] --> B{有现成的设计灵感<br/>或参考模板吗?}
B -- 有 --> C[路线一<br/>大纲+套模板]
B -- 没有 --> D{对视觉精美度<br/>要求高吗?}
D -- 高 --> E{需要后期反复改吗?}
D -- 一般 --> F[路线三<br/>HTML型一键生成]
E -- 改动多 --> G[路线二<br/>大纲+AI生图复刻]
E -- 改动少 --> H[路线四<br/>NotebookLM出图型]
C --> I[输出标准pptx]
F --> I
G --> I
H --> J[输出PDF→转pptx微调]
这一张图我建议你截下来保存。后面每一次接到 PPT 需求时,先按这个流程在脑子里过一遍,再决定动手。
接下来逐条拆开讲。
三、路线一:大纲生成 + 模板套用——大多数稿件的基础工作流
3.1 为什么这条路线是底层基本功
这条路线虽然听起来最朴素,但它是其他三条路线都绕不开的底层基本功。原因有三个:
第一,它是唯一能给你 100% 可编辑产物的路线。最终你拿到的是一份标准的 .pptx 文件,每一个文字、图标、形状都可以单独点选、修改、对齐。客户那边要改一个字、换一张图、调一个色,你直接改就是了。
第二,它的学习曲线最低。你只需要会用任意一款大模型生成文字大纲,会用 WPS 或 PowerPoint 打开模板复制粘贴,就能跑通整个流程。哪怕完全没接触过 AI 的人,跟着流程走一遍也能在半天内学会。
第三,它的容错率最高。AI 把内容生成错了,你看一眼就能改;模板挑得不太合适,你直接换一个就行。整个工作流里几乎没有"必须重头来过"的环节。
所以我自己 莫潇羽@源码七号站 在做 PPT 时,至少 70% 的稿件还是从这条路线起步的。
3.2 工具组合
这条路线只用到两类工具:
大模型(任选其一):Gemini / DeepSeek / 豆包 / 元宝 / 通义千问
排版软件(任选其一):WPS / Microsoft PowerPoint / Keynote
大模型层面,我个人当前最偏好 Gemini,原因是它的幻觉率最低、长文档记忆力最稳。所谓"幻觉",对新手来说一句话解释清楚:就是 AI 编造客观上不存在的事实或链接。Gemini 在这一点上比国内主流大模型表现都更稳一些,尤其是在你需要它严格基于你上传的文件来回答的时候。
排版软件我推荐 WPS,主要原因是它的稻壳模板库基本能满足 95% 以上的日常 PPT 需求,不用为找模板单独烧钱。Office 也能用,看个人习惯。
这里再插一句关于上传文件格式的提醒:如果你需要让 AI 参考一份已有的 PPT 文件,一定要把它先转成 PDF 格式再上传。 直接传 PPTX 给大模型,它能读到的只有文字部分,里面的图片、设计风格、版式它统统看不见。Word 格式同样有这个问题——里面的图片对大模型来说是不可见的。只有 PDF 格式下,大模型才具备视觉理解能力,可以"看见"页面上的每一个元素,包括布局、配色、字体风格。这个细节我反复跟新手强调过,几乎每个人一开始都会忽略。
另一个关于工具的小细节:对话轮次越多,大模型的输出质量越低。这是大模型的通用规律——它对上下文的注意力是有上限的,对话轮次堆得越多,前面的信息就越容易被它"遗忘"或"稀释"。所以做 PPT 时,我建议你用完的对话轮次及时删除。比如你让 AI 帮你拆解过参考图的风格,等风格描述拿到手之后,把那一轮对话直接删掉,让后续的对话保持在一个干净的上下文环境里。这一招能让 AI 生成的大纲质量明显更稳。
3.3 全流程实操拆解
我们用一个真实的小需求举例。假设客户的需求长这样:
"需要做一份门店标准化运营手册的 PPT,大概 20 页,要简洁清爽就行,不要花里胡哨,里面要覆盖物料采购、团队编制、门店制度、商品分类、营业流程、风险防控这几个板块。"
我们按下面这套步骤往下走。
3.3.1 第一步:把客户需求"喂"清楚给 AI
新人最容易掉的坑就是上来就让 AI 写大纲,结果 AI 写出来的东西跟客户想要的差了十万八千里。
正确的做法是分两步走:
第一段对话只做一件事:让 AI 复述并理解客户的需求。
我现在要给客户做一份 PPT,下面是客户的原始需求:
[把客户原话或需求截图粘进来]
请你先复述一下你的理解,并指出你认为客户最在意的三个点是什么。
让 AI 先复述一遍,等于在帮你做一次"对齐"。如果它复述偏了,你立刻就能修正;如果它对齐了,后面的所有输出就都建立在这次对齐的基础上。
3.3.2 第二步:让 AI 生成结构化大纲
需求对齐之后,再发一条具体的生成指令:
请严格按照客户的需求,设计这份 PPT 的完整大纲。
- 总页数控制在 20 页以内,包含封面、目录页、章节过渡页、内容页、尾页;
- 每一页给我标题 + 正文要点(可直接复制粘贴到 PPT 里的那种);
- 同时给出每一页的排版建议(比如几行几列、是否要配图、建议的字号层级);
- 风格上保持简洁清爽,避免堆砌花哨元素。
这里有几个细节要特别注意:
第一个细节是页数控制。 AI 默认很喜欢"扩写"