本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
卡通像素风的科普类短视频,本质是把"知识点 + 玩梗 + AI画面"这三件事捏到一条 1200 字左右的脚本里。整个生产流程可以压缩成四个模块:AI 写文案、人工改前五秒、AI 出画面、剪映做开头与组装。文案靠大模型一遍出稿,关键句靠人手工调;前两秒决定 25% 完播率,必须有悬念音效 + 三字标题 + 像素小人的"震惊看望远镜";中段画面优先用 DeepSeek 写提示词 + 即梦/Vidu 类工具图生视频,辅以动漫素材库替代,原创度足够高就能反复复用。整套链路新手当天就能跑通,核心是把每一步都做成可复制的"固定模板"。
想看完整拆解,往下翻。
一、为什么卡通像素风的科普视频值得做
我自己折腾这个赛道有一段时间了,一开始也是被一条 50 万播放的猪打蛇视频吸引进来的——那条片子我后来拆开看,从文案到画面再到剪辑,几乎没有一处是"高门槛"操作。能做到的人,只要肯花一周时间摸流程,基本都能搞定。莫潇羽@源码七号站后来把这个流程整理成了一套可执行的清单,这篇就是把清单展开讲清楚。
1.1 这个赛道现在长什么样
如果你刷过一阵子知识科普类账号,会发现一个有意思的现象:真人出镜的科普号在变少,卡通化、像素化、Q版小人形象的科普号在变多。原因不复杂,卡通化的呈现方式天然规避了几个难点。
第一,不用露脸。镜头感、口才、颜值这些原本是真人出镜博主的硬门槛,在像素风账号里全部不存在。配音可以用 AI 合成,小人形象由 AI 生成,你不用买灯光不用买相机,一台中等配置的电脑就能开干。
第二,风格统一容易做。卡通像素风的画风本身就带"颗粒感",很多 AI 生图工具的瑕疵反而被这层颗粒感盖住了。真人视频里一帧穿帮就是事故,像素风里多一点抖动观众反而觉得"挺有感觉"。
第三,素材可复用。一个像素小人形象、一张森林地形图、一组通用音效,可以在你后面几十条视频里反复出现,只要换主题、换核心 AI 视频就行。这条规律我反复验证过,只要文案够新,旧素材完全不影响数据。
1.2 选题的几个朴素逻辑
像素风账号最容易出爆款的选题,我自己摸出来的规律有这么几条:
第一类是反常识科普。比如"为什么猪是蛇的天敌""为什么马要被当作动力单位""为什么静脉血不会得癌症"。这类题目自带一个钩子——观众脑子里有一个朴素印象,你的标题告诉他这印象可能是错的,他就有动力点进来听你解释。
第二类是冷门的生活原理。像家用电器里某根线为什么用红色、菜市场里的鱼为什么活着出水后会"喘",这类选题受众面广,而且评论区天然爱讨论,互动数据漂亮。
第三类是把热点知识化。最近哪个新闻火、哪个游戏出新版本、哪个明星上了热搜,只要里面有一个能被你拆出"原理"的小点,就可以做。这条最依赖反应速度,但回报也最直接。
选题这件事我建议先囤后用。我自己在备忘录里常年挂着一份"待拆解清单",刷到任何一个让我"咦"了一下的小知识就记下来,拍片的时候挑一个能在 1200 字里讲清楚的就行。
1.3 一条爆款视频长什么样
把这个赛道里跑得好的片子拆开,你会发现它们的结构高度雷同。我归纳成下面这张表格,方便你对照:
|
时间区间 |
内容职责 |
数据目标 |
|
0-2 秒 |
悬念标题 + 像素小人震惊反应 |
25% 以内的两秒跳出率 |
|
2-5 秒 |
抛出"反常识"结论或第二钩 |
把五秒完播稳到 50% 以上 |
|
5-30 秒 |
用 3-5 个 AI 生成画面讲清原理 |
维持画面节奏不掉 |
|
30-60 秒 |
玩梗、引用经典动漫/影视场景 |
提升点赞与停留 |
|
60 秒后 |
结尾轻引导互动 |
评论与完播双拉 |
整篇视频时长建议控制在 60-90 秒之间。再短信息密度不够,再长完播率会被拉下来。
1.4 这套打法对新手特别友好的几个原因
我经常被问"我什么都不会能不能学",答案是:这套打法基本就是为零基础设计的。原因有这么几条。
软件门槛低。整条链路里用到的工具只有四个——一个能跑大模型的本地客户端(用来调用智能体写文案)、一个 AI 大模型对话页面(写画面提示词)、一个图生视频网站(出 AI 画面)、剪映(剪辑)。这四个里只有剪映需要稍微花点时间熟悉,其他都是"复制粘贴回车"级别的操作。
思维门槛低。整个流程是高度模板化的,你不需要懂分镜、不需要懂镜头语言、不需要懂调色。固定的开头格式、固定的造梗模板、固定的素材库调用方式,记住几条就能写完一整条片。
成本门槛低。AI 写文案的部分有大量免费方案,图生视频网站普遍有每日免费额度,剪映免费功能就够用。前期完全可以零成本跑通整条链路,等数据起来再考虑要不要花钱开会员买更高的生成额度。
唯一会让人犹豫的是时间投入。一条片从选题到剪完,熟手大概 90 分钟,新手第一条可能要 3-4 小时,但跑通三五条以后熟练度上来很快,后面就是流水线作业。
二、整体生产流水线的鸟瞰图
很多新人一上来就纠结"我该先学剪映还是先学 AI 提示词",其实顺序错了。这事得先把整个流程从头到尾跑一遍,有了全局感再去回头精修每一步,效率会高得多。莫潇羽@源码七号站当年走过的弯路就是死扣某一个工具的细节,结果发现别的环节卡死了等于白学。
2.1 一条片子的生命周期
我把整个流程拆成 7 步,新手照着走能少踩 80% 的坑。
┌───────────────────────────────────────────────────────────┐
│ Step 1 选题确认 + 一句话的反常识结论 │
│ ↓ │
│ Step 2 AI 写 1200 字脚本(智能体调用 / 单次对话均可) │
│ ↓ │
│ Step 3 人工二次改稿,重点是前 5 秒和"玩梗模板" │
│ ↓ │
│ Step 4 把脚本扔给 DeepSeek,逐句生成图生视频提示词 │
│ ↓ │
│ Step 5 AI 出画面(豆包出首帧图 + 视频平台跑动作) │
│ ↓ │
│ Step 6 剪映里铺底图 + 抠像合成 + 字幕 + 音效 │
│ ↓ │
│ Step 7 审一遍数据合规性,导出发布 │
└───────────────────────────────────────────────────────────┘
七步走完一条片就成型了。下面我把这张大图拆细,讲讲每一步里到底要做什么。
2.2 文案先行 vs 画面先行
这是新手最容易选错的一道分岔。先讲结论:永远文案先行。
道理也简单。AI 画面在这套打法里是"插画师",它的任务是把你写好的文字翻译成视频。你必须先有一句完整的文案,知道你这一秒要说什么,才能写出对应的画面提示词。反过来你先随便生成一堆 AI 画面再凑词,99% 的概率凑出来的视频前言不搭后语。
我自己的工作流是这样:文案先写满,然后逐句过一遍,把需要 AI 画面承载的句子标黄,其他句子用动漫素材库的现成片段顶上。这样能把 AI 生成的次数压到最低,省时间也省额度。
2.3 把整条链路想象成"四个工位"
如果你以前在工厂里待过,你会发现这个流程和流水线作业几乎一模一样。我把它抽象成四个工位:
flowchart LR
A[工位一<br>文案工位<br>大模型生成+人工改稿] --> B[工位二<br>提示词工位<br>DeepSeek写画面词]
B --> C[工位三<br>画面工位<br>豆包/即梦/Vidu出片]
C --> D[工位四<br>剪辑工位<br>剪映组装+开头精修]
D --> E[(成片)]
四个工位是纯线性的,前一步没出结果不能跳到下一步。但每个工位内部是可以并行优化的——比如你在工位一卡壳时,可以同时在工位三跑前几条视频,等文案改完再回头看画面是否对得上。
这种工位思维的好处是,你的精力一次只用在一件事上。今天上午我只写文案,下午只跑画面,晚上只剪辑,头脑切换成本最低,产出反而最高。
2.4 不同工位的时间分配
下面这个分配是我跑了几十条片之后定下来的,新手可以直接抄:
|
工位 |
熟手用时 |
新手用时 |
占总时间比 |
|
文案工位 |
15 分钟 |
30 分钟 |
17% |
|
提示词工位 |
5 分钟 |
15 分钟 |
8% |
|
画面工位 |
25 分钟 |
60 分钟 |
33% |
|
剪辑工位 |
45 分钟 |
90 分钟 |
42% |
可以看到,剪辑是最吃时间的一环。这也是为什么我后面会用整整一章来讲剪映里的具体操作——你在这里偷的懒,后面观众数据会替你买单。
2.5 一个最容易被忽视的前置:本地工具的部署
如果你打算用智能体的方式让 AI 自动调用一套"写作包"(也就是预设好的文案模板),你需要先把这套模板装到本地客户端的 skills 目录下面。具体路径在不同系统下略有差别,Windows 一般是 C:\Users\你的用户名\.claude\skills\ 这一类的目录。
整个安装过程其实就三步:
# 1. 解压模板文件夹
# 2. 把整个文件夹复制到 ~/.claude/skills/ 下
# 3. 在终端里启动客户端,确认能识别到这个 skill
成功之后,你在客户端里输入"调用 xxx 写一篇短视频文案,标题是...",它就会自动按预设的模板写一段干货化、口语化的文案出来。这一步搞定之后,文案工位就完成了 70% 的工作量。
需要提醒一点,新手第一次配置环境可能会卡输入法、卡权限、卡路径,这些问题没什么技术含量但很烦人。我的建议是,装不上别死磕,直接用网页版的大模型对话页面一样能写出文案,只是少了"调用专属模板"这层方便,但本质上不影响出片。
三、AI 文案生成与人工二次改稿的全套技巧
文案是整条片的灵魂。画面再好看、剪辑再花哨,文案立不住,数据立马塌方。但好消息是,文案是整条流程里 AI 替代率最高的一环——你只需要把"为什么 xxx"或"xxx 的真相"丢给大模型,它能在 30 秒内写出一份能用的初稿,剩下的工作就是改前五秒、塞玩梗模板、校对数据。
3.1 大模型生成初稿的指令模板
我自己用的指令长这样,你可以直接抄:
请写一篇短视频文案,
标题:为什么 xxx(替换成你的选题),
要求:
- 全程梗密集,结尾反转
- 字数 1200 字,上下浮动 50 字
- 口语化、不要正经课本腔
- 段落之间要有节奏感,不要全是长句
- 涉及到数据的地方,标注"待核实"三个字
最后那一句"涉及数据标注待核实"是我后加的,特别重要。AI 会一本正经地编数据,你如果不让它自己标出来,就要逐句过一遍找数字,效率太低。让它自己标出来,你后面只检查带"待核实"标签的句子就行。
3.2 文案的五段式结构
AI 写完后,我会先按下面这张结构表过一遍,看每一段是不是都在它该在的位置上:
|
段落 |
内容职责 |
字数占比 |
|
钩子段 |
标题问题 + 反常识结论的预告 |
8-10% |
|
第二钩 |
接住前两秒,引向 5 秒完播 |
6-8% |
|
原理段 |
核心知识点的展开 |
35-40% |
|
玩梗段 |
用通用模板把数据/原理变有趣 |
25-30% |
|
收尾段 |
反转 + 互动引导 |
10-15% |
任何一段比例失衡,整条文案就会"歪"。比如钩子段写太长,观众等不到结论就划走;玩梗段塞太多,核心知识反而被冲淡。
3.3 前五秒文案是改稿的重中之重
我个人的经验是,改一条片的文案,70% 的时间花在前五秒。这五秒里要解决三件事。
第一件,标题问题要写得"短而怪"。短指的是字数尽量压在 12 字以内,怪指的是要带反常识或反直觉的暗示。比如"为什么猪是蛇的满级天敌"——这句话本身就让人愣一下,"满级"这个游戏化的词,把一个朴素的生物学现象变得很有钩子感。同理"为什么静脉血不会得癌症""为什么充电宝最怕坐高铁",都是这套写法。
第二件,第二句要承接得住。第二句的任务是把因为前两秒留下来的人,再多留三秒。这里我有两套打法:
- 打法 A:用对标视频的热门评论充当第二句。 这招屡试不爽。你的选题大概率有人做过,直接去刷它的评论区,把点赞最高的那几条挑出来当第二句的素材。原因是这些评论已