本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
这篇笔记把"一只橘色胖猫从田里挖土豆、一路做成蘸番茄酱薯条"的整支系列短片,拆成了三段可复制的流水线:先用即梦AI做出六张写实风格的分镜图,再把每张图丢进图生视频生成六段动态片段,最后在剪映里按顺序拼接、配上音效和转场导出成片。 全程不需要会画画、不需要建模,核心难点只有一个——让那只猫从第一个镜头到最后一个镜头长得一模一样,靠的是"固定一段角色描述 + 同一套形象设定"的笨办法。我自己折腾下来,最费时间的不是写提示词,而是图生视频环节要多抽几遍才能抽到满意的动作。下面这套方法同样能套用到搬玉米、逛菜市场、做奶茶等任何"萌宠拟人 + 分步骤"的选题上。整篇笔记我按"想清楚 → 备工具 → 出图 → 出视频 → 剪辑 → 发布"的真实顺序往下走,每一步都附上我自己用的提示词模板和踩坑提醒,照着做就能跑通一支属于你自己的片子。想看完整拆解,往下翻。
一、先搞清楚:这类"拟人萌宠做饭"短片到底是个什么东西
刷抖音的时候,你大概率刷到过这种画面:一只戴着小厨师帽的胖橘猫,一本正经地在田里捡土豆、推着小板车回家、站在灶台前翻炒,最后坐在餐桌边蘸着番茄酱啃薯条。配上田野的虫鸣、榨汁机的嗡嗡声、油炸的滋啦声,整支视频又萌又解压,完播率往往不低。
这类内容的本质,其实是"虚拟角色 + 流程叙事"的组合拳。它不是随便生成一段猫的动图就完事,而是有一条清晰的故事线:从原材料到成品,一步一步走下来,观众会不自觉地想看"它下一步要干嘛"。这种"做一件完整的事"的钩子,是它能留住人的根本原因。
我把它拆成两个支柱来理解,方便后面动手:
第一个支柱是角色锚点。整支片子从头到尾必须是"同一只猫",毛色、胖瘦、厨师帽、围裙都不能变。一旦中途换了脸,观众立刻出戏,这是这类视频最容易翻车的地方。
第二个支柱是分镜叙事。一支三十秒左右的短片,通常拆成五到八个镜头,每个镜头对应一个动作阶段。镜头之间靠转场和音效衔接,节奏要顺。
把这两件事想明白,剩下的就是用工具去实现。这里要先说清楚一个观念:AI 工具只是帮你"出素材"的,真正决定片子好不好看的,是你前期的脚本设计和后期的剪辑节奏。我见过太多新手把全部精力砸在"生成"上,结果素材一大堆、成片乱糟糟。莫潇羽@源码七号站一直强调的一点是——先有脚本,再有素材,最后才是剪辑,顺序别反了。
值得提醒的是,做这类内容更多是当成一种创作练习和能力提升来看待。把它当作熟悉 AI 工具流的练手项目,比一上来就盯着流量更容易坚持下去。
1.1 它为什么让人看得停不下来
我琢磨过这类视频的"上头"机制,大概有三层。
最浅一层是反差萌。一只胖橘猫,本来该是趴着打盹的形象,结果一本正经地戴着厨师帽干起了精细活,这种"动物做人类的事"的错位本身就有喜感。它越认真,你越想笑。
中间一层是确定性的满足感。做饭这件事有明确的起点和终点,观众潜意识里知道"它最后一定会把饭做出来",于是会一直看到结尾确认这个预期被满足。这跟看人拆快递、看流水线装配是一个心理——我们天生喜欢看一件事被完整地做完。
最深一层是解压。田野的虫鸣、切菜的脆响、油锅的滋啦、咀嚼的咔嚓,这些细碎而真实的声音叠在萌系画面上,会让人莫名地放松。所以后面第八节我会反复强调音效的重要性——很多时候,决定一支片子"解不解压"的,不是画面,而是声音。
想清楚这三层,你在设计脚本时就有了方向:动作要有反差、流程要完整、声音要到位。
1.2 同一套思路能长出多少种内容
橘猫做饭只是这个套路的一个切片。把"主体"和"流程"两个变量一换,能衍生出一大片内容。比如换主体:柴犬、小熊、小仓鼠、拟人化的小萝卜;比如换流程:开早餐店、摆地摊卖烤肠、经营一家奶茶铺、当快递员送包裹。每一种组合都是一支新片子,而背后的制作流程是同一套。这也是我愿意花时间把这套流程写成笔记的原因——它不是教你做一个视频,而是教你做一类视频。
二、工具组合:即梦AI 负责"出素材",剪映负责"拼成片"
整套流程只用到两个工具,分工很清楚。
即梦AI是字节跳动旗下剪映团队做的一站式 AI 创作平台,前身是 2024 年内测的剪映 Dreamina,同年改成中文名"即梦"。它能干的事很多,对我们这个项目来说,只需要用到两个功能:图片生成(输入一段文字描述,生成图片)和图生视频(上传一张图,让它动起来变成短视频)。它基于字节自研的 Seedream、Seedance 系列模型,对中文提示词的理解比较到位,这点对国内创作者特别友好。
即梦AI 是积分制的。免费用户每天能领到一批免费积分,生成图片和视频都会按清晰度、时长扣积分。清晰度越高、时长越长,扣得越多。免费额度对练手够用,但要批量出片就得规划着花——我的做法是把积分留给"图生视频"这一步,因为视频比图片更吃积分,也更需要反复抽。账号登录支持抖音扫码或手机号,进去之后在创作中心能看到"图片生成""视频生成"等入口。
第一次进去可能会被满屏的功能和模板晃花眼,别慌。你只要认准两个入口:一个是"图片生成"(也可能叫"AI 作图"之类),另一个是"视频生成"。整个项目就在这两个入口之间来回。其他什么数字人、画布、模板广场,这次都用不上,看一眼知道有这回事就行。界面这东西各家都在频繁改版,名字和位置可能和我描述的略有出入,但"输入描述→设置参数→点生成→挑结果"这套逻辑是通用的,按这个逻辑找入口准没错。
小提示:即梦AI 近一两年模型升级很快,从 Seedream 4.0 到 Seedance 系列一路在迭代,视频的连贯性和一致性越来越好。你打开界面看到的模型选项可能和我截图时不完全一样,但"图片生成 → 图生视频"这条主干流程是不变的,挑当前默认的高质量模型即可。
除了我们要用的两个核心功能,即梦AI 其实还带了一堆能力,比如智能画布(多图融合、局部重绘、AI 扩图、AI 消除)、对口型、AI 数字人、智能多帧(用多张关键帧生成更长的视频)等等。这些功能这个项目暂时用不上,但你练熟基础流程之后可以挨个去摸索——尤其是智能多帧,对做更长、更复杂的系列片很有用。新手阶段先别贪多,把"图片生成"和"图生视频"两个吃透,足够你产出像样的成品了。
我自己刚上手时的一个误区,是以为"模型越新越好,参数越多越好",结果在一堆选项里纠结半天。后来想明白了:对这种萌宠生活流的片子,画面要的是"自然、稳定、可爱",不是炫技。默认的写实模型 + 简洁的提示词,反而比一通乱调参数出来的效果稳。工具是拿来用的,别被工具的复杂度绑架了。
剪映则是后期合成工具,负责把即梦AI 吐出来的一堆视频片段拼成一支完整短片:排序、加音效、加背景音、切片段、加转场、导出。它和抖音、即梦是同一个生态,素材衔接很顺。电脑版和手机版都行,我个人更习惯电脑版,时间轴看得清楚,剪起来快。
剪映的界面对新手很友好,主要功能就那么几块:媒体(导入素材)、音频(音乐和音效)、文本(字幕)、贴纸、特效、转场、滤镜、调节(调色)。我们这个项目用得最多的是媒体、音频、转场三块,其余的等熟练了再玩。它还有一个好处是快捷键和专业剪辑软件接近,比如分割是 Ctrl+B、撤销是 Ctrl+Z,上手没什么门槛。如果你完全没剪过视频,花十分钟把"导入、分割、调音量、加转场、导出"这五个动作摸一遍,这个项目就够用了。
两个工具的分工,用一张表就能讲明白:
|
环节 |
用什么工具 |
解决什么问题 |
关键动作 |
|
出分镜图 |
即梦AI · 图片生成 |
把文字脚本变成画面 |
写提示词、选比例、超清 |
|
出动态片段 |
即梦AI · 图生视频 |
让静态图动起来 |
写动作描述、多抽几次 |
|
拼成片 |
剪映 |
把片段串成完整故事 |
排序、音效、转场、导出 |
记住这张分工表,后面所有操作都是在往这三个格子里填东西。
三、整条流水线鸟瞰:六个镜头怎么串成一支完整短片
在动手之前,先把整条路看一遍,心里有谱。以"橘猫做薯条"为例,我把它设计成六个镜头,对应做薯条这件事的六个阶段。整条流水线长这样:
flowchart LR
A[写六镜头脚本] -->