本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
先把结论甩在前面,方便只想要答案的朋友:OiiOii 是上海天码形空科技自研的、目前第一个专门为"动画成片"打造的 AI 智能体平台。它自己不训练底层大模型,核心本事是"调度"——把"艺术总监、编剧、角色设计师、分镜师、音乐总监"这一整套剧组角色塞进一个对话框,再在背后接入并调用市面上多款主流的图像、视频生成模型(官方口径是 30 多款,常见的有字节系的 Seedance、Seedream,也包括 Sora 2、通义万相 Wan 2.5 等),由这支虚拟团队接力帮你把一句话或一张图变成动画。平台里你会看到单段视频通常被限制在 15 秒上下,这是 OiiOii 为了保证角色一致而设的"平台侧生成规则",不要把它误当成某个模型雷打不动的物理上限——不同底层模型原生支持的时长本就不一样。普通人用它,主要走三条成片路线:漫画转视频、动漫音乐 MV、剧情故事短片。它最大的价值在于把"会画、会写、会剪"这三件门槛极高的事打包自动化了;最大的短板则是可控性偏弱、远景人脸容易崩、清晰度还不够,很多时候得反复"抽卡"才能拿到一条满意的镜头。
我自己把这三条路线全都从头到尾跑了一遍,踩的坑、好用的地方、积分大概怎么花,都记在下面了。这篇是按"先讲清原理,再手把手拆操作,最后给真实评价"的顺序写的,不堆术语、不画大饼。想看完整拆解,往下翻就行。
一、先把 OiiOii 这件事说清楚:它到底是个什么东西
很多人第一次听到"动画创作 AI 智能体"这个词是懵的。我刚上手那会儿也一样,盯着界面研究了半天才反应过来:它跟我们平时用的那种"输入一句话出一张图"的工具,完全不是一个物种。
1.1 它的本质:不是一个模型,而是一支"虚拟剧组"
先解释一个名词。智能体,英文叫 Agent,你可以把它理解成一个"能自己规划步骤、自己调用工具、还能跟别的 Agent 商量着干活"的 AI 角色。普通的 AI 画图工具是"一问一答",你给提示词,它吐结果,中间没有任何"思考流程"暴露给你。而 OiiOii 走的是另一条路——它把做一部动画拆成了好几个工种,每个工种由一个专门的智能体负责。
这里先把它的身世交代清楚,免得后面理解跑偏:OiiOii 是上海天码形空科技自研的产品,2025 年中开始内测。它自己并不训练底层的图像、视频大模型,而是站在更上层做"编排与调度"——背后接入了市面上多款主流生成模型,按需调用它们来干活。换句话说,它卖的不是"模型",而是"一支会协作的 AI 团队"加"一套把活分发出去的流程"。这个定位你记住了,下面很多设计才解释得通。
平台对外的说法是内置了七个专业角色,组成一个完整的创作团队。我实际跑下来,能明确看到登场的大概是下面这几位:
|
智能体角色 |
它在流程里干的活 |
你需要怎么配合 |
|
艺术总监 |
接住你的第一句需求,定整体调性、风格、情绪 |
给一句话 + 选一个风格 |
|
编剧 |
把模糊的创意拆成完整故事、人物设定、镜头清单 |
确认或微调它写的剧本 |
|
角色设计师 |
把文字里的角色画成主视图、三视图 |
看脸、提意见、不满意就让它重做 |
|
场景设计师 |
补充环境、背景的视觉设定 |
一般不用手动管 |
|
分镜师 |
按剧本把每个镜头的画面描述写出来,再批量出视频 |
确认分镜、单条不行就重抽 |
|
音乐总监 |
匹配节奏、生成音效或配乐 |
选类型,或者干脆自己换 |
|
资产管理 |
把你创作过的角色存进"资产库"反复复用 |
手动同步到库里 |
这套设计的聪明之处在于:你全程扮演的角色其实是"甲方"。你不用懂分镜语言、不用会写运镜提示词,你只需要像对接外包团队那样,看它交上来的东西,点头或者打回去重做。莫潇羽我自己第一次跑完整个流程的感受是——它确实把"动画制作"这件原本需要一个小团队折腾好几天的事,压缩成了一个人坐在电脑前点几下鼠标。
1.2 两种使用姿势:托管式和对话式
进了平台你会发现,几乎每个创作入口都让你二选一:托管模式,还是对话模式。这两个的区别,新手一定要搞清楚,不然很容易白白浪费积分。
托管模式,说白了就是"傻瓜式一键出片"。你把需求丢进去,剩下的全交给智能体团队自动跑,中途基本不问你意见,最后直接甩一条成片给你。好处是省事,坏处是你几乎没有插手的余地,出来啥样就是啥样。
对话模式,则是在每个关键环节都停下来问你:这个角色脸满不满意?这个分镜要不要改?这个音乐时长选哪个?它更像是你和团队一边沟通一边推进。我个人的建议是——只要你对成片有具体想法,就老老实实用对话模式。托管模式适合"我就图一乐,随便出个东西看看"的场景。
这里有个我踩过的小坑:用对话模式的时候,它经常停下来等你回话,你要是走开了去干别的,它就在那儿干等着,进度条一动不动。所以选了对话模式,人最好别离开。
1.3 底层逻辑:它是个"多模型调度台",不是某一个模型
这一段稍微硬核一点,但搞懂它,你后面所有的"为什么会崩""为什么单段就这么短"都能想明白。
前面说了,OiiOii 自己不训练大模型,它是个"调度层"——把活儿分发给底层那些真正干脏活累活的第三方模型。这里要先纠正一个很多人(包括早期一些教程)会犯的误判:不要以为它只挂了某一家的模型,更不要以为它是某个大厂自研的平台。OiiOii 整合的是一整批主流生成模型,官方口径是 30 多款,常见的有负责出图的 Seedream 系列,负责出视频的 Seedance、Sora 2、通义万相 Wan 2.5 等等。你在不同创作场景里,它调用的可能是不同的模型组合。所以平台里偶尔冒出来的"S2"这类简写,更像是某次生成里被调用到的某个具体模型档位,而不能简单粗暴地等同于"就是 Sora"或"就是某一个模型"——这点早期传得很乱,记住"多模型"这三个字就不会被带偏。
抛开具体是哪家模型,它的成片在机制上是"两段式"拼出来的,这个底层套路是通用的:
第一段是生图。先由图像生成模型把静态画面画出来——无论是角色的主视图、三视图,还是 MV 开场那张整体海报,都是这一步的产物(平台里有时会显示类似 "Seedream 4.5" 的模型档位)。
第二段是图生视频。再由视频生成模型,基于上一步那张定好的图 + 文字描述,把画面"动起来",生成一个个镜头段落。
理解了这套"先定图、再动起来"的两段式,你就能抓住用好 OiiOii 的两个关键点:
关键点一:单段视频通常 ≈ 15 秒(这是平台侧的生成规则)
↓ OiiOii 为了把"同一个角色的脸"在一段里稳住,给单段设了较短的时长
↓ 注意:这是平台为保一致性而定的工作流规则,不是模型雷打不动的物理上限
↓ 不同底层模型原生支持的时长本就不同,有的能做到更长,平台是另做了取舍
↓ 实际效果:超过单段长度就切下一段,跨段时角色容易"换张脸"
关键点二:成片 = 图生视频
↓ 先有一张定下来的图(角色 / 海报)
↓ 再让视频模型基于这张图 + 文字描述去"动起来"
↓ 所以图没定好,视频就别想稳
这套逻辑你一旦想通,就会明白后面我反复提到的"角色崩坏""为什么要先把角色锁死再生成""为什么单段别贪长",根子全在这儿。AI 视频这个领域现在还在飞速迭代,底层模型几个月一变样,OiiOii 之所以搞内测、让大家进来玩,很大程度上也是想一边收集真实反馈、一边持续打磨它这套"多模型调度"的编排逻辑。
1.4 它能做什么、适合谁
把能力盘一下,OiiOii 目前能产出的形态相当丰富:多格漫画、漫画转视频、动漫音乐 MV、剧情故事短片、静态角色立绘、衍生品设计,甚至动态壁纸这种小东西。风格库也大,官方口径在 140 到 160 多种之间浮动,水墨、赛博朋克、国潮 3D、日系、哥特、插画风……基本你能想到的二次元和动画风格都能翻得到。
适合的人群其实很明确:做内容的自媒体作者、品牌营销岗、需要可视化作品的音乐人、动漫设计爱好者,还有想用动画形式做教学内容的教育者。说到底,它瞄准的就是"有创意、但没有专业动画制作能力"的这群人——莫潇羽@源码七号站 我自己也算其中之一,所以才会一头扎进去研究这么久。
二、动手之前:账号、积分,和那块绕不开的"画布"
工具再强,门没进对也白搭。这一章把开工前必须搞清楚的几件事说明白:怎么进、积分怎么算、画布怎么操作、资产库是干嘛的。
2.1 内测邀请制:怎么进去
截至我写这篇的时候,OiiOii 还