莫潇羽@源码七号站(www.fuyuan7.com) | 转载请注明出处
快速摘要
2026年3月24日,OpenAI 宣布全面关停 Sora 视频生成服务,包括独立 App、API 接口以及 ChatGPT 内置视频功能,这款曾经震撼全球的 AI 视频产品从上线到谢幕仅走过25个月。 与此同时,LibTV 平台上线了自研视频模型 Star Video 2.0,主打多镜头叙事、音视频一体化生成和多模态精准控制三大核心能力,定位短剧与 AI 电影制作场景。本文将从行业背景出发,深入拆解 Star Video 2.0 的技术原理、操作方法、提示词编写技巧以及与同类产品的对比差异,帮助每一位想要入门 AI 视频创作的朋友建立完整的认知框架。往下看有更详细的拆解。
一、Sora 关停始末:一个时代标杆的谢幕
1.1 从惊艳到落幕的25个月
2024年2月,OpenAI 首次发布 Sora 技术预览版,凭借 4K 分辨率和最长 60 秒的连贯叙事视频,瞬间点燃了全球 AI 视频领域的热情。彼时,业界普遍只能生成 10 秒以内、720P 的短片,Sora 几乎以一己之力抬高了整个赛道的天花板。
然而,从发布预览到正式公测,中间隔了整整 10 个月。2024年12月,Sora 才对公众开放使用,但这时候快手可灵等国产模型已经迭代了好几个版本,用户再上手 Sora 时并没有感受到年初预览时的那种巨大落差。2025年9月,升级版 Sora 2 携独立 App 上线,五天内下载量突破百万,一度登顶 App Store。
但好景不长。据多家媒体披露,Sora 的日均运行成本高达 1000 万至 1500 万美元,折合年化约 54 亿美元的算力开支。与之对应的是,其累计消费者端收入仅约百万美元量级——这是一个严重入不敷出的生意。到了 2026 年初,Sora App 的月下载量已经从峰值暴跌了七成以上。
2026年3月24日,OpenAI 在社交平台发布简短声明,宣布关停 Sora 的全部服务。CEO Sam Altman 在内部会议上进一步说明:不仅面向消费者的应用停止运营,面向开发者的 API 和 ChatGPT 中的视频功能也将一并下线。此前与迪士尼签订的那份涉及 200 余个 IP 的三年合作协议,也随之终止。
1.2 Sora 关停背后的三重压力
莫潇羽@源码七号站认为,Sora 的关停并不是一个单纯的产品失败事件,而是多重压力叠加的结果。
首先是商业化严重不及预期。AI 视频生成的推理成本远高于文本和图像,而 Sora 的付费转化率据报道不足 3%,与 ChatGPT 18% 的转化率相差甚远。每生成一段视频,背后消耗的算力成本是文生图的数十倍,这让 Sora 沦为一个持续失血的无底洞。
其次是版权争议的高压。大量用户使用 Sora 生成受版权保护的角色视频——从游戏人物到动画角色,甚至制作真实人物的深度伪造内容。好莱坞多家制片厂和行业协会对 OpenAI 提起诉讼,索赔金额巨大。
最后是战线过长带来的战略焦虑。OpenAI 的应用部门负责人 Fidji Simo 在内部信中坦言,过去产品线过于分散,不同 App 和技术栈的碎片化正在拖慢整体推进速度。关停 Sora,本质上是 OpenAI 从多线扩张转向重点突破的战略收缩——算力和团队资源将转向代号为"Spud"的下一代基础模型,以及机器人和世界模拟等长期研究方向。
1.3 AI 视频生成进入"中国时间"
Sora 的退场,并不意味着 AI 视频赛道降温,恰恰相反,这条赛道正在加速洗牌。从字节跳动的 Seedance 2.0、快手的可灵 3.0,到阶跃星辰的 Step-Video、MiniMax 的海螺 AI,再到本文要重点介绍的 LibTV 平台及其 Star Video 2.0 模型——越来越多来自中国的产品和技术正在接过接力棒。
回顾这段历史,有几个关键时间节点值得记住。2024年上半年,Sora 首发预览后迟迟未能公测,快手可灵趁势抢占了用户心智,用一系列高质量的AI视频生成案例快速积累了口碑。2024年下半年到2025年初,国产模型进入密集迭代期,可灵、海螺、Vidu 等产品轮番升级,在人物一致性、运镜控制、画面稳定性等关键指标上不断突破。2026年春节前后,字节跳动发布 Seedance 2.0,在复杂物理规律还原和人类微表情捕捉方面达到了新的高度,被业内认为重新定义了行业标准。与此同时,阶跃星辰将 30B 参数量的 Step-Video-T2V 开源,成为全球参数量最大的开源视频生成模型,采用 MIT 协议开放商用。
在这个蓬勃发展的生态中,LibTV 选择了一条差异化路线:它不只做一个视频生成模型,而是构建一个完整的创作平台。Star Video 2.0 是这个平台上的核心引擎之一,但远不是全部。正是这种"模型+平台+工作流+Agent"的组合策略,让它在拥挤的赛道中找到了自己的位置。
可以说,当 Sora 选择退场时,新一代工具已经摆上了台面。接下来,莫潇羽@源码七号站就带大家深入了解其中一个引起广泛关注的新选手——Star Video 2.0。
二、Star Video 2.0 是什么?快速认识这个新模型
2.1 背景与定位
Star Video 2.0 是 LibTV 平台于 2026 年 3 月上线的视频生成模型。LibTV 是 LiblibAI(哩布哩布 AI)推出的专业 AI 视频创作平台,LiblibAI 本身是国内知名的 AI 图像创作社区,由北京奇点星宇科技有限公司运营,在 Stable Diffusion 社区和 AIGC 图像领域积累了大量用户和模型资源。
LibTV 的定位非常明确:它不是一个简单的"视频生成器",而是一个从剧本创意到视频成片的全链路创作平台。Star Video 2.0 的上线,补全了 LibTV 在自有视频模型方面的最后一块拼图。此前,LibTV 主要通过接入可灵、Seedance、Vidu、PixVerse 等第三方模型来提供视频生成能力;现在有了自研的 Star Video 2.0,平台的核心竞争力进一步增强。
Star Video 2.0 的核心定位是面向短剧和 AI 电影制作场景。它想要解决的不是"如何生成一个三秒钟的炫酷片段"——这在当下已经不算难题——而是"如何生成一场完整的、能用于实际交付的戏"。
2.2 三大核心能力概览
Star Video 2.0 与市面上大多数视频模型的差异化,集中体现在三个层面:
- 多镜头叙事能力:一句话描述一段包含多个分镜的完整场景,模型自动推演分镜切换、转场衔接和动作节奏。
- 音视频一体化生成:画面生成的同时同步输出对白、环境音和动作音效,实现原生视听同步。
- 多模态精准控制:通过上传参考图(如角色三视图)来锁定角色外观,确保多镜头之间角色形象的一致性和可控性。
下面我们逐一展开,深入拆解每一项能力的原理和实操方法。
三、核心能力一:多镜头叙事——从"拼片"到"一句话出戏"
3.1 传统 AI 视频制作的痛点
在 Star Video 2.0 之前,用 AI 做一段完整的短片,通用的工作流大致是这样的:先写好分镜脚本,然后针对每一个分镜单独生成视频片段,再把这些片段导入剪映或 Premiere 之类的剪辑软件,手动调整转场、节奏和顺序,最后拼凑成一个完整的视频。
这个流程的问题非常明显。第一,每一个分镜都需要单独生成、单独调整提示词,一旦某个镜头的角色长相或画面风格出现偏差,就要反复重新生成,俗称"抽卡"。第二,不同镜头之间缺乏逻辑上的连贯性——模型并不知道上一个镜头发生了什么,每次都是独立生成,导致拼接时经常出现画面跳跃、风格不统一等问题。第三,后期拼接本身就是一项耗时耗力的工作,对于没有专业剪辑经验的创作者来说门槛不低。
简单来说,传统方式下做出来的 AI 视频,本质上就是一个"拼好片"——一堆独立生成的碎片被手动粘合在一起。
3.2 Star Video 2.0 的多镜头叙事原理
Star Video 2.0 的核心突破在于,它能够在一次生成过程中,根据用户提供的一段完整的场景描述,自动规划和生成包含多个镜头的连贯视频。
从技术原理的角度来理解,当前主流的 AI 视频生成模型普遍采用基于 DiT(Diffusion Transformer)的扩散架构。DiT 架构的核心思想是:将 Transformer 的强大序列建模能力与扩散模型的生成质量结合起来。在训练阶段,模型学习大量视频数据中的时空特征——包括每一帧内的空间信息(画面构图、物体位置、光影关系)和帧与帧之间的时间信息(运动轨迹、镜头切换、节奏变化)。
多镜头叙事能力的关键在于镜头感知的时间建模。具体而言,模型需要理解一段叙事文本中包含多少个逻辑上独立的"镜头",每个镜头的景别(特写、中景、远景)是什么,镜头之间应该如何衔接(硬切、推镜、转场)。这通常通过以下几个机制来实现:
- 语义解析层:模型首先对用户输入的文本进行深度语义分析,识别其中的场景切换信号词(如"随后"、"切到"、"镜头推向"),将一段描述拆分为多个逻辑分镜。
- 时间注意力机制:在 DiT 架构中,空间注意力层负责每帧画面的内容生成,而时间注意力层负责跨帧的运动和变化建模。对于多镜头生成,时间注意力层需要在镜头切换点处正确地"断开"前一个镜头的运动延续,并"接入"新镜头的起始状态。
- 位置编码设计:为了让模型区分"同一个镜头内的帧间关系"和"不同镜头之间的帧间关系",通常会引入多模态旋转位置编码(如 MM-RoPE),让模型感知不同镜头的边界。
- 一致性约束:在多镜头生成过程中,模型通过跨镜头的全局注意力或记忆机制,确保不同镜头之间的角色外观、服装细节、场景风格保持一致。
从Seedance 1.0 的技术报告中我们可以窥见类似的设计思路。Seedance 的架构中明确提到了"原生多镜头叙事连贯性"和"解耦的空间-时间注意力层",Star Video 2.0 虽然没有公开技术论文,但从其表现出的能力推断,底层应该采用了类似的技术路线。
3.3 实操示例与提示词编写技巧
理解了原理之后,我们来看实际怎么用。在 Star Video 2.0 中生成多镜头视频,关键在于提示词的编写质量。莫潇羽@源码七号站根据实测经验,总结了以下几个要点:
(一)明确标注镜头切换
在提示词中,你需要用清晰的语言标注不同镜头之间的切换关系。常用的切换信号词包括:
镜头顺势推向……
随后切回中景……
切特写……
切跟拍中景……
这些词汇就像是给模型的"分镜指令",告诉它在哪里进行镜头切换,以及切换到什么样的景别。
(二)描述具体的动作和节奏
不要只写"一个人跑步",而要写清楚跑步的具体动态细节。例如:
一名跑者穿着荧光绿跑鞋在积水中快速奔跑,水花四溅;
切特写:跑鞋踩踏水坑的微距慢动作,鞋面网眼材质清晰可见;
切跟拍中景:跑者擦去额头的汗水,眼神坚毅地冲破终点线的红丝带。
注意这段提示词中包含了三个镜头(远/中景奔跑 → 特写慢动作 → 跟拍中景冲线),每个镜头都有明确的动作描述和材质细节。根据实测,这样一段描述通过 Star Video 2.0 大约三分钟就可以生成一条完整的多镜头视频。
(三)善用风格限定词
在提示词的开头加入整体风格描述,可以帮助模型统一全片的视觉调性。例如:
90年代复古电影风格。杂乱的办公桌前,疲惫的侦探拿起一张半烧毁的照片,
眼神突然震惊。镜头顺势推向照片上的神秘符号特写,
随后切回中景,侦探抓起椅子上的风衣夺门而出。
"90年代复古电影风格"这个前缀会影响整段视频的色调、颗粒感和画面比例,让三个镜头在视觉上保持统一。
(四)一个实用的提示词模板
莫潇羽@源码七号站为大家整理了一个可复用的提示词结构模板:
[风格限定]. [场景一描述,包含角色、动作、情绪];
[镜头切换指令]:[场景二描述,包含景别和细节];
[镜头切换指令]:[场景三描述,包含动作节奏和结尾]。
按照这个结构来组织提示词,可以大幅提升多镜头生成的成功率和画面连贯性。
四、核心能力二:音视频一体化——声画同步的原生方案
4.1 为什么声音如此重要
一段没有声音的 AI 视频,就像一部被消音的电影——再精美的画面也会让观众觉得少了点什么。声音不仅提供信息(对白传达剧情),还营造氛围(环境音建立空间感)、强化节奏(动作音效标记关键时刻)。
在过去,给 AI 生成的视频配音是一个独立的后期步骤。你需要先生成无声视频,然后使用 ElevenLabs 之类的语音合成工具生成对白,再使用 AudioCraft 或 Stable Audio 生成环境音效和背景音乐,最后在剪辑软件中手动对齐所有音轨。这个流程不仅繁琐,而且音画同步的精度很难保证——嘴型对不上台词、脚步声和落地画面错位,是常见的问题。
4.2 原生音视频联合生成的技术原理
Star Video 2.0 的音视频一体化,意味着模型在生成画面的同时,直接输出与画面同步的声音轨道。这并不是简单地在视频生成完毕后"贴"一层音效上去,而是在模型的生成过程中,视觉信号和听觉信号就已经被联合建模了。
理解这个机制,可以参考两条技术路线:
第一种是端到端联合生成。 在训练阶段,模型同时学习视频帧序列和对应的音频波形(或音频频谱)之间的关联关系。例如,当模型学习到"一只手关上一扇木门"的视觉模式时,它同时学习到这个动作对应的"咚"一声关门音效的声学特征。在推理阶段,模型同时输出视频帧和音频数据,二者在时间轴上是天然对齐的。
第二种是级联式生成。 先生成视频,然后将视频帧作为条件输入传递给一个音频生成子模型。音频模型会根据画面内容逐帧生成对应的声音。这种方式在技术上更容易实现,但音画同步的精度取决于两个模型之间的耦合程度。
字节跳动的 Seedance 2.0 在其技术描述中提到了"统一多模态音视频联合生成架构",Meta 早期的 Movie Gen 系列也包含了专门的 Movie Gen Audio 子模型来生成视频配音。Star Video 2.0 在音视频生成方面展现出的能力(包括对白、环境音和动作音效的同步生成),表明它至少采用了与这些前沿方案类似的技术思路。
4.3 声音生成的实际表现
从实测来看,Star Video 2.0 生成的声音覆盖了三个层面:
- 对白与人声:当提示词中包含角色说话的内容时,模型会生成与嘴型基本匹配的人声对白。例如在生成昆曲《牡丹亭》片段时,闺门旦的唱腔和伴奏能够与画面中的起势动作同步响起。
- 环境音:场景中的自然声音会被自动填充——室内场景的低频底噪、户外场景的风声和鸟鸣、雨天场景的淅淅沥沥等。
- 动作音效:与具体动作绑定的声音,比如拿起物品的碰撞声、关门声、脚步踩水声等。在跑步者踩踏水坑的镜头中,水花溅起的音效与画面中的落脚时机基本同步。
当然,当前的音视频一体化还没有做到完美。在一些复杂场景中,声音可能会出现轻微的错位或不自然的地方——比如实测中昆曲场景的画外音被错误地归属给了画面中的丫鬟角色。但整体而言,相比完全没有声音或需要手动配音的方案,这已经是一个巨大的效率飞跃。
4.4 带声音的提示词怎么写
如果你希望生成的视频包含特定的声音元素,在提示词中明确描述声音信息会很有帮助。以下是莫潇羽@源码七号站总结的几个实用技巧:
描述对白内容时使用引号或明确标注"说话"、"念白"等动作。 例如:
画外突然传来一声清亮的念白"小姐!",
闺门旦和旁边的丫鬟一齐向画面右侧看去。
描述环境和动作时暗示声音元素。 例如:
在积水中快速奔跑,水花四溅
这段描述中"积水"和"水花四溅"本身就暗示了踩水的声音,模型会据此生成相应的音效。
如果不需要声音,可以在提示词中注明"无对白"或"纯器乐背景"。 这可以避免模型在不需要人声的场景中生成不必要的对白。
进阶技巧:通过声音线索推动叙事。 声音不仅仅是画面的装饰,它本身就可以成为叙事的一部分。例如在悬疑类短片中,你可以在提示词中写"远处传来若有若无的警笛声,角色转头望向窗外"——这里的警笛声不仅是一个音效,更是推动角色下一步动作的叙事触发器。Star Video 2.0 在处理这类提示词时,通常能正确理解声音与画面之间的因果关系。
另外值得一提的是,在对白的语种方面,目前 Star Video 2.0 对中文和英文的支持都比较稳定。如果你需要生成特定口音或方言的对白,建议在提示词中明确注明,比如"用四川话说道"或"用英式英语念出台词"。不过莫潇羽@源码七号站提醒大家注意,方言和小语种的支持效果目前还存在一定波动,建议生成后仔细检查。
五、核心能力三:多模态控制——把画面的主导权还给创作者
5.1 角色一致性难题
做 AI 视频创作的朋友一定深有体会:AI 生成的最大不确定性之一,就是角色的"变脸"问题。你在第一个镜头里精心生成了一只穿官袍的猫,到了第二个镜头它可能就变成一只穿汉服的狗了。这种角色一致性的崩塌,让多镜头的长视频制作变得极其困难。
传统的解决办法通常是使用图生视频(Image-to-Video, I2V)的方式:先用 AI 绘图工具生成一张高质量的角色定帧图,然后以这张图作为起始帧来驱动视频生成。这种方式能在一定程度上保证单个镜头内的角色一致性,但不同镜头之间的一致性仍然难以保障。
5.2 参考图驱动的多模态控制原理
Star Video 2.0 提供了一种更加系统性的解决方案:多模态参考输入。用户可以上传角色的参考图片(比如一张角色的正面、侧面和背面三视图),模型会从参考图中提取角色的核心视觉特征——面部结构、服装设计、配色方案、体型比例等——并在整个视频生成过程中锁定这些特征。
从技术实现的角度来看,这种能力通常涉及以下几个环节:
- 视觉特征提取:使用预训练的视觉编码器(如 CLIP 或更高级的多模态编码器)将参考图转换为高维特征向量,这些向量捕捉了角色外观的关键信息。
- 条件注入机制:将提取出的角色特征向量注入到 DiT 的生成过程中,通常通过交叉注意力(Cross-Attention)机制或者直接与初始噪声进行特征拼接。这确保了生成过程中的每一帧都受到参考图特征的约束。
- 一致性损失函数:在模型训练阶段,通过设计专门的损失函数来惩罚角色特征的偏移。例如,如果生成视频中角色的面部特征与参考图的差异超过一定阈值,损失函数会给出更大的惩罚信号,驱动模型学习更稳定的角色保持能力。
阶跃星辰开源的 Step-Video-TI2V 模型在技术报告中详细描述了类似的实现:它没有采用传统的交叉注意力方法,而是将参考图像的向量表示与 DiT 第一帧的向量在通道维度上直接拼接,以获得更强的图像一致性。这种思路在业界已经被广泛验证,Star Video 2.0 的表现也印证了这一技术路线的有效性。
5.3 实操:如何上传参考图并控制角色
在 LibTV 的操作界面中,使用参考图控制角色的流程大致如下:
第一步,准备角色参考图。 最理想的参考图是角色的三视图(正面、45度侧面、背面),背景干净、角色特征清晰。你可以先使用 LibTV 内置的"角色三视图生成"功能,或者使用 Midjourney、Seedream 等图像模型生成一张满意的角色设定图。
第二步,在创作界面上传参考图。 进入 LibTV 的无限画布后,创建一个图片节点,将参考图上传到画布中。
第三步,在视频生成节点中关联参考图。 将参考图节点与视频生成节点连接,这样 Star Video 2.0 在生成视频时就会以这张图为角色外观的约束条件。
第四步,在提示词中描述角色的动作和场景,但无需重复描述角色的外观。 因为外观信息已经通过参考图传递给了模型,你只需要专注于描写角色做了什么、在什么场景中、有什么情绪和动作即可。
从实测效果来看,以穿官袍的汤姆猫三视图为参考生成的视频中,模型精准锁住了角色的面部特征和服装细节,画面没有出现闪烁或崩坏。特别值得注意的是,当角色开口说话时,口型与台词基本吻合,面部微表情的还原度也相当不错。
六、LibTV 平台全景:不只是一个视频模型
6.1 无限画布与节点式工作流
要充分发挥 Star Video 2.0 的能力,你需要理解它所处的创作环境——LibTV 的无限画布工作台。
传统的视频编辑软件(如 Premiere、Final Cut Pro)采用的是线性时间轴的操作逻辑,所有素材都排列在一条时间线上。LibTV 的设计则完全不同:它使用了一张无限延展的二维画布,用户可以在画布上自由放置五种类型的节点:
- 文本节点:放入剧本、提示词、场景描述等文本内容
- 图片节点:放入参考图、角色设定图、分镜首帧等图像素材
- 视频节点:放入生成的视频片段或上传的参考视频
- 音频节点:放入配乐、音效、对白录音等音频素材
- 脚本节点:放入结构化的分镜脚本
节点之间通过连线来建立逻辑关系。例如,你可以将一个文本节点(包含场景描述)连接到一个视频节点,表示"用这段文字来生成这个视频";或者将一个图片节点连接到视频节点,表示"以这张图为参考来生成视频"。
这种节点式工作流的最大优势在于非线性思维。你不需要按照时间顺序从头到尾地做视频,而是可以同时展开多条创作线路——比如一边调整 A 镜头的角色形象,一边生成 B 镜头的场景视频,一边让 AI 推演 C 镜头的剧情走向。所有工作进度都在一张画布上一目了然。
6.2 20+ 专业创作工具
除了 Star Video 2.0 模型本身,LibTV 还提供了超过 20 项辅助创作功能,莫潇羽@源码七号站挑几个最实用的介绍一下:
- 9/25 宫格智能分镜:输入一段剧本文字,一键生成 9 格或 25 格的分镜画面预览,帮你快速确认每个镜头的画面构成。
- 剧情推演四宫格:上传一张参考图,AI 会自动推演出这张图前后可能发生的四个剧情节点,非常适合用来做故事创意扩展。
- 角色三视图生成:输入角色的文字描述,自动生成正面、侧面和背面的三视图,作为后续视频生成时的角色参考。
- 多机位 9 宫格:同一个场景生成 9 个不同机位和角度的画面,帮你选择最满意的镜头角度。
- 三维坐标球打光:通过可视化的三维坐标球来调整场景的光照方向和强度,不需要复杂的 3D 软件操作。
- 画面前3秒/后5秒延展:对已有的视频片段进行时间维度上的扩展,在不改变核心内容的前提下延长视频时长。
- 高清扩图(2x/4x/6x):将低分辨率的视频帧放大到更高分辨率,同时补充画面细节。
- 视频提帧至 90fps:将低帧率视频平滑插帧到 90fps,让运动画面更加流畅。
6.3 30+ 模型聚合:不止 Star Video 2.0
LibTV 的另一个核心竞争力是多模型聚合。除了自研的 Star Video 2.0,平台还接入了可灵 3.0/O3、Seedance 2.0、Wan 2.6、Vidu Q3 PRO、PixVerse V5.5、海螺 2.3 等 30 多款主流视频模型,以及 Midjourney V7、Seedream 5.0、LibNano Pro 等图像模型和豆包、Kimi 等语言模型。
这意味着你不需要在多个平台之间来回切换。在一张画布上,你可以用 Midjourney 生成角色设定图,用 Star Video 2.0 生成多镜头叙事片段,用可灵 3.0 生成需要高画质的特写镜头,用 Seedance 2.0 生成需要复杂物理效果的动作场景——然后在 LibTV 的画布上统一管理和拼接所有素材。
6.4 Agent 自动化创作
LibTV 的另一个前瞻性设计是对 AI Agent 的支持。平台开源了 libtv-skills 技能包(遵循 MIT 开源协议,托管在 GitHub 上),支持 OpenClaw、KimiClaw 等 AI Agent 直接调用 LibTV 的创作能力。
这意味着什么呢?简单来说,你可以在 Agent 中用一句自然语言指令,比如"帮我做一部 1 分钟的国风动画短片,主角是一个穿汉服的少女在竹林中舞剑",然后 Agent 会自动完成以下所有步骤:
- 生成剧本和分镜脚本
- 设计角色形象和三视图
- 逐镜头生成视频片段
- 添加配乐和音效
- 将所有素材整合到一个 LibTV 项目中
整个过程无需人工干预。Agent 甚至会每隔一段时间向你汇报进度。当然,目前这个功能更适合原型验证和快速出片,精品级的内容仍然需要人工审核和调整。
安装方法也非常简单,以下是通过 npx 一键安装技能包的命令:
# 交互式选择要安装的技能
npx skills add libtv-labs/libtv-skills
# 直接安装指定技能
npx skills add libtv-labs/libtv-skills --skill libtv-skill
安装完成后,你的 Agent 就拥有了调用 LibTV 所有生图、生视频能力的权限,可以通过创建会话、发送指令、查询进度、下载结果等一系列 API 来完成自动化创作。
七、完整实操流程:从注册到出片
为了让没有任何 AI 视频创作经验的朋友也能顺利上手,莫潇羽@源码七号站在这里梳理一遍从零开始使用 Star Video 2.0 的完整流程。
7.1 注册与登录
打开浏览器,访问 LibTV 官网 https://www.liblib.tv/,点击注册按钮,使用手机号或邮箱完成注册。LibTV 是纯 Web 应用,不需要安装任何客户端软件,支持 Chrome、Edge、Safari 等主流浏览器。
7.2 新建项目
登录后点击"开始创作",进入无限画布界面。你会看到一张空白的画布和顶部的工具栏。在这里,你可以选择四种默认的创作模式入口:
- 脚本生成模式:从文字剧本开始,自动生成分镜
- 角色三视图模式:从角色设计开始
- 图生视频模式:从一张图片开始
- 音频生视频模式:从一段音频开始
对于初次使用的朋友,建议从"脚本生成模式"入手,体验最完整的创作流程。
7.3 编写剧本与生成分镜
在画布中创建一个文本节点,输入你的剧本或场景描述。然后使用快捷键 / 调出功能菜单,选择"分镜生成"。AI 会根据你的剧本自动拆解出分镜脚本,每个分镜包含镜头编号、时长建议、画面描述、角色信息、景别、动作、情绪等详细字段。
如果你不满意某个分镜的拆解,可以手动编辑或让 AI 重新生成。确认分镜脚本后,就可以进入下一步。
7.4 生成分镜首帧图
选中分镜脚本节点,使用工具栏中的"批量生图"功能,为每一个分镜生成一张首帧图。你可以选择不同的图像模型(如 LibNano Pro、Seedream 5.0 等),也可以使用多角度预览和三维打光功能来调整画面的构图和光影。
如果需要使用参考角色,这时候就可以上传或生成角色的三视图,并将其与对应的分镜节点关联。
7.5 生成视频
确认首帧图满意后,选中目标分镜,选择 Star Video 2.0 模型进行视频生成。对于多镜头叙事的场景,你可以把多个分镜合并成一个提示词提交给 Star Video 2.0,让它一次性生成包含多个镜