AI学习吧
📍 源码七号站 开源解码 Pixelle-Video 深度拆解:一个主题词自动生成完整短视频的开源 AI 引擎

Pixelle-Video 深度拆解:一个主题词自动生成完整短视频的开源 AI 引擎

摘要:Pixelle-Video是一款基于ComfyUI架构的开源AI短视频自动化引擎,只需输入一个主题关键词,即可全自动完成文案撰写、AI配图、语音合成、背景音乐添加和视频合成五大步骤。它支持通义千问、DeepSeek等多种大语言模型,以及FLUX、Stable Diffusion等图像生成模型,整个流程模块化、可插拔,支持本地或云端部署。本文从底层原理、安装部署、配置调优到实际操作进行了全链路拆解,帮助你快速上手这一高效的视频创作工具。
字号 100%
行距 2.05
当前可见 60% 的内容
快速摘要: Pixelle-Video 是一个基于 ComfyUI 架构的开源 AI 短视频自动化引擎,你只需要输入一个主题关键词,它就能自动完成文案撰写、AI 配图生成、语音合成、背景音乐添加和最终视频合成这五个核心步骤。 它支持通义千问、DeepSeek、Ollama 等多种大语言模型,图像生成方面支持 FLUX、Stable Diffusion 等主流模型,语音合成支持 Edge-TTS、Index-TTS 等方案,整个流程模块化、可插拔。本文将从底层原理、安装部署、配置调优到实际操作全链路拆解这个项目,往下看有更详细的分析。 本文由 莫潇羽@源码七号站(www.fuyuan7.com)原创撰写,转载请注明出处。

为什么需要这样一个工具

短视频已经成为当下最主流的内容表达形式。不管是知识科普、产品展示还是个人表达,短视频的传播效率都远超图文。但传统的短视频制作流程至少涉及五个环节——写文案、找素材、录音/配音、剪辑合成、调色出片——每个环节都需要特定的工具和技能储备。对于大多数人来说,光是学会 Premiere Pro 或 Final Cut Pro 的基本操作就需要投入大量时间。

Pixelle-Video 试图解决的正是这个痛点。它的核心理念是:把短视频制作流程中的每一个环节都交给 AI 去完成,用户只需要提供一个主题关键词。 比如你输入"为什么要坚持阅读",系统就会自动完成从文案创作到最终视频输出的全部工作。

这个项目由 AIDC-AI 团队开源在 GitHub 上,采用 Apache License 2.0 开源协议,项目地址是:

https://github.com/AIDC-AI/Pixelle-Video

截至莫潇羽@源码七号站撰写此文时,该项目在 GitHub 上已经获得了接近 2800 颗 Star,社区活跃度较高,版本迭代也比较频繁。接下来,我们就从技术原理到实操步骤,一步一步拆解这个项目。


整体技术架构解析

在深入操作之前,有必要先搞清楚 Pixelle-Video 底层是怎么运作的。理解了原理,后续遇到问题才知道该从哪里下手排查。

核心流水线:四阶段处理模型

Pixelle-Video 的视频生成过程本质上是一条四阶段流水线:

文案生成 → 配图规划 → 逐帧处理 → 视频合成

这四个阶段各自独立,又通过数据流串联在一起。我们逐一来看每个阶段具体做了什么。

第一阶段:文案生成。 这个环节的核心是大语言模型(LLM)。当你输入一个主题后,系统会把这个主题包装成一个精心设计的结构化 prompt,发送给你配置的 LLM(比如通义千问、DeepSeek、GPT 等)。这个 prompt 的设计非常关键——它不仅仅是简单地说"请围绕这个主题写一篇文章",而是明确要求 LLM 按照视频分镜的格式来输出内容。

具体来说,LLM 返回的不是一段随意的散文,而是一个带有明确分镜结构的 JSON 数据。每个分镜包含三个核心字段:解说词文本(也就是这个画面对应的旁白内容)、图像描述提示词(英文,用于指导 AI 图像生成模型创作对应的画面)、以及该分镜的时长估算。这种结构化的输出格式保证了后续每一个环节都有清晰的数据输入。

在最新版本中,项目团队对 LLM 结构化输出的解析逻辑进行了重构,提升了容错能力。即使 LLM 偶尔返回格式不够标准的数据,系统也能自动修正并提取出有效信息,而不是直接报错中断。这种健壮性的设计在实际使用中非常重要,因为不同 LLM 模型的输出格式稳定性参差不齐。

第二阶段:配图规划。 系统根据第一阶段输出的分镜脚本,为每一个片段规划需要生成的视觉素材。这里的"规划"包括确定每个分镜的图像提示词、图像尺寸、生成模型等参数。如果用户设置了统一的视觉风格前缀(比如"极简线条插画风格"),系统会自动把这个前缀拼接到每个分镜的提示词前面,确保整个视频的视觉风格一致。

第三阶段:逐帧处理。 这是计算量最大也是技术复杂度最高的环节。系统会逐个分镜地执行三个子任务。

第一个子任务是调用 AI 图像或视频生成模型创建视觉素材。系统把分镜中的英文图像提示词和用户设定的提示词前缀拼接在一起,连同图像尺寸等参数一起发送给 ComfyUI。ComfyUI 根据对应的工作流执行 AI 推理,生成符合描述的图像或视频片段,然后返回给 Pixelle-Video。这个过程中,ComfyUI 工作流里实际执行的步骤可能非常复杂——包括模型加载、提示词编码、扩散采样、VAE 解码、后处理等十几个环节——但对于 Pixelle-Video 来说,这一切都被封装在了工作流内部,它只需要发送请求和接收结果。

第二个子任务是调用 TTS 引擎把对应的文案文字转换为语音音频。系统会把当前分镜的解说词文本发送给 TTS 工作流,工作流执行语音合成后返回一个音频文件。音频文件的时长直接决定了这个分镜在最终视频中的持续时间——也就是说,视频的节奏是由语音的节奏来驱动的。

第三个子任务是根据选择的视频模板,把图像(或视频)和文字信息渲染成一帧帧的画面。这个环节用到了 Chromium 无头浏览器来渲染 HTML 模板。系统把分镜的文字内容和生成的图像素材作为参数注入到 HTML 模板中,然后用 Chromium 渲染这个页面并截图,生成一系列静态图像帧。这些帧按照时间轴排列起来,就构成了这个分镜的视觉内容。这种基于 HTML 的渲染方式非常灵活,意味着你可以利用任何 Web 技术(CSS 渐变、SVG 图形、甚至 Canvas 动画)来设计视频画面。

第四阶段:视频合成。 最终,系统使用 FFmpeg 把所有分镜的画面帧序列、语音音轨、背景音乐合成为一个完整的视频文件。FFmpeg 是业界标准的音视频处理工具,Pixelle-Video 在这一步完成帧率控制、音频混合、格式编码等工作。

视频合成过程中涉及的技术细节其实相当多。首先是帧率控制——系统需要根据每个分镜的语音时长来精确计算这个分镜需要多少帧画面。假设视频帧率设定为 30fps,一段 3 秒的语音就需要 90 帧画面。如果使用的是静态图片模板,这 90 帧实际上是同一张图片的重复;如果使用的是视频模板或带有 CSS 动画的模板,每一帧可能都略有不同。

其次是音频混合。系统需要把多个分镜的语音音频按时间轴拼接在一起,然后与背景音乐进行混合。背景音乐的音量通常会被自动降低,以确保人声清晰可闻。如果背景音乐的长度不够覆盖整个视频,系统会自动循环播放。

最终输出的视频格式通常是 MP4(H.264 编码 + AAC 音频),这是目前兼容性最好的视频格式,几乎所有平台和设备都能正常播放。

模块化架构设计

Pixelle-Video 采用了高度模块化的架构设计,这是它最核心的技术优势之一。

在传统的 AI 视频工具中,各个环节通常是紧耦合的——用什么模型、用什么 TTS、用什么画面风格,往往都是写在代码里不可更改的。但 Pixelle-Video 不同,它把整个流水线中的每一个"能力单元"都抽象成了可替换的模块。

这种模块化的实现方式得益于它对 ComfyUI 生态的深度整合。ComfyUI 是一个基于节点化工作流的 AI 生成平台,它的核心思想是:把复杂的 AI 生成过程拆解成一个个"节点",每个节点负责一个特定的功能(比如加载模型、执行推理、后处理等),节点之间通过数据流连接起来形成"工作流"。

Pixelle-Video 中的图像生成和语音合成都是通过调用 ComfyUI 工作流来实现的。项目的 workflows/ 目录下预置了多个工作流 JSON 文件,分别对应不同的生成任务。比如:

  • image_flux.json 对应使用 FLUX 模型生成图像
  • video_wan2.1.json 对应使用 WAN 2.1 模型生成视频片段
  • tts_edge.json 对应使用 Edge-TTS 进行语音合成
  • tts_index.json 对应使用 Index-TTS 进行语音合成

这意味着,如果你想把图像生成模型从 FLUX 换成 Stable Diffusion XL,或者把 TTS 从 Edge-TTS 换成 ChatTTS,你不需要改一行代码——只需要在 ComfyUI 里搭好对应的工作流,导出为 JSON 文件放到 workflows/ 目录下就行了。

两种部署模式

在 ComfyUI 的接入方式上,Pixelle-Video 提供了两种模式:

本地部署模式(SelfHost): 你在自己的电脑或服务器上运行 ComfyUI 服务,Pixelle-Video 通过 HTTP API 与本地的 ComfyUI 通信。这种模式的优点是完全在本地运行,不产生额外费用,但需要你的机器有一块算力足够的显卡(推荐 NVIDIA GPU,显存至少 8GB 以上)。

云端模式(RunningHub): 如果你的电脑没有独立显卡或者显存不够,可以使用 RunningHub 提供的云端 ComfyUI 服务。你只需要填入 RunningHub 的 API Key,图像和视频的生成任务就会被发送到云端执行。RunningHub 提供了 24GB 和 48GB 显存两种规格的机器可选。

这两种模式可以根据实际情况灵活切换,混合使用也是可以的。


环境准备与安装部署

Pixelle-Video 目前提供了三种安装方式,从零基础用户到开发者都有对应的方案。

方式一:Windows 一键整合包(推荐新手使用)

这是门槛最低的方式。项目团队提供了 Windows 平台的一键整合包,打包了 Python 环境、FFmpeg、Chromium 等所有依赖,下载解压后双击启动脚本就能用。

操作步骤如下:

用这种方式,你完全不需要手动安装 Python、uv 或 FFmpeg,属于真正的"开箱即用"。需要注意的是,整合包的体积会比较大,因为它内置了完整的运行环境。

方式二:源码安装(推荐有一定基础的用户)

如果你有 Python 开发经验,或者使用的是 macOS / Linux 系统,源码安装是更灵活的选择。

首先,你需要确保系统中已经安装了两个前置工具:

安装 uv(Python 包管理器):

# macOS / Linux
curl -LsSf https://astral.sh/uv/install.sh | sh

# Windows (PowerShell)
powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"

uv 是一个用 Rust 编写的高速 Python 包管理器,速度比传统的 pip 快很多。Pixelle-Video 使用 uv 来管理 Python 依赖。

安装 FFmpeg(音视频处理工具):

# macOS (使用 Homebrew)
brew install ffmpeg

# Ubuntu / Debian
sudo apt update && sudo apt install ffmpeg

# Windows (使用 Chocolatey)
choco install ffmpeg

FFmpeg 是视频合成环节的核心工具,负责把图像帧序列、音频轨道合成为最终的视频文件。

前置工具准备好之后,就可以拉取代码并启动了:

# 克隆项目代码
git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video

# 使用 uv 运行(会自动安装所有 Python 依赖)
uv run streamlit run web/app.py

执行完最后一条命令后,浏览器会自动打开 Web 界面。首次运行时 uv 会自动下载并安装所有依赖包,这个过程可能需要几分钟时间,取决于你的网络状况。

方式三:Docker 部署(推荐服务器或团队使用)

如果你需要在服务器上长期运行,或者希望把 Pixelle-Video 部署为一个稳定的服务,Docker 是最合适的选择。

# 克隆项目
git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video

# 复制配置文件模板
cp config.example.yaml config.yaml

# 启动 Docker 服务(国内用户可加 USE_CN_MIRROR=true 使用国内镜像加速)
USE_CN_MIRROR=true docker compose up -d

Docker 方案会启动两个容器:一个是 API 服务(端口 8000),一个是 Web 界面服务(端口 8501)。配置文件 config.yaml 通过 volume 挂载到容器中,修改后无需重建镜像。

从 Dockerfile 可以看到,项目基于 Python 3.11 Slim 镜像构建,系统依赖包括 FFmpeg(音视频处理)、Chromium(HTML 模板渲染)、以及 Noto CJK 字体(中日韩字符显示支持)。

对于国内部署,Docker Compose 文件支持通过 USE_CN_MIRROR 参数切换为阿里云镜像源,这样在 docker build 阶段就不会因为网络问题卡住。


首次配置详解

不管你选择了哪种安装方式,首次使用前都需要完成系统配置。打开 Web 界面后,展开「⚙️ 系统配置」面板,这里需要配置两个核心模块。

配置大语言模型(LLM)

LLM 是文案生成的"大脑",Pixelle-Video 需要调用 LLM 来完成视频脚本的自动创作。

目前支持的 LLM 类型包括:

  • 通义千问(Qwen): 阿里云出品的大语言模型,国内访问速度快,性价比较高。到阿里云百炼平台注册并获取 API Key 即可使用。
  • DeepSeek: 深度求索出品的开源大模型,代码和推理能力突出。到 DeepSeek 开放平台获取 API Key。
  • Ollama 本地模型: 如果你想完全在本地运行(不依赖任何云端 API),可以安装 Ollama 并下载一个本地模型(如 Qwen2.5、Llama 3 等)。Ollama 提供了兼容 OpenAI API 格式的本地接口,Base URL 通常是 http://localhost:11434/v1
  • 其他兼容 OpenAI API 格式的服务: 包括各种中转站、自建模型服务等,只要接口格式兼容就能接入。

配置界面提供了便捷的预设选择功能——通过下拉菜单选择预设模型后,Base URL 和模型名称会自动填充,你只需要填入 API Key 即可。如果你使用的是自定义服务,也可以手动填写这三个字段。

在这里,莫潇羽@源码七号站建议新手优先选择通义千问或 DeepSeek。这两个模型在中文场景下的文案生成质量都不错,且注册流程相对简单。

LLM 模型选择建议

选择合适的 LLM 模型对最终视频质量的影响非常大,这里 莫潇羽@源码七号站 做一个更详细的对比分析,帮助你做出合理的选择。

通义千问(Qwen) 是阿里巴巴达摩院出品的大语言模型系列。它在中文语义理解和文本生成方面表现优秀,尤其擅长生成流畅自然的中文叙述性文案。对于生活知识、文化科普、情感故事等偏叙事类的视频主题,通义千问的输出质量通常很不错。注册阿里云百炼平台后即可获取 API Key,新用户通常有一定的使用额度,非常适合前期测试。

DeepSeek 是深度求索团队推出的大语言模型,在逻辑推理和结构化输出方面能力较强。如果你的视频主题偏向技术解释、数据分析、因果论证类内容,DeepSeek 往往能给出更有条理的文案结构。另外,DeepSeek 对于结构化 JSON 格式输出的遵循度也比较高,在与 Pixelle-Video 的配合使用中,出现格式解析错误的概率相对较低。

Ollama 本地模型 适合对数据安全有严格要求或者网络条件不稳定的用户。Ollama 支持在本地运行多种开源模型,比如 Qwen2.5、Llama 3、Mistral 等。使用 Ollama 的最大优势是完全不依赖外部 API,所有数据都在本地处理。但需要注意的是,本地模型的性能取决于你的硬件配置。对于文案生成这个任务来说,一个 7B 参数量的模型在普通消费级硬件上就能跑得比较流畅,但质量可能不如云端的大参数模型。如果你的内存够用(建议 16GB 以上),可以尝试 14B 甚至更大参数量的模型来获得更好的文案质量。

成本对比参考: 使用 Ollama 本地模型不产生 API 调用费用,只消耗电力和硬件资源。云端模型方面,通义千问和 DeepSeek 的调用成本都比较低。一般来说,一个包含 3-5 个分镜的视频,LLM 文案生成环节的 Token 消耗大约在 1000-3000 之间,折算下来成本很低,几乎可以忽略不计。

不管选择哪个模型,都建议在正式批量生成之前先用几个不同的主题测试一下,看看输出的文案风格和质量是否符合你的预期。文案质量是整个视频质量的基石,花时间在这个环节做选型是值得的。

配置图像生成服务

图像生成是整个流水线中对硬件要求最高的环节。配置方式取决于你选择的是本地模式还是云端模式。

本地 ComfyUI 模式:

如果你选择在本地运行 ComfyUI,需要先确保 ComfyUI 已经正确安装并启动。ComfyUI 的安装本身是一个独立的话题,这里简述关键步骤:

在 Pixelle-Video 的配置界面中,填入 ComfyUI 的地址(默认 http://127.0.0.1:8188),然后点击「测试连接」。如果连接成功,说明 Pixelle-Video 能正常调用本地 ComfyUI 来生成图像了。

有一点很重要——你需要确保 Pixelle-Video 预置的工作流在你的 ComfyUI 环境中能正常运行。建议先把 workflows/ 目录下的 JSON 工作流文件导入 ComfyUI 手动测试一遍,确认模型文件、自定义节点都已经正确安装。如果工作流在 ComfyUI 中跑不通,Pixelle-Video 调用时也一样会报错。

RunningHub 云端模式:

如果没有本地显卡,可以使用 RunningHub 提供的云端 ComfyUI 服务。到 RunningHub 官网(https://www.runninghub.cn/)注册账号,获取 API Key,填入配置界面即可。RunningHub 支持并发请求配置,你可以根据自己的需求和预算调整并发数。

配置完成后,别忘了点击「保存配置」。配置会持久化到 config.yaml 文件中,下次启动无需重新填写。


Web 界面操作全流程

Pixelle-Video 的 Web 界面基于 Streamlit 构建,采用了三栏式布局。每一栏负责不同的功能区域,下面我们按照实际操作的顺序来逐一讲解。

左侧栏:内容输入

这是视频创作的起点。左侧栏提供了两种内容输入模式。

AI 生成模式: 这是最常用的模式。你只需要在输入框中填写一个主题关键词或主题句,比如"坚持阅读改变人生"、"量子力学入门科普"、"中国传统节日习俗"等。系统会把这个主题发送给 LLM,由 AI 自动生成完整的视频文案脚本。

固定文案模式: 如果你已经有了现成的文案,可以切换到这个模式,直接粘贴进去。系统会跳过 LLM 文案生成环节,直接进入后续的配图和语音处理。这个模式支持三种文本分割方式——按段落分割、按行分割、按句子分割——你可以根据文案的结构选择合适的方式。每一个分割出的文本片段会对应视频中的一个分镜。

背景音乐(BGM)的设置也在左侧栏。你有三种选择:不使用 BGM(纯人声解说)、使用内置的背景音乐(项目 bgm/ 目录下预置了一些音乐文件)、或者使用你自己准备的音乐文件。如果选择自定义音乐,把 MP3 或 WAV 文件放到 bgm/ 目录即可。界面上提供了试听功能,点击「试听 BGM」就能预览效果。

中间栏:语音与视觉设置

中间栏分为两个区块——语音设置和视觉设置。

语音设置这一块: 核心是选择 TTS 工作流。前面提到,Pixelle-Video 的语音合成也是通过 ComfyUI 工作流来实现的。系统会自动扫描 workflows/ 目录下的 TTS 相关工作流文件,在下拉菜单中列出供你选择。

目前支持的主流 TTS 方案有两个方向。Edge-TTS 是微软 Edge 浏览器内置的在线语音合成服务,它的 Python 封装库允许开发者通过代码调用这项服务。Edge-TTS 的优势是完全不需要本地 GPU,音质也相当自然,支持多种中文音色(如"晓晓"、"云扬"等),属于"开箱即用"型的方案。不过需要注意的是,Edge-TTS 需要联网才能使用,而且微软方面的服务接口偶尔会有变动,项目团队已经在最新版本中锁定了 edge-tts 的 Python 库版本来保证稳定性。

另一个方向是 Index-TTS,这是由 B 站(bilibili)团队开源的高质量语音合成模型。Index-TTS 最大的特色是支持零样本声音克隆——你只需要上传一段参考音频(几秒到十几秒即可),它就能生成与参考音频音色相似的语音。最新的 Index-TTS 2.0 版本还加入了情感控制功能,可以独立控制音色和情感表达,同时支持精确的语音时长控制,这在视频配音场景中非常有价值——因为视频制作往往需要语音严格匹配画面时长。Index-TTS 还支持中文拼音混合输入,当你需要精确控制某个字的发音时(比如多音字),可以用拼音标注来强制指定读音。不过 Index-TTS 需要在本地部署模型,对显卡有一定要求。

除了这两个主要方案,社区中还有一些其他的 TTS 选择。比如 ChatTTS 是一个专注于对话场景的语音合成模型,它生成的语音更贴近日常交谈的语气,适合制作"聊天体"风格的视频。如果你想接入 ChatTTS,只需要在 ComfyUI 中安装对应的节点,搭建一个 ChatTTS 工作流,然后导出放到 Pixelle-Video 的 workflows/ 目录即可。

TTS 方案选择建议: 如果你只是想快速上手,Edge-TTS 是毫无疑问的首选——不需要本地 GPU,不需要下载模型,音质也不错。如果你需要用特定的音色来打造个性化的声音形象,Index-TTS 的声音克隆功能是目前开源方案中效果较好的。如果你有更高级的需求(比如情感控制、方言支持等),可以探索 ComfyUI 生态中的其他 TTS 节点。

如果你选择了支持声音克隆的 TTS 工作流,界面上会出现一个「参考音频」上传区域,你可以上传 MP3、WAV 或 FLAC 格式的参考音频。上传后可以直接试听,也可以输入一段测试文本点击「预览语音」来试听合成效果。

视觉设置这一块: 包含两个关键配置项。

一是 图像生成工作流 的选择。和 TTS 类似,图像生成工作流也从 workflows/ 目录中自动扫描加载。默认使用 image_flux.json,对应 FLUX 这个比较流行的 AI 绘图模型。你也可以选择其他预置工作流,或者把自己搭建的 ComfyUI 工作流导出后放进去。

图像尺寸可以自定义,默认是 1024×1024 像素。需要注意不同的生成模型对尺寸有不同的限制,比如 FLUX 模型通常在 1024×1024 或 768×1344 等特定尺寸下效果最好。

提示词前缀(Prompt Prefix) 是一个值得好好利用的功能。它会自动拼接到每个分镜的图像提示词前面,用来统一整个视频的画面风格。比如你设置前缀为:

Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style

那么无论 LLM 生成的分镜内容是什么,最终发给图像生成模型的提示词都会带上这个前缀。这样就能确保整个视频从头到尾的视觉风格是一致的。需要注意的是,提示词前缀必须使用英文,因为大多数 AI 图像生成模型对英文提示词的理解效果更好。

点击「预览风格」按钮可以用当前配置快速生成一张测试图片,确认画面效果是否符合预期。这是一个非常实用的功能,建议在正式生成视频之前先预览几次,调整到满意的风格再开始。

二是 视频模板 的选择。视频模板决定了最终画面的布局和设计,比如文字显示在什么位置、图片怎么放置、是否有动效等。

Pixelle-Video 的模板系统基于 HTML 技术实现。每个模板就是一个 HTML 文件,放在 templates/ 目录下。系统通过 Chromium 无头浏览器渲染这些 HTML 模板,再截图生成视频帧。这种设计有一个巨大的优势——如果你懂 HTML 和 CSS,就可以完全自定义视频画面的每一个细节。

模板按照命名规则分为三类:

  • static_ 开头的是静态模板,不依赖 AI 生成的图像素材,纯文字排版设计
  • image_ 开头的是图片模板,使用 AI 生成的图片作为画面背景或主要视觉元素
  • video_ 开头的是视频模板,使用 AI 生成的视频片段作为画面背景

模板在下拉菜单中按视频尺寸分组显示——竖屏(9:16,适合手机端平台)、横屏(16:9,适合桌面端播放)、方形(1:1,适合社交媒体信息流)。

右侧栏:生成与预览

当所有参数都配置完毕后,点击右侧栏的「🎬 生成视频」按钮就可以开始了。

生成过程中,界面会实时显示当前进度。你可以看到系统正在执行哪个步骤,比如"分镜 3/5 - 生成插图"这样的提示。整个生成时间取决于分镜数量、网络状况和 AI 推理速度,通常一个 3-5 个分镜的视频可以在几分钟内完成。

生成完成后,视频会自动在右侧栏播放。界面上会显示视频时长、文件大小、分镜数等基本信息。生成的视频文件保存在项目的 output/ 目录下,你可以直接取用。


进阶技巧与实践建议

如何获得更好的文案质量

LLM 的选择直接决定了视频文案的质量。根据莫潇羽@源码七号站的实际测试经验,不同模型在不同类型的主题上表现差异明显。知识科普类主题,DeepSeek 的逻辑组织能力比较强;情感叙事类主题,通义千问的语言表达更自然流畅。如果对文案质量要求很高,可以先用"固定文案模式"自己写好脚本,再让系统处理后续的配图和配音环节。

另外,主题关键词的写法也有讲究。比起笼统的"健康生活","每天快走 30 分钟对身体的五个好处"这样具体的表述能让 LLM 输出更有针对性的文案。

自定义 ComfyUI 工作流

这是 Pixelle-Video 最有想象力的扩展点。只要你熟悉 ComfyUI 的工作流搭建,就可以把几乎任何 AI 生成能力接入这个视频制作流水线。

举几个实际场景:

  • 你想用 Stable Diffusion 3 替代 FLUX 来生成图像,只需要在 ComfyUI 里搭好对应的工作流,导出 JSON 放到 workflows/ 目录
  • 你想使用 ChatTTS 替代 Edge-TTS,同样的操作思路
  • 你想在图像生成后自动做一次高清放大(UpScale),在工作流里加一个放大节点即可

需要注意的是,Pixelle-Video 对工作流有一些约定——工作流中的输入输出节点需要遵循特定的命名规范,这样系统才知道往哪里填入提示词、从哪里取回生成结果。具体的规范可以参考项目 workflows/ 目录下已有的工作流文件,照着它们的结构来搭建就不容易出错。

为了更好地理解这一点,我们以图像生成工作流为例来说明。Pixelle-Video 在调用工作流时,需要动态替换以下几个参数:

  • 正向提示词(positive prompt): 对应 CLIP 文本编码节点的输入,系统会自动填入用户设定的提示词前缀 + LLM 生成的英文图像描述
  • 图像宽度和高度: 对应空白潜空间生成节点或图像尺寸设置节点的参数
  • 随机种子: 对应采样器节点的 seed 参数,通常使用随机值来保证每次生成的结果不同
  • 输出节点: 系统需要知道从哪个节点获取最终生成的图像文件

在预置的工作流 JSON 文件中,这些需要动态替换的参数位置已经用特定的占位标记标注好了。当你创建自定义工作流时,只需要确保对应位置的节点 ID 和参数名称与系统期望的一致即可。一个比较省事的做法是——在 ComfyUI 中搭建好你想要的工作流,导出为 API 格式的 JSON 文件,然后对照已有的工作流文件,把占位标记添加到正确的位置。

如果你在自定义工作流过程中遇到问题,可以到项目的 GitHub Issues 页面查找类似的问题或提交新的问题。社区中已经有不少用户分享了自己搭建工作流的经验和踩过的坑。

自定义视频模板

如果你熟悉 HTML 和 CSS,可以在 templates/ 目录下创建自己的视频模板。模板文件需要遵循特定的命名规范(static_image_video_ 前缀),以及特定的 HTML 结构约定。

一个简单的思路是:复制一个已有的模板文件,在它的基础上修改样式和布局。比如你可以调整字体大小、颜色、背景透明度、文字动画效果等。因为底层用的是标准的 Web 技术栈,你甚至可以用 CSS 动画来实现文字渐入、图片缩放等过渡效果。

模板的尺寸决定了视频的画面比例。竖屏模板通常设计为 1080×1920 像素(9:16),横屏为 1920×1080 像素(16:9),方形为 1080×1080 像素(1:1)。

为了帮助你理解模板的基本结构,下面给出一个简化的图片类模板框架示例:

<!DOCTYPE html>
<html>
<head>
<style>
  body {
    margin: 0;
    width: 1080px;
    height: 1920px;
    overflow: hidden;
    font-family: 'Noto Sans CJK SC', sans-serif;
  }
  .bg-image {
    position: absolute;
    width: 100%;
    height: 100%;
    object-fit: cover;
    /* 背景图片会被替换为 AI 生成的图像 */
  }
  .text-overlay {
    position: absolute;
    bottom: 120px;
    left: 60px;
    right: 60px;
    color: #ffffff;
    font-size: 42px;
    line-height: 1.6;
    text-shadow: 0 2px 8px rgba(0,0,0,0.6);
    /* 文字内容会被替换为当前分镜的解说词 */
  }
  .gradient-mask {
    position: absolute;
    bottom: 0;
    width: 100%;
    height: 50%;
    background: linear-gradient(transparent, rgba(0,0,0,0.7));
  }
</style>
</head>
<body>
🔒
该内容仅对更高等级社区用户开放
请谨慎解锁时效性强且发布日期较早的文章
单篇解锁后若未显示全文请刷新页面
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
注册用户
注册用户
可见 70%
社区精英
社区精英
可见 100%
社区守护
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥9.9
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布1 篇
文章总数1315 篇
昨日发布7 篇
本月发布26 篇
建站时间419 天
🔍 搜索
📅 日历
« 2026 » « 09 »
 123456
78910111213
14151617181920
21222324252627
282930    
站长微语

联系站长

QQ:2805463528
AIGC 技术社区
致力于解码 AI前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长QQ二维码
AI交流群
AI交流群
仍在路上

那些寒夜里追赶过的方向

那些冷眼下没放弃的理想

一篇一篇写到现在

仍在路上

"不羁放纵爱自由"

—— 致敬 Beyond
持续创作中 莫潇羽 · 源码七号站