想做短视频,选题其实不难,难的是后面那一长串机械劳动:写文案、找配图、配人声、铺背景音乐、对字幕、导出。一条 1 分钟的视频,就算熟练工也要一两个小时。想靠这个做号、做矩阵,人力根本顶不住——你算过就知道了,一天能出两条已经是极限。
于是很多人去找「AI 一键成片」。市面上的东西大概分两类:一类是网页版 SaaS,模板固定、按条收费,素材还得先传到别人服务器;另一类是开源项目,能自己部署、数据和模型都在自己手上,但不少项目要么停更、要么只认某一个固定模型,换个模型就废了。
今天要说的 Pixelle-Video 属于第二类里目前最活跃的那一个。它的逻辑很简单:你给一个主题,它把文案、配图、配音、背景音乐、合成全部做完。官方给的宣传语是「3 分钟生成一个短视频」,这句话有水分(取决于你接的模型速度),但它至少把流程真的串起来了。

如果你平时也在挑 AI 工具,可以先看一眼站内这篇按需求挑 AI 工具的思路,再决定要不要为「自动出片」单独装一套东西。
一、先说清楚:它到底解决什么问题
它解决的不是「生成一条惊艳的片子」,而是「把一条能发的片子做出来,且不用我坐下剪」。这两件事差别很大,先说破,省得你装完失望。
它真正省掉的是这四件事:
- 写稿:给个主题,自动出标题、旁白和分镜脚本;
- 配图:把旁白逐句拆成分镜,每句配一张图(或一段视频);
- 配音:接入 TTS 直接出人声,还能传参考音频做音色克隆;
- 合成:按你选的模板排版、贴字幕、铺 BGM、导出成片。
换句话说,它是一个流水线调度器,不是一个「视频模型」。这句话很重要——它同时决定了它的上限和下限,后面第五节还会展开。
二、关键数据先摆出来
| 项目 | 数值 |
|---|---|
| 仓库 | github.com/ATH-MaaS/Pixelle-Video |
| Star / Fork | 28,674 / 4,172 |
| 开源许可 | Apache-2.0 |
| 主要语言 | Python |
| 最新发行版 | v0.1.15(2026-01-27,Windows 一键整合包) |
| 整合包累计下载 | 约 81,000 次 |
| 内置模板 / 工作流 | 31 套模板、29 套工作流 |
| 贡献者 / 提交 | 15 位贡献者,核心作者提交 245 次 |
| 首次发布 / 最近提交 | 2025-11-07 / 2026-06-14 |
两万八千多 Star、八万多次整合包下载,说明它不是自嗨项目。但 Star 只代表「有人觉得这事值得」,不代表「它适合你」——下面几个问题才是真正决定体验的。
两个容易踩的坑,先说明白
第一,仓库地址已经换了。这个项目最早在 AIDC-AI 组织下,现在整个组织改名成了 ATH-MaaS,所以 README 里的徽章、文档链接、下载链接全都还写着旧名字。aidc-ai.github.io 那个文档站现在直接 404,正确地址是 ath-maas.github.io/Pixelle-Video/zh。如果你搜到旧链接打不开,不是项目挂了。
第二,它不是「破解版剪映」。它不提供任何平台的素材库,也不帮你搬运别人的视频。所有画面要么是 AI 现生成的,要么是你自己上传的素材。这一点比什么都重要——它决定了你能拿它做什么内容,也决定了你在平台上的合规风险。
三、整条流水线长什么样
下面是官方流程图。左边输入文本,右边输出视频,中间那个橙色大框就是它真正干活的地方:

拆开看是四步:生成脚本(标题 + 旁白)→ 生成分镜提示词 → 逐环节产出(音频 / 图片 / 合成帧 / 渲染片段)→ 拼接并铺 BGM 输出成片。
注意中间那格写的三行小字:edge-tts | index-tts | chat-tts | custom、flux | qwen | sdxl | custom。这就是它跟「固定模板 SaaS」最大的不同——每一步都是一个可以替换的插槽。你觉得配音不好听就换 TTS,觉得画风不对就换图像模型,不用等官方更新。
四、界面怎么用:三步出第一条
它跑起来是个本地网页(Streamlit),三栏布局,不需要写代码:

流程只有三步:① 展开「系统配置」把模型密钥填上 → ② 左侧填主题(或直接贴现成文案)→ ③ 点「生成视频」。中间你还能顺手调这几样:分镜数量(0 到 10+,直接决定视频长短)、语速、男声/女声、分镜模板、图像尺寸。
三个配置项分别管什么,别填错:
| 配置项 | 管什么 | 常见选择 | 能不能跳过 |
|---|---|---|---|
| LLM 配置 | 写文案、拆分镜 | 通义千问 / GPT-4o / DeepSeek / Ollama | 不能,必须填 |
| ComfyUI / RunningHub | 出图、出视频、出语音 | 本地 ComfyUI,或云端 RunningHub | 二选一,至少配一个 |
| API 媒体模型 | 不装 ComfyUI,直连模型厂商 | OpenAI、DashScope、火山 ARK、可灵 | 可以,只在用 api/ 工作流时才需要 |
关于「画风很丑」这件事
很多人第一眼看到官方示例会觉得:「就这?火柴人?」——这其实不是它不行,而是默认提示词前缀决定的。它的默认值是:
Minimalist black-and-white matchstick figure style illustration,
clean lines, simple sketch style
也就是「极简黑白火柴人线稿」。这个前缀是写在 config.yaml 里的,改掉它 + 换一个图像模型,画风立刻就变了。默认这个风格只是因为它加载快、成本低,适合先把流程跑通:

所以别拿默认效果去判断这个项目的上限。真正决定成片好看程度的,是你接的那个图像/视频模型。
五、要花多少钱?(这是最容易误会的地方)
先说一句最关键的澄清,能省你很多纠结:Pixelle-Video 本体几乎不消耗显卡。它是个调度壳,真正的重活——出图、出视频、跑 TTS——全在它外面:本地 ComfyUI、云端 RunningHub,或者直连的模型 API。
所以「我电脑没显卡能不能用」的答案是:能用,只不过你要么付 API 的钱,要么租云显卡跑。三种方案的账大概是这样:
| 方案 | 怎么配 | 成本 | 适合谁 |
|---|---|---|---|
| 完全免费 | LLM 用 Ollama(本地跑)+ 本地 ComfyUI | 0 元 | 有能跑 ComfyUI 的显卡,且愿意折腾 |
| 推荐 | LLM 用通义千问 + 本地 ComfyUI | 官方口径:3 段分镜约 0.01–0.05 元 | 有显卡但想省事,文案质量要稳 |
| 纯云端 | LLM 用 OpenAI + 图像走 RunningHub | 明显更高,按量付费 | 完全不想碰本地环境 |
要提醒的是:那个「3 段分镜 0.01–0.05 元」只算了 LLM 写文案的钱,没算图像和视频生成。真正的开销大头在出图和出视频上——用云端视频模型的话,单条成本可能直接上一个量级。跑之前先在心里估一遍,别等账单出来才发现。
六、三种部署方式,按自己的情况选
| 方式 | 前置要求 | 启动命令 | 适合谁 |
|---|---|---|---|
| Windows 一键整合包 | 无(已打包 Python / uv / ffmpeg) | 解压后双击 start.bat | Windows 用户,想最快跑通 |
| 源码安装 | Python 包管理器 uv + ffmpeg | uv run streamlit run web/app.py | macOS / Linux,或想改代码 |
| Docker Compose | Docker / Docker Desktop | USE_CN_MIRROR=true docker-compose up -d | 想装到 NAS / 服务器上长期跑 |
Windows 整合包在 GitHub 的 Releases 里,最新那个 zip 约 380 MB。解压运行后浏览器会自动打开 http://localhost:8501,在「⚙️ 系统配置」里填好密钥就能用。
源码方式要装两个前置依赖,命令如下:
# 1) 装前置依赖
macOS: brew install ffmpeg
Ubuntu / Debian: sudo apt update && sudo apt install ffmpeg
# 2) 拉代码并启动
git clone https://github.com/ATH-MaaS/Pixelle-Video.git
cd Pixelle-Video
uv run streamlit run web/app.py
Docker 方式多一句提示:国内建议加 USE_CN_MIRROR=true,它会自动走清华源,否则构建阶段大概率卡住。起来之后 Web 界面在 8501,后端 API 在 8000。config.yaml 和 output/ 都挂到了宿主机上,容器删了配置和成片也还在。
七、它最大的价值:能力可以随便换
仓库里实打实放了 31 套排版模板和29 套 ComfyUI 工作流,而且命名有规律,看一眼就知道是干什么的:
| 模板前缀 | 含义 | 是否需要 AI 生成素材 |
|---|---|---|
static_*.html | 纯文字排版 | 不需要,最省算力 |
image_*.html | AI 图片做背景 | 需要出图 |
video_*.html | AI 视频做背景 | 需要出视频,最贵 |
工作流则分本地和云端两套:workflows/selfhost/ 下 8 套(跑在你自己装的本机 ComfyUI,如 image_flux.json、image_nano_banana.json、tts_index2.json),workflows/runninghub/ 下 21 套(走云端算力,本地零配置)。文件名一样的那两个,就是同一件事的本地版和云端版。
想塞自己的工作流进去也不难,三步:先在本地 ComfyUI 里把流程跑通;把负责提示词的文本节点标题改成 $prompt.text!(或 $prompt.value!,看节点接受哪种输入);用「Save (API Format)」导出 JSON,按前缀丢进 workflows/ 就行——出图用 image_、出视频用 video_、语音用 tts_。文件名前缀错了,界面上就不会出现。
最近几个版本还往「素材分析」方向扩了:2026-01 加了数字人口播、图生视频、动作迁移三个扩展模块;2026-06 又加了直连 API 媒体模型配置(能在界面里直接填供应商的 Base URL 和代理开关)。也就是说它已经不只会做「图文卡片 + 旁白」这一种视频了。
八、常见问题
生成的视频存在哪?
存在项目目录下的 output/ 文件夹,界面上会显示时长、文件大小和分镜数量,可以直接下载。Docker 部署的话,你挂载 ./output 的那个宿主机目录就是。
语音合成老失败,是不是坏了?
大概率不是。默认的 Edge-TTS 调的是微软免费接口,网络一波动就失败,这是已知问题。解决办法是换成 ComfyUI 的 TTS 工作流(选 tts_ 前缀的那些,比如 tts_index2.json),稳定性高得多。
报错「Could not find a Chrome executable」怎么办?
系统里没装 Chrome。部分依赖浏览器的功能(比如模板渲染截图)需要它,装一个 Google Chrome 就好。
报 LLM 相关错误怎么排查?
按顺序查三样:Base URL 有没有多空格或多余斜杠、API Key 有没有余额、模型名有没有拼错。官方 FAQ 里这三条排在最前面,说明绝大多数报错都出在这里,跟你装的引擎没关系。
出来的片子不满意,从哪开始调?
按影响力从大到小:① 换 LLM(文案节奏和分镜逻辑全变了)→ ② 改提示词前缀 + 换图像模型(画风)→ ③ 换 TTS 或传参考音频(音色)→ ④ 换模板和尺寸(排版)。前两项动一下,效果差别比后两项大得多。
九、什么情况下其实不需要它
说点不讨好的。这工具不是人人都该装,下面几种情况建议先别折腾:
- 你的号靠真人出镜或实拍。那它帮不上忙——它做的是「图文 + 旁白」这类合成视频。真要走拍摄路线,看站内这篇从零开始入门短视频的拍摄剪辑更实在。
- 一周只发一两条,且剪映已经用得很顺手。边际收益很低。省下来的时间还不够你填配置表。
- 既不想碰命令行,也不想付任何 API 费用。体验会很差——出图慢、画风差,你大概率是用两天就卸载。
- 你只是想要现成的视频素材。那你需要的是下载工具,不是生成工具。站内这篇自托管的视频数据采集与下载 API更对口。
反过来说,它最适合的是这种人:有明确的批量内容方向(知识科普、书单、情感语录、历史故事这类图文型口播),能接受先花半天把环境配好,之后每天稳定出好几条。这时候它的价值才真正体现出来——因为它省的不是「做一条视频的时间」,而是「每条视频里那一段重复劳动」。
如果你只是想先玩玩 AI 配图和内容卡片,站内这篇AI 创作工具箱的用法门槛更低,不用装任何服务。
十、使用边界与合规提醒
这几条跟你账号的安全直接相关,比装不装得起来更重要:
- AI 生成内容要标注。主流平台基本都要求对 AI 生成的画面/人声做标识,别心存侥幸。标注不是减分项,被判定为「未标注的 AI 内容」才是。
- 别拿它做搬运和洗稿。它能生成画面,不代表你可以把别人的视频扒下来过一遍再发。真要找参考素材,走正规授权渠道。
- 声音克隆只用你本人或已获授权的声音。它的 Index-TTS 工作流支持上传参考音频克隆音色。用别人的声音(尤其是名人)去做内容,风险很高。
- 注意「两层许可」。Pixelle-Video 的代码是 Apache-2.0,商用没问题;但你调用的第三方模型 API(图像、视频、TTS)各有各的条款和商用限制,那部分得单独看。
十一、项目地址与文档
- GitHub 仓库:https://github.com/ATH-MaaS/Pixelle-Video
- 使用文档(中文):https://ath-maas.github.io/Pixelle-Video/zh/
- Windows 整合包下载:Releases 页面
- 官方视频教程:B 站
- 相关项目:Pixelle-MCP(让 AI 助手直接调用 ComfyUI)
提醒一句:README 和文档里的很多链接还写着旧组织名 AIDC-AI,点进去会自动跳到 ATH-MaaS,属于正常现象。看到地址栏变了别慌。




















解读,手把手教会你从0-1入局-Featured-Image-300x200-1.jpg)






暂无评论内容