Agent + ComfyUI 短剧生成流水线
定义
Agent + ComfyUI 短剧生成流水线是文中用于 AI 短剧生产的一条端到端自动化链路,目标是把“一个一句话创意”持续加工成“最终 MP4 成片”。
它针对的不是“我写一个提示词,模型直接吐一段视频”的单点生成,而是把创意、剧本、分镜、关键帧、视频合成、质检等环节拆开,再由 Hermes Agent 统一编排、由 ComfyUI 负责渲染执行。
文中给出的整体顺序非常明确:
- 创意输入
- 剧本策划
- 分镜转译
- 关键帧生成
- 视频合成
- 自动质检
- 输出 MP4
这使它更接近“流水化视频生产系统”,而不是单模型一次性出片工具。
在本文档中的语境
这条流水线出自《我用 Hermes Agent + ComfyUI 搭了一条「AI 拍短剧」流水线(基础版) 摘要》对应原文,作者讨论的是:现有 AI 视频工具很多,但“从灵感到成品”之间的整条链路仍缺少成熟串联方案,因此尝试用 Hermes Agent + ComfyUI 做一个基础版样例。
文中的核心判断是:
- 上层需要一个能理解创意、拆任务、组装流程的“脑子”
- 下层需要一个能吃工作流、素材和模型并实际渲染视频的“手脚”
因此形成了“Hermes Agent 做编排大脑,ComfyUI 做渲染引擎”的分工。
整体链路与阶段顺序
文中给出的主链路是:
一句话创意 → 剧本策划 → 分镜提示词 → 关键帧生成 → ComfyUI 视频合成 → 后期质检 → 一条 MP4 视频。
如果按更通用的术语重述,可理解为:
- 创意输入:输入一个极短的故事种子
- 剧本策划:把故事拆成有节奏的短剧段落
- 分镜转译:把剧情段落翻译成可供生成模型使用的镜头描述与提示词包
- 关键帧生成:先产出关键画面,而不是直接整段视频
- 视频合成:把关键帧送入图生视频流程进行延展
- 自动质检:由 Agent 回看结果是否符合预期
- 输出 MP4:下载并交付最终成片
这个顺序是本文定义该流水线时最关键的骨架,不能省略其中的中间层。
Hermes Agent 的职责边界
Hermes Agent在该架构里不直接负责“画图”或“渲染视频”。它的职责主要是编排与控制,具体包括:
- 拆解一句话创意
- 生成剧本和分镜结构
- 为每个镜头生成提示词包
- 把中文叙事转成 ComfyUI 工作流更容易消费的英文 Prompt
- 维护跨分镜的角色一致性描述
- 调用外部 API 与工作流
- 对输出结果做自动检查
原文明确说过:Agent 不负责「画图」,真正出画面的工作交给下游渲染链。
因此,Hermes Agent更像制作流程中的“编剧 + 导演 + 制片调度 + 质检员”,而不是最终图像或视频模型本身。
ComfyUI 的职责边界
ComfyUI 在这条链路中的角色是渲染引擎,而不是上层创意决策器。
它负责接收:
- workflow JSON
- 上传的图片素材
- 音频文件
- 注入后的参数
然后通过视频模型完成 GPU 渲染,最终产出 MP4。
文中举例的下游视频环节是使用图生视频模型流程,例如 LTX I2V;上层 Agent 则通过 ComfyUI REST API 去提交任务、轮询状态并下载结果。
换句话说,ComfyUI 解决的是“怎么把既定流程和素材真正跑起来”,不是“这个故事该怎么讲”。
剧本策划:Agent 先当编剧
文中示例的输入只有一句话:
一个程序员在咖啡店写代码时,电脑突然蓝屏,咖啡洒了,最后发现是老板关的服务器。
拿到这类输入后,Hermes Agent不会直接去请求视频生成,而是先做剧本拆解。
作者采用的是 四宫格分镜结构:把一个短剧拆成 4 个分镜,每个分镜 5 秒,总时长 20 秒。
示例中的四段分别是:
| 分镜 | 时长 | 戏剧功能 | 画面内容 |
|---|---|---|---|
| 1 | 5s | 开场钩子 | 程序员在咖啡店专注写码,建立情境 |
| 2 | 5s | 冲突触发 | 电脑蓝屏,表情从专注变崩溃 |
| 3 | 5s | 高潮发展 | 咖啡意外翻倒,矛盾爆发 |
| 4 | 5s | 收尾反转 | 老板现身关服务器,悬念收尾 |
也就是说,这条流水线不是直接把一句话喂给视频模型,而是先把故事整理成有节奏、有戏剧功能的镜头序列。
分镜转译:Agent 再当导演
剧本拆完以后,Hermes Agent还要把每个分镜转译成 ComfyUI 和下游模型可执行的“提示词包”。
文中说明,Agent 会为每段生成:
- 画面描述 + 动作线
- TTS 旁白文本
- BGM 情绪点位标注
- 英文 Prompt
示例里单个分镜提示词包不仅包含镜头标题和英文 Prompt,还包含以下结构化字段:
- 画面描述
- 角色参照
- 色彩基调
- 动作线
- TTS_旁白
- BGM_情绪点位
例如一个“咖啡店专注写码”的镜头,会被细化为中景、暖色调、侧后方视角、镜头缓慢横移、键盘敲击动作持续、阳光投影变化、咖啡蒸汽上升等细节。这说明该流水线中的 Agent 不是简单改写文案,而是在做镜头级别的导演转译。
角色一致性与角色资产库
这条架构里一个被单独强调的难点,是跨分镜角色一致性。
如果让 Agent 为 4 个分镜独立生成提示词,同一个“程序员”很可能在不同镜头里长得不一样。文中给出的思路不是幻想视频模型自己解决,而是引入 角色资产库 作为约束层。
文中示例的角色目录包括:
character_bible.md:角色档案ref_photos/:正脸、侧脸、全身、表情等参考图voice_samples/:不同情绪音频样本prompts/:角色专属提示词,例如main.txt