W
AI-Wiki
CONCEPT

Agent + ComfyUI 短剧生成流水线

定义

Agent + ComfyUI 短剧生成流水线是文中用于 AI 短剧生产的一条端到端自动化链路,目标是把“一个一句话创意”持续加工成“最终 MP4 成片”。

它针对的不是“我写一个提示词,模型直接吐一段视频”的单点生成,而是把创意、剧本、分镜、关键帧、视频合成、质检等环节拆开,再由 Hermes Agent 统一编排、由 ComfyUI 负责渲染执行。

文中给出的整体顺序非常明确:

  1. 创意输入
  2. 剧本策划
  3. 分镜转译
  4. 关键帧生成
  5. 视频合成
  6. 自动质检
  7. 输出 MP4

这使它更接近“流水化视频生产系统”,而不是单模型一次性出片工具。

在本文档中的语境

这条流水线出自《我用 Hermes Agent + ComfyUI 搭了一条「AI 拍短剧」流水线(基础版) 摘要》对应原文,作者讨论的是:现有 AI 视频工具很多,但“从灵感到成品”之间的整条链路仍缺少成熟串联方案,因此尝试用 Hermes Agent + ComfyUI 做一个基础版样例。

文中的核心判断是:

  • 上层需要一个能理解创意、拆任务、组装流程的“脑子”
  • 下层需要一个能吃工作流、素材和模型并实际渲染视频的“手脚”

因此形成了“Hermes Agent 做编排大脑,ComfyUI 做渲染引擎”的分工。

整体链路与阶段顺序

文中给出的主链路是:

一句话创意 → 剧本策划 → 分镜提示词 → 关键帧生成 → ComfyUI 视频合成 → 后期质检 → 一条 MP4 视频。

如果按更通用的术语重述,可理解为:

  • 创意输入:输入一个极短的故事种子
  • 剧本策划:把故事拆成有节奏的短剧段落
  • 分镜转译:把剧情段落翻译成可供生成模型使用的镜头描述与提示词包
  • 关键帧生成:先产出关键画面,而不是直接整段视频
  • 视频合成:把关键帧送入图生视频流程进行延展
  • 自动质检:由 Agent 回看结果是否符合预期
  • 输出 MP4:下载并交付最终成片

这个顺序是本文定义该流水线时最关键的骨架,不能省略其中的中间层。

Hermes Agent 的职责边界

Hermes Agent在该架构里不直接负责“画图”或“渲染视频”。它的职责主要是编排与控制,具体包括:

  • 拆解一句话创意
  • 生成剧本和分镜结构
  • 为每个镜头生成提示词包
  • 把中文叙事转成 ComfyUI 工作流更容易消费的英文 Prompt
  • 维护跨分镜的角色一致性描述
  • 调用外部 API 与工作流
  • 对输出结果做自动检查

原文明确说过:Agent 不负责「画图」,真正出画面的工作交给下游渲染链。

因此,Hermes Agent更像制作流程中的“编剧 + 导演 + 制片调度 + 质检员”,而不是最终图像或视频模型本身。

ComfyUI 的职责边界

ComfyUI 在这条链路中的角色是渲染引擎,而不是上层创意决策器。

它负责接收:

  • workflow JSON
  • 上传的图片素材
  • 音频文件
  • 注入后的参数

然后通过视频模型完成 GPU 渲染,最终产出 MP4。

文中举例的下游视频环节是使用图生视频模型流程,例如 LTX I2V;上层 Agent 则通过 ComfyUI REST API 去提交任务、轮询状态并下载结果。

换句话说,ComfyUI 解决的是“怎么把既定流程和素材真正跑起来”,不是“这个故事该怎么讲”。

剧本策划:Agent 先当编剧

文中示例的输入只有一句话:

一个程序员在咖啡店写代码时,电脑突然蓝屏,咖啡洒了,最后发现是老板关的服务器。

拿到这类输入后,Hermes Agent不会直接去请求视频生成,而是先做剧本拆解。

作者采用的是 四宫格分镜结构:把一个短剧拆成 4 个分镜,每个分镜 5 秒,总时长 20 秒。

示例中的四段分别是:

分镜时长戏剧功能画面内容
15s开场钩子程序员在咖啡店专注写码,建立情境
25s冲突触发电脑蓝屏,表情从专注变崩溃
35s高潮发展咖啡意外翻倒,矛盾爆发
45s收尾反转老板现身关服务器,悬念收尾

也就是说,这条流水线不是直接把一句话喂给视频模型,而是先把故事整理成有节奏、有戏剧功能的镜头序列。

分镜转译:Agent 再当导演

剧本拆完以后,Hermes Agent还要把每个分镜转译成 ComfyUI 和下游模型可执行的“提示词包”。

文中说明,Agent 会为每段生成:

  • 画面描述 + 动作线
  • TTS 旁白文本
  • BGM 情绪点位标注
  • 英文 Prompt

示例里单个分镜提示词包不仅包含镜头标题和英文 Prompt,还包含以下结构化字段:

  • 画面描述
  • 角色参照
  • 色彩基调
  • 动作线
  • TTS_旁白
  • BGM_情绪点位

例如一个“咖啡店专注写码”的镜头,会被细化为中景、暖色调、侧后方视角、镜头缓慢横移、键盘敲击动作持续、阳光投影变化、咖啡蒸汽上升等细节。这说明该流水线中的 Agent 不是简单改写文案,而是在做镜头级别的导演转译。

角色一致性与角色资产库

这条架构里一个被单独强调的难点,是跨分镜角色一致性。

如果让 Agent 为 4 个分镜独立生成提示词,同一个“程序员”很可能在不同镜头里长得不一样。文中给出的思路不是幻想视频模型自己解决,而是引入 角色资产库 作为约束层。

文中示例的角色目录包括:

  • character_bible.md:角色档案
  • ref_photos/:正脸、侧脸、全身、表情等参考图
  • voice_samples/:不同情绪音频样本
  • prompts/:角色专属提示词,例如 main.txt