W
AI-Wiki

AI · 源文件

入库前的原始上传文件存档。点击左侧文件名可预览文件内容。

我用 Hermes Agent + ComfyUI 搭了一条「AI 拍短剧」流水线(基础版).md8.3 KBit/ai/我用 Hermes Agent + ComfyUI 搭了一条「AI 拍短剧」流水线(基础版).md
---
title: "我用 Hermes Agent + ComfyUI 搭了一条「AI 拍短剧」流水线(基础版)"
source_url: "https://mp.weixin.qq.com/s/BCMhE7lu-HkkPljjS8_CZA"
source_site: "mp.weixin.qq.com"
clipped_at: "2026-07-06T10:49:07.015968+00:00"
clipper: "aiwiki-url-ingest"
extractor: "weixin_static"
source_strategy: "normal_web_clip"
source_strategy_label: "普通网页抓取"
author: "从AI到Web3的探索之旅"
---

# 我用 Hermes Agent + ComfyUI 搭了一条「AI 拍短剧」流水线(基础版)

上个月我产生了一个想法:像 Herems 这些 Agent 框架竟然可以产出文字图片内容,那么视频输出会怎么样呢,于是想让 AI Agent 帮我生成短剧。不是那种「我写提示词,AI 生成一段视频」的单点操作。而是**从一句话创意到完整视频,全自动走完**。

现在 AI 做视频的工具确实不少,但把「灵感到成品」之间的每个环节串联起来,这件事没人做好。

经过多方面的搜索资料,简单学习了一下目前做 AI 短剧的方法和工作流。

初期尝试,但也可以给大家作为一个参考

---

## 一、架构:谁是大脑,谁是手脚

先看整体链路:

```
一句话创意 
 ↓ 
① 剧本策划 (Hermes Agent 编剧) ← Agent 的能力 
 ↓ 
② 分镜提示词 (Agent 转译) ← Agent 的能力 
 ↓ 
③ 关键帧生成 (GPT Image 2 出图) ← 半自动 
 ↓ 
④ ComfyUI 视频合成 (LTX I2V) ← API 调用 
 ↓ 
⑤ 后期质检 (Agent 自动检查) ← Agent 的能力 
 ↓ 
一条 MP4 视频
```
核心分工:**Hermes Agent 做编排大脑,ComfyUI 做渲染引擎**。

Agent 不负责「画图」。它负责的是拆解创意、生成提示词、维护角色一致性、调用 API、检查输出质量。真正出画面的活儿,交给 ComfyUI。

---

## 二、剧本策划——Agent 当编剧

输入是一句话。比如:

> 「一个程序员在咖啡店写代码时,电脑突然蓝屏,咖啡洒了,最后发现是老板关的服务器。」

Hermes Agent 拿到这句话后,不是直接去生成视频——它先拆镜头生成分镜图片。

按照 **四宫格分镜** 结构自动拆解:

| 分镜 | 时长 | 戏剧功能 | 画面内容 |
| --- | --- | --- | --- |
| 1 | 5s | 开场钩子 | 程序员在咖啡店专注写码,建立情境 |
| 2 | 5s | 冲突触发 | 电脑蓝屏,表情从专注变崩溃 |
| 3 | 5s | 高潮发展 | 咖啡意外翻倒,矛盾爆发 |
| 4 | 5s | 收尾反转 | 老板现身关服务器,悬念收尾 |

![](https://mmbiz.qpic.cn/mmbiz_png/l3tcFSYBduFeAfSgvxWbcbxOwtFRo8xwHyf7FM6aNxEib1k3CnK4ZDdl39oDjnj4KfzFkgwIvmU5ia0N1IPgflicB1WfNk62Z3NelCkjhJpljs/640?wx_fmt=png&from=appmsg)四个分镜各 5 秒,加起来 20 秒。

Agent 为每段生成:

- • 画面描述 \+ 动作线
- • TTS 旁白文本
- • BGM 情绪点位标注
- • 英文 Prompt(ComfyUI 工作流需要英文输入)

![](https://mmbiz.qpic.cn/sz_mmbiz_png/l3tcFSYBduGcUFkoLH6Ijn40dEibtqyj5u6uoLVOVs1DCspyiaCGyNA1motjrGrZcYeLbibYiaCDvibVyADtCteUb5p2nosldgXFS0DsFdE7hCJY/640?wx_fmt=png&from=appmsg)

---

## 三、分镜提示词——Agent 当导演

剧本有了,Agent 需要把它翻译成 ComfyUI 能理解的语言。

对每个分镜生成一个提示词包:

- 

```
SCENE_01: TITLE: "Focused Coding in Cozy Coffee Shop" Prompt: > "A programmer types intensely at a wooden table in a cozy coffee shop, sunlight streaming through window, steam rising from coffee cup, cinematic lighting, 4k, slow camera pan right" 画面描述: > 中景,暖色调,侧后方视角,咖啡店环境安静舒适, 程序员专注敲代码,屏幕发出柔和光,咖啡冒着热气 角色参照: "profiles/程序员.md" 色彩基调: "暖橙 + 柔和棕色" 动作线: - "手指持续快速敲击键盘" - "镜头从左向右缓慢横移" - "阳光缓慢移动投影" - "咖啡轻微蒸汽上升" TTS_旁白: > "一切看起来都很平静,直到这一刻还没有任何预兆。" BGM_情绪点位: "0s - 5s:轻松lofi + 咖啡店环境音 + 低频暖音垫"
```
这里有一个核心难点:**跨分镜的角色一致性**。

如果你让 Agent 独立生成四个分镜的提示词,大概率每段的「程序员」长得不一样。解决方案是角色资产库比如拥有角色三视图等,不过这个就以后再讲了。

---

## 四、角色资产库(连续性保障)

如果要进行规范化的管理你的资产,那么可以尝试将每个角色在 Git 仓库里管理:

```
characters/程序员小王/ 
├── character_bible.md # 角色档案 
├── ref_photos/ # 正脸、侧脸、全身、表情 
│ ├── front.jpg 
│ ├── side.jpg 
│ └── angry.jpg 
├── voice_samples/ # 各情绪音频 
│ └── neutral.wav 
└── prompts/ # 角色专属提示词 
 └── main.txt
```
Agent 在生成每个分镜的提示词时,自动引用 `prompts/main.txt` 中的角色描述。这样四个分镜的「程序员」描述是一致的——虽然视频模型不能保证像素级一致性,但服装、发型、环境描述保持一致,观感上不会跳跃。

---

## 五、关键帧——四张图定节奏

在进入 ComfyUI 之前,需要先生成 4 张关键帧。

顺序:首帧(建立场景)→ 发展帧(冲突出现)→ 高潮帧(矛盾爆发)→ 结尾帧(反转/悬念)。具体根据你的剧本进行生成。

这里可以直接使用 GPT Image 2 出图,或者也可以用一些免费的开源模型进行生成,比如 qwen\-image 等。Agent 把每个分镜的提示词喂给模型,生成对应的关键帧。

文生成图的工作流可以在 runninghub 搜索下载。当然你也可以直接使用你订阅的 ChatGPT 直接生成,效果也非常不错。

---

## 六、ComfyUI 生成(核心环节)

这一步是整套流水线的枢纽。

Hermes Agent 通过 **ComfyUI REST API** 来提交任务:

```
Agent ──POST /prompt──→ ComfyUI ──→ GPU 渲染 ──→ 输出 MP4 
 ├── workflow JSON 
 ├── 上传图片 
 └── 音频文件
```
整段交互大概 50 行 Python,核心流程:

1. 1\. **导出 API 格式的 workflow** — 在 ComfyUI 界面里用「Save (API Format)」导出工作流。编辑器格式(带 subgraph 的)不能直接提给 API,必须导出为 API 格式。
2. 2\. **上传图片** — 把 4 张关键帧 POST 到 `/upload/image`
3. 3\. **提交 workflow** — 把 JSON \+ 参数注入,POST 到 `/prompt`
4. 4\. **轮询等待** — 检查 `/history/{prompt_id}`,直到 `status: success`
5. 5\. **下载视频** — 从 `/view` 拉取最终 MP4

当然你也可以不懂上面的流程, Hermes Agent 它自带有一套 skill \- Comfyui skill ,在部署好 Hermes 之后,你直接告诉他启用即可。

![](https://mmbiz.qpic.cn/mmbiz_png/l3tcFSYBduG49kFLQbJ9vSKUEcctJJjraJ5Ff7WGeanTjSSluHDDHmPaW0U54cHay9NvX8EFIMxhicAIZlTbX4wFG7oXRqaayvRLJemw09Gc/640?wx_fmt=png&from=appmsg)## 七、这套架构的通用性

虽然我用的是「短剧」场景,但 Agent \+ ComfyUI 的编排模式可以延伸到很多方向:

- • **营销视频批量生产**:产品介绍视频、AIGC 广告素材
- • **教育内容**:知识点可视化、操作演示
- • **游戏过场动画**:角色剧情短片
- • **动态封面/预告片**:公众号文章、社媒内容的视频化

你需要的东西并不复杂:

1. 1\. 一台有 GPU 的服务器(显存足够的话,入门级也能跑量化模型)
2. 2\. Hermes Agent(开源,免费)
3. 3\. ComfyUI(框架开源,免费)
4. 4\. 视频生成模型(如 LTX 2\.3 开源,免费)

**全栈开源,没有隐藏成本。**

---

## 下一步

当然,目前上面介绍的流程只是基础, pipeline 还有几个方向可以继续打通:

- • **多 Agent 协作**:编剧 Agent 和导演 Agent 分离,各自专注
- • **实时交互式生成**:Agent 根据用户反馈实时修改剧本和画面
- • **自定义音频注入**:主要是如何来描述音色来生成音频,包括克隆声音
- • **端到端角色一致性**:用更稳定的角色一致性保持方案替代纯提示词控制

在使用 comfyui 的时候,其实也可以找到一些非常不错的文生图,或者图生文工作流,目前也有许多比如小破站的光锥大佬的全能参考节点 Licon MSR ,也能达到接近 Seedance 的效果。

接下来也会通过不断的学习,然后把做 AI 视频学到的内容分享给大家。