W
AI-Wiki
ENTITY

Hermes Agent

定义与身份

Hermes Agent 是《我用 Hermes Agent + ComfyUI 搭了一条「AI 拍短剧」流水线(基础版) 摘要》里短剧生成流水线的上层智能编排体,核心定位是“大脑”,不是图像模型,也不是视频渲染器。

在原文的整体链路里,它负责的环节包括:

  • ① 剧本策划
  • ② 分镜提示词转译
  • ⑤ 后期质检

而真正负责生成画面和视频的,是后续模型与渲染链路:

  • ③ 关键帧生成由图像模型完成,如 GPT Image 2,也可替换为 qwen-image 等模型
  • ④ 视频合成由 ComfyUI 工作流完成,文中示例是 LTX I2V

因此,Hermes Agent 在这条流水线中的准确角色,不是“生成视频的那个模型”,而是把创意拆成一系列可执行任务、再把任务交给各个工具的智能调度与编排层。

在流水线中的位置

原文给出的链路是:

一句话创意 → 剧本策划 → 分镜提示词 → 关键帧生成 → ComfyUI 视频合成 → 后期质检 → MP4 视频。

其中作者明确总结为:

  • Hermes Agent 做编排大脑
  • ComfyUI 做渲染引擎

这一定义非常关键,因为它划清了 Hermes Agent 的能力边界:它不直接“画图”,也不直接“渲染视频”,而是负责把前后流程接起来,让“一句话创意到完整视频”尽量自动跑通。

输入处理方式

Hermes Agent 的输入可以简化到一句话创意。原文示例是:

一个程序员在咖啡店写代码时,电脑突然蓝屏,咖啡洒了,最后发现是老板关的服务器。

拿到这类输入后,它不是直接开始生成视频,而是先进入剧本策划与分镜拆解阶段。

原文强调,Hermes 的第一步是“先拆镜头生成分镜图片”,也就是先把文本创意转成结构化镜头需求,而不是把一句自然语言直接粗暴喂给视频模型。

这一步的意义在于:

  • 把模糊创意转成可执行镜头单元
  • 先明确叙事节奏,再生成关键帧
  • 为后续图像模型和 ComfyUI 提供稳定输入
  • 给角色一致性、旁白、音乐点位等附加控制留出结构化接口

角色职责

根据原文,Hermes Agent 至少承担 6 类明确职责:

1. 剧本策划

它把一句话创意扩展成可拍摄的短剧结构,而不是只输出一个泛泛的剧情简介。

在示例中,它会把故事拆成 4 个分镜,每个分镜 5 秒,总时长 20 秒,对应完整的小型戏剧节奏。

2. 分镜拆解

它按 四宫格分镜结构 自动拆镜,给每个分镜分配时长、戏剧功能与画面内容。

原文示例的 4 段分别是:

  • 分镜 1:5 秒,开场钩子,程序员在咖啡店专注写码,建立情境
  • 分镜 2:5 秒,冲突触发,电脑蓝屏,表情从专注变崩溃
  • 分镜 3:5 秒,高潮发展,咖啡意外翻倒,矛盾爆发
  • 分镜 4:5 秒,收尾反转,老板现身关服务器,悬念收尾

这说明 Hermes Agent 不只是列镜头编号,而是会把时间、叙事功能和画面任务同时结构化。

3. 提示词转译

剧本完成后,它继续承担“导演助理”角色,把中文叙事需求转译成下游工作流能消费的提示词包,尤其是英文 Prompt。

原文明确说明英文 Prompt 是必需项,因为 ComfyUI 工作流需要英文输入。

4. 角色一致性维护

原文把“跨分镜的角色一致性”点为一个核心难点:如果四个分镜分别独立生成提示词,同一个“程序员”很容易每段长得都不一样。

Hermes Agent 在这里的职责,是在生成每个分镜提示词时复用统一角色描述,自动引用角色专属提示内容,尽可能保持:

  • 服装一致
  • 发型一致
  • 环境描述一致
  • 观感连续,不至于镜头跳脸

原文同时指出,这种方式不能保证像素级一致性,但能把连续性控制在“观感不跳跃”的水平。这也构成它的实际能力边界之一。

5. 调用 API 与串联工具

Hermes Agent 不只负责写提示词,还负责把生成任务真正交给下游系统执行。

在原文里,它通过 ComfyUI 的 REST API 提交任务,串接工作流 JSON、上传图片和音频文件,推动渲染链运行。

6. 自动质检

在整条链路的最后一段,原文把“后期质检”也列为 Agent 能力,说明它不是只负责前期创作,还会在成片输出后承担自动检查角色。

虽然原文没有展开具体评分规则,但明确给出了“Agent 自动检查”这一职责归属。

分镜阶段的结构化产出

原文给出,Hermes Agent 会为每个分镜生成一整套结构化内容,至少包括以下 5 项:

  • 画面描述
  • 动作线
  • TTS 旁白文本
  • BGM 情绪点位标注
  • 英文 Prompt

这 5 项不是装饰性信息,而是后续流水线真正要消费的生产资料。

画面描述

用于定义镜头内容、景别、视角、环境与光线。原文示例里会写到“中景、暖色调、侧后方视角、咖啡店环境安静舒适、程序员专注敲代码、屏幕发出柔和光、咖啡冒着热气”等细节。

动作线

用于描述画面里的持续动作和镜头运动。示例包括:

  • 手指持续快速敲击键盘
  • 镜头从左向右缓慢横移
  • 阳光缓慢移动投影
  • 咖啡轻微蒸汽上升

这说明 Hermes Agent 产出的不是静态图关键词,而是带有时间展开感的动作设计。

TTS 旁白文本

它会同步为分镜生成旁白文案,供后续 TTS 或音轨制作使用。示例中某段旁白是:

一切看起来都很平静,直到这一刻还没有任何预兆。

BGM 情绪点位

它不仅给出“要什么音乐”,还会把音乐情绪和时段绑定。示例中有:

0s - 5s:轻松 lofi + 咖啡店环境音 + 低频暖音垫