四宫格分镜结构
定义
四宫格分镜结构是文中用于 AI 短剧自动生成的一种固定拆镜模板。它的作用不是讨论一般性的叙事学,也不是宽泛的“讲故事方法”,而是把“一句话创意”快速转成后续工作流可消费的结构化中间表示,供 Hermes Agent 继续生成提示词、关键帧和视频任务。
在这套方法里,一个短剧会被固定拆成 4 个分镜,每个分镜约 5 秒,总时长约 20 秒。这个时长配置是文中明确给出的基础版本,不是自由浮动的长片写法。
在本文档中的语境
该结构出现在《我用 Hermes Agent + ComfyUI 搭了一条「AI 拍短剧」流水线(基础版) 摘要》所描述的流水线前段,位于“一句话创意”与“分镜提示词”“关键帧生成”之间,是剧本策划阶段的核心组织方式。
整条链路在文中被描述为:一句话创意 → 剧本策划 → 分镜提示词 → 关键帧生成 → 视频合成 → 后期质检 → 输出 MP4。
其中,四宫格分镜结构承担的是从创意到分镜脚本的第一次标准化拆解。没有这一步,后面的图像生成、视频合成和质检都缺少稳定输入;有了这一步,Agent 才能按镜头逐段展开。
固定时间配置
文中的基础配置非常具体:
- 4 个分镜
- 每个分镜约 5 秒
- 总时长约 20 秒
这意味着它不是面向长视频的复杂分场结构,而是面向短视频生产的压缩模板。作者举的示例里,四段时长相加就是 20 秒,便于快速生成、快速迭代,也便于后续用 4 张关键帧去驱动视频工作流。
四个分镜的典型戏剧职责
文中给出的四格职责是固定且功能导向的,通常对应:
- 开场钩子
- 冲突触发
- 高潮发展
- 收尾反转
这四段不是平均切开就结束,而是各自承担不同戏剧任务:
- 第 1 镜负责开场钩子,快速建立场景、角色和情境,让观众立刻知道“现在发生了什么”。
- 第 2 镜负责冲突触发,把平静状态打破,明确出现问题或异常。
- 第 3 镜负责高潮发展,让矛盾进一步升级或爆发,形成最强情绪点。
- 第 4 镜负责收尾反转,用揭示、悬念或反差完成结尾。
文中示例是一句创意:程序员在咖啡店写代码时电脑突然蓝屏,咖啡洒了,最后发现是老板关的服务器。对应拆法为:
- 分镜 1:程序员在咖啡店专注写码,建立情境。
- 分镜 2:电脑蓝屏,表情从专注转为崩溃。
- 分镜 3:咖啡意外翻倒,矛盾爆发。
- 分镜 4:老板现身关服务器,形成反转收尾。
这个例子说明,四宫格分镜结构强调的是“可生成、可执行”的镜头职责划分,而不是抽象地写成起承转合四个大词就结束。
Agent 在每个分镜上继续生成什么
四宫格不是最终产物,而是后续自动化生成的骨架。文中明确说,Agent 会为每一段分镜继续生成一整套可执行信息,包括:
- 画面描述 + 动作线
- TTS 旁白文本
- BGM 情绪点位标注
- 英文 Prompt
这里的英文提示词有明确用途:后续视频与图像工作流需要英文输入,因此 Agent 要把中文创意与中文分镜进一步转译成模型更容易消费的英文描述。
以文中的单镜示例来看,一个分镜提示词包不只是几句 prompt,而会进一步包含:
- 分镜标题
- 英文画面提示词
- 中文画面描述
- 角色参照信息
- 色彩基调
- 动作线条目
- 对应的 TTS 旁白
- 对应时间段的 BGM 情绪设计
例如第 1 镜会把“咖啡店里专注写代码的程序员”扩展成中景、暖色调、侧后方视角、阳光、蒸汽、镜头横移、键盘动作等细节。可见四宫格并不是粗略剧情摘要,而是 Agent 展开后续镜头语言的上游结构。
作为中间表示的价值
四宫格分镜结构的核心价值,在于把一句话创意转成图像生成与视频工作流都能继续加工的中间表示。
一句话创意本身太模糊,不能直接稳定驱动后面的多个环节;而完整视频工作流又需要分镜级输入。四宫格正好把两者连接起来:
- 对上,它能承接自然语言创意。
- 对下,它能喂给提示词生成、关键帧生成、视频合成、旁白与音乐设计。
换句话说,它是“创意层”和“执行层”之间的桥。文中所谓“从一句话创意到完整视频,全自动走完”,靠的不是单次 prompt 直接吐视频,而是先经过这种结构化拆镜。
与关键帧顺序的一一对应
文中还明确给出了 4 张关键帧的生成顺序,这个顺序与 四宫格分镜结构 是相互对应的:
- 首帧:建立场景
- 发展帧:冲突出现
- 高潮帧:矛盾爆发
- 结尾帧:反转或悬念
它们实际上就是四个分镜在图像层的对应物:
- 第 1 镜对应首帧
- 第 2 镜对应发展帧
- 第 3 镜对应高潮帧
- 第 4 镜对应结尾帧
因此,四宫格不是停留在文本层的“脚本概念”,而是直接决定后面要生成哪 4 张关键图,以及这些图在视频节奏中的先后关系。
文中说明,在进入 ComfyUI 之前,需要先生成这 4 张关键帧;Agent 会把每个分镜的提示词喂给图像模型,生成对应关键帧,再送入后续视频合成流程。
关键机制:为什么它适合 Agent 工作流
这套结构适合 Agent 的原因,在于它把复杂任务切成了稳定的、重复的、可模板化的四段。
对 Hermes Agent 来说,这意味着它可以围绕每个分镜做同样的事情:
- 读取同一角色设定
- 生成同类字段的提示词包
- 规划每段旁白与音乐
- 按镜头顺序输出关键帧描述
- 为后续图像与视频 API 调用准备输入
这种结构化输出比直接生成一整段自由散文式脚本更适合自动执行,因为后续系统需要的是镜头级参数,而不是只供人阅读的文学文本。