W
AI-Wiki
CONCEPT

角色资产库

定义

角色资产库是短剧生成流水线中的角色连续性管理方案,直接目标是解决多分镜分别生成提示词时,同一角色外观容易漂移的问题。

在文中的 Agent + ComfyUI 短剧生成流水线 里,Hermes Agent 会先把一句话创意拆成 四宫格分镜结构,再为每个分镜单独生成英文 Prompt、画面描述、动作线、TTS 旁白和 BGM 情绪点位。问题在于:如果这四段提示词完全独立生成,那么同一个“程序员”在不同镜头里很可能长得不一样。

文中明确把这件事视为“跨分镜的角色一致性”难点。

在本文档中的语境

这套方法出现在作者介绍 AI 短剧基础流水线时,位于“分镜提示词——Agent 当导演”之后,属于对角色连续性问题的补充说明。

作者的整体链路是:一句话创意 → 剧本策划 → 分镜提示词 → 关键帧生成 → ComfyUI 视频合成 → 后期质检。

其中 Agent 负责拆解创意、生成提示词、维护角色一致性、调用 API 和检查输出质量;真正负责生成画面的,是 ComfyUI 与视频模型。

角色资产库 就是 Agent 维护角色一致性的一个基础抓手:它不是端到端的视频一致性算法,而是通过统一资产和统一描述,减少每个分镜各写各的导致的人物漂移

典型目录结构

文中给出了一个非常具体的目录组织方式,并建议把每个角色放在 Git 仓库中管理:

characters/程序员小王/ 
├── character_bible.md
├── ref_photos/
│ ├── front.jpg
│ ├── side.jpg
│ └── angry.jpg
├── voice_samples/
│ └── neutral.wav
└── prompts/
 └── main.txt

这些文件在文中的含义分别很明确:

  • character_bible.md:角色档案。
  • ref_photos/:角色参考照片,文中举例包含正脸、侧脸、全身、表情等参考。示例文件有 front.jpgside.jpgangry.jpg
  • voice_samples/:角色音频样本,用于保留角色声音或情绪表达的参考,示例文件是 neutral.wav
  • prompts/main.txt:角色专属提示词主文件,用来沉淀该角色的统一描述。

关键机制

核心机制只有一句话:Agent 在生成每个分镜提示词时,会自动引用 prompts/main.txt 中的角色描述。

这意味着无论当前是在生成开场镜头、冲突镜头、高潮镜头还是反转收尾镜头,角色的基础描述来源都不是临时现编,而是指向同一份角色提示词主文件。

在文中四段各 5 秒、总计 20 秒的 四宫格分镜结构 里,这种统一引用尤其重要,因为每个分镜都要单独产出一整套提示词包。如果没有共享角色描述,分镜之间极易出现:

  • 同一角色脸型变化;
  • 发型前后不一致;
  • 服装颜色或款式跳变;
  • 场景里的角色气质和身份感失真。

通过把角色描述收束到 prompts/main.txt,Agent 至少能保证每次写 Prompt 时都从同一份角色设定出发。

能解决什么

角色资产库 解决的不是“让模型绝对生成同一张脸”,而是“让角色在多镜头里尽量像同一个人”。

文中给出的效果边界很具体:

  • 不能保证像素级一致性
  • 但能在服装、发型、环境描述等层面提高一致性。
  • 结果是整体观感“不容易跳跃”,观众更容易把多个分镜识别为同一角色的连续表演。

这里的“环境描述”也很关键,因为短剧分镜并不只涉及人物本身,还涉及镜头气氛和场景语义。如果角色描述每次都带着统一的服装、发型与所处情境特征,镜头切换时违和感会明显降低。

为什么建议放进 Git 仓库

文中建议将角色资产放在 Git 仓库中做规范化管理。这个建议并不是为了形式上的“上版本控制”,而是为了让角色描述真正成为可复用、可维护、可追踪的资产。

放进 Git 后,至少有几个直接好处:

  • 角色档案、参考图、音频样本、专属提示词能集中存放,不会散落在不同位置。
  • 修改角色设定时可以持续迭代同一份 character_bible.mdprompts/main.txt,避免同名角色出现多个版本。
  • Hermes Agent 在不同项目阶段反复生成分镜时,可以始终引用同一套标准资产。
  • 后续如果要扩展到更多角色、多 Agent 协作或更复杂的自动化流程,资产目录天然适合作为输入源。

换句话说,角色资产库 在本文里的意义不仅是“存文件”,更是把角色从一次性提示词,升级为流水线可复用的结构化资产。

细节与边界

1. 它属于基础版连续性保障

作者明确表示,这只是当前基础流水线中的连续性方案。它主要依赖统一提示词和参考资产,而不是更强的模型级一致性控制。

因此它更像一种“先把规范立起来”的办法,而不是最终形态。

2. 它依赖提示词控制,不是端到端锁定角色

文中已经点明:即使四个分镜都引用同一份 prompts/main.txt,视频模型仍然不能保证像素级一致性

也就是说,这个方案能提升连续性,但不能承诺以下结果:

  • 每一帧都生成完全一致的五官;
  • 每个镜头都保持同一姿态或同一精确服装纹理;
  • 在所有镜头间达到影视级角色锁定。

3. 更强方案仍是后续优化方向

在文章“下一步”部分,作者把端到端角色一致性列为后续要继续打通的方向,并明确提出要“用更稳定的角色一致性保持方案替代纯提示词控制”。

这说明 角色资产库 在作者的方法论里是一个过渡层:

  • 现在先用它解决“每段都长得不一样”的基础问题;
  • 以后再升级到更稳定、更自动化的一致性方案。

与流水线其他环节的关系

角色资产库 主要服务于“分镜提示词生成”阶段,但它的影响会传递到后续多个环节:

  • 在分镜阶段,它决定 Agent 写出的角色描述是否统一。
  • 在关键帧生成阶段,统一描述会影响 4 张关键帧的角色观感是否连贯。
  • ComfyUI 视频合成阶段,前序关键帧和提示词越统一,最终视频越不容易出现明显跳变。

因此,它虽然看起来只是一个目录结构,实际上是连接 Hermes Agent、关键帧生成与视频合成质量的重要中间层。

相关条目