W
AI-Wiki
CONCEPT

Agent 驱动工作流

定义

Agent 驱动工作流,是指把“如何完成任务”的一部分决策权交给 AI 代理:用户主要提供目标或自然语言描述,代理负责理解需求、规划步骤、决定关键参数、选择调用哪些能力,再把结果组织成可交付产物。

它与“脚本驱动工作流”的核心区别不在于有没有代码,而在于参数和路径是不是预先写死。脚本驱动通常要求人先规定好多少行、多少列、每帧尺寸、输出格式、处理顺序;Agent 驱动则让代理根据任务描述动态判断这些内容。

在本文讨论的案例里,这个代理就是 OpenAI Codex,它不是只执行固定命令,而是会根据一句自然语言需求,自行判断应生成什么类型的 2D 游戏素材、需要几帧、采用什么布局、是否拆成方向性动画、是否需要把多个阶段打包输出。

在本文档中的语境

本文语境中的 Agent 驱动工作流,来自 agent-sprite-forge 这类面向游戏素材生产的实践:用户只说“我要什么”,而不是先把整套图像生成与后处理参数全部配置完。随后由 OpenAI Codex 先做任务规划,再调用图像生成能力与本地脚本,把结果交付为可直接进入 2D 游戏引擎的素材。

这里的重点不是“AI 会画图”这么简单,而是“AI 先决定怎么画、画成什么结构、后续如何整理”。因此它不是单次生图工具的别名,而是一种把任务理解、参数决策、工具调用、结果组装连成一体的工作方式。

这也是为什么本文把它放在与“参数写死的脚本流”相对的位置上:同样是自动化,前者由代理处理不确定决策,后者主要执行人类事先穷举好的规则。

关键机制或组成

1. 由 AI 代理负责任务规划

Agent 驱动的第一步不是直接跑脚本,而是先规划。以 agent-sprite-forge 为例,OpenAI Codex 会先分析用户描述,决定这是角色动画、道具效果,还是地图场景;如果是角色动画,还要进一步判断适合多少帧、采用何种排布、是否需要多段效果。

原文把这个过程概括为四步中的第一步:规划、生成、后处理、组装。其中“规划”明确由 Codex 完成,决定素材类型、帧数和布局策略。

2. 根据描述自动决定参数

Agent 驱动并不要求用户先输入完整参数表。用户可以只给一句目标,例如生成一个火法师施法动画,代理再根据描述自动推断:

  • 需要几帧才能表现动作连续性;
  • 精灵图应采用什么网格布局;
  • 是否需要上下左右四向行走或方向拆分;
  • 是否应该使用“捆绑包”模式,把施法、弹道、命中三段动画一起生成;
  • 如果是地图场景,应使用单张烘焙图还是混合分层图。

这类参数不是简单默认值,而是与任务语义绑定的动态决策。也正因为如此,用户输入的是需求,代理输出的是执行方案加结果。

3. 代理做决策,代码做确定性后处理

本文中的 Agent 驱动工作流 并不是“全部都交给 AI 随机发挥”。相反,它有清楚的分工:AI 负责不确定、需要理解语义的部分;代码负责确定、可重复的像素级处理。

agent-sprite-forge 中,这种分工表现为:

  • OpenAI Codex 负责理解需求、规划素材结构,并调用内置图片生成能力产出原始图;
  • 本地 Python 脚本负责执行确定性后处理,例如去除洋红色背景(#FF00FF 色键抠图)、按网格切分帧、提取精确边界框、对齐、缩放、导出透明 PNG、合成 GIF 预览;
  • 当任务是地图时,还会在最后把图层、透明道具、碰撞区域和触发区域等元数据整合成可用场景。

这种模式与 确定性后处理 紧密相关:Agent 驱动不等于取消规则,而是把规则放在后处理层,让创造性决策与标准化清理分别落在最适合的环节里。

4. 可在技能之间组织协作

Agent 驱动工作流通常不只是一条单命令管线,还能根据任务需要组织多个能力协作。文中的例子是地图生成:当地图采用混合分层策略且需要透明道具时,系统会自动调用角色/道具生成能力去生成这些元素。

这说明代理不只是“给某个脚本填参数”,而是在更高层做任务拆解与能力编排。

与脚本驱动工作流的区别

脚本驱动的特点

脚本驱动工作流通常要求事先确定流程和参数。人要先写好固定模板,例如输出几列几行、单帧尺寸、命名规则、导出格式、是否切片、是否抠图,然后程序照单执行。它的优点是稳定、可控,但前提是任务边界比较固定。

Agent 驱动的特点

Agent 驱动工作流 更适合处理输入目标清楚、但中间参数不容易预先写死的任务。用户给的是结果意图,代理负责把意图翻译成执行方案。像帧数、布局、分层策略、是否拆方向、是否把多个动画阶段打包,都是在执行时按描述动态决定的。

本文中的直接对比

原文明确指出,传统工具是“你写死一套参数:多少行、多少列、每帧多大、输出什么格式”;而 agent-sprite-forge 则让 OpenAI Codex 自己判断“最适合生成什么布局的精灵图、需要几帧、要不要做方向性拆分、捆绑包里包含哪些阶段”。这正是本文定义 Agent 驱动工作流 的核心依据。

在游戏素材生产中的表现

在 2D 游戏素材场景里,Agent 驱动工作流 之所以成立,是因为素材生产不是只靠一次生图就结束,真正麻烦的是后面一系列面向“游戏就绪”的处理。

以角色和动画为例,用户目标可能只是“生成一个火法师的施法动画,带弹道和爆炸效果”,但要交付成可用资产,还涉及动画帧规划、网格布局、透明背景处理、逐帧切分、边界框提取、对齐缩放、PNG 序列导出和 GIF 预览合成等步骤。

以地图场景为例,代理还要判断场景复杂度:

  • 简单场景可以使用单张烘焙图,直接生成一张完整地图;
  • 复杂场景则更适合混合分层图,把地面作为基础图层,把门、灯笼等物体拆成独立透明道具,并补充碰撞区域与触发区域元数据,以支持碰撞检测、Y 轴排序和交互。

也就是说,Agent 驱动工作流 不是单点生成,而是以“可直接使用的结果”为目标,自动决定中间结构。

为什么适合嵌入更大自动化链路

本文特别强调 Agent 驱动工作流 的一个价值:它不是给人手工点按钮的图形界面工具,而是给 AI 使用的“技能”。这意味着它天然适合被放进更长的自动化链条里。

原文给出的方向是:可以让 AI 先写剧情,再根据剧情自动生成角色和场景。这里的关键并不是“能串联多个步骤”本身,而是因为每一步都不必由人重新填写大量固定参数,代理可以接着上一步的语义结果继续做规划。