自检驱动的AI工作流
定义
自检驱动的AI工作流,是指把输出审核要求、格式约束、结构标准和完成条件,预先写成 AI 可读取、可逐项执行的清单,并嵌入某个可组合能力单元设计|能力单元或规范文件中,使 AI 在生成后自动执行“检查→修正→再输出”的闭环,而不是每一步都等待人工审核。
它关注的核心不是“让 AI 先生成,人工再返工式纠错”,而是把原本由人反复扮演的审稿者角色,尽量前置为规则、清单和自检步骤。这样可以显著减少人工反复返工,人工只保留最终“放行/不放行”的决策权。
在本文档中的语境
本文语境中的自检驱动的AI工作流,来自一套以 Anthropic Skills、渐进式披露式能力组织 与 Harness Engineering 为代表的工作流设计思路:
- 不再把“每次都重写一遍完美提示词”视为稳定方案;
- 不再把“每个环节都人工审核”视为默认流程;
- 而是把工作流固化为可复用的能力单元,再把审核要求内嵌为自动自检机制。
在这个语境下,自检不是补充动作,而是能力单元的一部分。一个能力如果只有生成步骤、没有生成后的自动检查与修正,就仍然会退回“AI 输出一次,人来挑错一次”的低效模式。
核心机制
1. 把审核标准写成清单
自检驱动的第一步,不是提高人工审稿强度,而是把人工平时审查时使用的判断依据写成明确条目,交给 AI 在输出后逐项核对。
原文给出的典型做法,是在能力规范中直接加入“自检清单”一节,例如:
- 标题是否在 30 字以内;
- 导语是否在 100 字以内;
- 是否包含 3-5 个小节;
- 每个小节是否有小标题;
- 结尾是否有行动建议。
这些条目不是给人参考的抽象建议,而是给 AI 执行的验收条件。也就是说,审核标准要从“人脑里的经验”转成“模型可读取的显式规范”。
2. 生成后自动检查与修正
自检驱动不是只让 AI 对照清单“看一眼”,而是要求它在初稿完成后自动执行检查,并在发现不符合项时直接修正。
原文中的关键要求非常明确:
- 生成完成后自动执行自检;
- 如果有任何一项不符合,自动修正后再输出;
- 不要询问用户,直接改。
这意味着自检环节不是人工触发的返工流程,而是生成流程的内置尾段。只有在 AI 已经完成检查并修正后,结果才算正式输出。
3. 减少人工反复返工
传统流程通常是:
- AI 生成内容;
- 人检查是否符合要求;
- 人指出哪里不合格;
- AI 修改;
- 重复第 2-4 步。
这种模式的问题不在于“人是否负责”,而在于人工成为每一轮迭代的必经节点,导致系统吞吐量被人工审查速度锁死。原文明确指出,随着模型能力提升,系统中最慢的环节反而会变成人类审查。
自检驱动的工作流就是针对这个瓶颈提出的:把大部分可规则化的检查交给 AI 自己完成,从而减少人工在过程中的多轮返工和反复沟通。
4. 人工只保留最终放行决策
自检驱动并不等于完全取消人工,而是重新定义人工所处的位置。
在原文的建议中,更合理的流程是:
- 把审核规则写成可读取的规范文件;
- AI 按规范自动生成、自检、自我修正;
- 人只在最终发布前做一次“发/不发”的决策。
因此,人工从“过程审核员”转为“最终决策节点”。这是一种职责收敛:
- 规则化、重复性的检查,交给 AI;
- 价值判断、风险承担和最终授权,保留给人。
这也使它与单纯的“人工兜底审查”不同:它不是要求人盯住每一步,而是让人只在真正需要承担责任的出口节点介入。
典型组织方式
自检驱动的机制通常不会孤立存在,而是嵌入到Skills驱动的AI工作流设计中,作为每个能力单元的组成部分。
一种典型结构是:
- 一级只暴露能力名称、简介和触发条件,用于判断是否加载;
- 二级正文写明完整流程、风格要求、工作步骤与自检清单;
- 三级再挂接模板、案例和参考文档,供按需查阅。
在这种结构里,自检清单通常位于能力正文中,而不是散落在聊天对话里。这样做有两个直接好处:
- 规则能被复用,而不是每次靠人临时补充;
- 自检能成为标准执行流程,而不是操作者心情好的时候才做。
与能力单元设计的关系
自检驱动的AI工作流与可组合能力单元设计高度相关。
如果一个能力单元需要在独立运行和组合运行两种情况下都保持稳定输出,那么它就不能把“质量保证”外包给外部人工。否则:
- 独立运行时质量不稳定;
- 与其他能力组合时,会把错误和格式问题传递到下游;
- 上游每次变动都会引发新的人工返工链条。
因此,一个成熟的能力单元不仅要定义输入、输出和触发条件,还要定义完成后的自检逻辑。自检相当于能力单元的内建验收层。
细节与边界
适合前置为自检的内容
更适合写成自检清单的,通常是可以明确判断、可稳定执行的要求,例如:
- 字数、长度、格式等硬约束;
- 是否包含若干固定结构;
- 是否补齐必要段落或标题;
- 是否输出指定类型的结尾、摘要或建议;
- 是否满足某些固定风格模板。
这类规则一旦写清楚,就可以替代大量重复人工检查。
不应误解为“完全不需要人工”
原文强调的是“移除每个环节都要 human-in-the-loop 的流程摩擦”,不是主张所有任务都永远不需要人工判断。
对高风险、高责任、需要最终授权的任务,人工仍然应该保留最终放行权。自检驱动削减的是过程中的重复性审查,而不是组织责任。
不等于让 AI 自由发挥后再自圆其说
自检驱动成立的前提,是审核标准被明确写成规范。如果没有清单,所谓“自检”就容易退化为模型自行声称“已检查完成”,但实际上没有可验证的标准。
所以它依赖的不是一句“请你检查一下”,而是把检查条件结构化、显式化,并嵌入能力文件。
不适合只靠临时对话维持
如果审核要求仍然散落在多轮对话中,模型每次都要重新理解,人也要反复补充,那么它仍属于提示词驱动的人盯人流程,而不是稳定的自检驱动工作流。