CONCEPT
生成与评估分离模式
基本定义
生成与评估分离模式是面向AI复杂任务落地的协作设计思路,核心借鉴**生成对抗网络(GAN)**的生成器、判别器博弈逻辑,将「任务执行生成」与「成果质量评估」的职责完全拆分给不同的独立智能体,从架构层面避免单代理模式下普遍存在的智能体自我宽容、自我评估失效、输出平庸化等问题,是当前Harness架构的核心设计基础,也是AI自主开发软件开发范式的核心支撑机制之一。
核心起源
该模式由Anthropic团队在探索长时AI开发系统的过程中提出,团队并没有直接设计全场景通用架构,而是选择了AI能力短板最突出、自我评估失效问题最明显的前端设计场景作为切入点,先验证模式可行性再逐步扩展适用范围。
前端设计场景落地验证
解决的核心痛点
无干预的Claude大模型系列生成前端设计时,普遍存在模板化、套路化问题,仅能输出安全平庸的界面,缺乏视觉美感与原创性,核心原因就是单代理模式下模型无法客观评判自身设计的审美质量,陷入「自我满意」的低质量循环。
落地机制
- 首先制定可量化的前端设计四大评分标准,权重分配为:设计质量35%、原创性35%、工艺15%、功能性15%,每个维度都有明确的评判细则,解决审美无法量化的问题。
- 基于Claude Agent SDK搭建完整的反馈闭环流程:
- Generator智能体基于用户提示生成HTML/CSS/JS前端代码
- Evaluator智能体通过Playwright MCP工具与真实运行的页面交互,完成浏览、点击测试、截图留存等操作,按四大标准输出详细评分与修改意见
- 评估反馈回流至Generator,作为下一轮迭代的优化输入
- 单轮前端开发通常迭代5~15次,最长耗时可达4小时,每轮迭代的真实交互评估环节不可省略。
落地效果
该模式不仅能稳定提升前端设计的基础质量,还可推动AI突破平庸陷阱实现「创意跃迁」:在荷兰艺术博物馆网站开发实验中,前9轮迭代输出的是符合预期的深色主题落地页,第10轮迭代中模型完全推翻原有方案,重构出带CSS透视效果的3D空间化交互方案,画作以自由布局挂在虚拟房间墙面,通过门洞实现导航,完全超出常规生成的效果上限。
全栈开发场景迁移应用
在前端设计场景验证可行性后,团队将生成与评估分离模式迁移至更复杂的全栈AI开发场景,结合动态适配模型能力AI工程思维,扩展形成Harness架构的三代理协作体系:
- 新增Planner智能体负责需求拆解:仅需接收用户1~4句简单需求提示,即可扩展为完整的产品规格,包含功能清单、迭代规划、AI能力融入方案等内容,避免长时开发偏航
- Generator智能体按迭代拆分机制以迭代为单位完成全栈代码开发,默认技术栈为React、Vite、FastAPI、SQLite(复杂场景替换为PostgreSQL)
- Evaluator智能体负责全链路质量评估,覆盖功能可用性、BUG检测、需求匹配度等多个维度,评估结果回流形成闭环 该架构解决了长时AI开发中的偏航、BUG频发、自我评估失效等核心问题,可支撑数字音频工作站、2D游戏制作器等复杂全栈应用的自主开发。
适用边界
- 适用场景:适合有明确可量化评估标准的长周期复杂任务,包括前端设计、全栈开发、AI内容创作量化评估标准|AI内容创作、AI数据分析量化评估标准|AI数据分析等,配合量化评估与反馈闭环可实现最优效果
- 不适用场景:短平快的简单任务无需使用该模式,否则会增加不必要的协作成本;评估标准完全模糊的场景暂不适用,需先完成评估规则的量化拆解才能落地。