CONCEPT
Evaluator智能体
基本定义
Evaluator智能体是Harness架构的三大核心智能体角色之一,与Planner智能体、Generator智能体共同构成AI自主开发的完整协作链路,是生成与评估分离模式的核心落地单元,其设计灵感源自生成对抗网络的生成-评判对抗思路,旨在解决单代理模式下普遍存在的智能体自我宽容、自我评估失效问题,由Anthropic团队在Claude大模型系列的AI开发实践中迭代完善。
核心职责
Evaluator智能体定位为AI开发体系的「质检员」,承担两大核心职责:
- 客观评估Generator智能体的开发成果,全面排查代码BUG、功能缺失、逻辑漏洞、设计缺陷等问题;
- 基于标准化规则输出可落地的修改意见,为Generator的迭代优化提供明确方向。
核心运行机制
测试执行逻辑
Evaluator智能体统一基于Playwright MCP实现自动化测试,不同场景下的测试覆盖范围不同:
- 前端设计场景:直接与真实运行的前端页面交互,自动完成页面浏览、按钮点击、功能切换、截图核验等操作,覆盖视觉呈现、交互逻辑、可用性等维度;
- 全栈开发场景:模拟真实用户操作路径,覆盖UI交互、API端点调用、数据库读写、边缘场景(非法输入、异常操作)等多维度测试,确保应用的稳定性与可用性。
协作规则
- 迭代合约前置:每轮迭代启动前,Evaluator需与Generator提前协商迭代合约,明确本轮迭代的功能目标、测试标准、「完成」的定义,避免后续出现认知分歧;
- 最终评估权专属:Generator每轮迭代后的自我评估仅作参考,Evaluator拥有唯一的最终评估权,不受模型自我宽容特性影响;
- 反馈闭环回流:评估完成后,Evaluator输出的评分结果与修改意见将直接回流给Generator,作为下一轮迭代的输入,构成完整的AI开发反馈闭环。
通信机制
Evaluator与其他智能体的通信全部通过文件完成:读取Generator提交的代码、运行演示等产出物后,生成独立的评估报告文件交还Generator,所有交互记录自动留存,支持后续开发回溯。
标准化评分体系
Evaluator采用四大维度的标准化评分规则,所有维度均设置硬阈值,任意维度未达标则本轮迭代直接判定失败,Generator必须重新优化。不同场景下的评分规则权重与判定标准有所差异:
前端设计场景评分规则
| 评分维度 | 权重 | 判定标准 |
|---|---|---|
| 设计质量 | 35% | 考察界面配色、字体、布局、细节的整体统一性,是否符合产品定位的视觉氛围 |
| 原创性 | 35% | 惩罚模板化、套路化的AI痕迹设计,鼓励自定义创意选择 |
| 工艺 | 15% | 考察字阶层级、间距、色彩对比度等基础技术执行的扎实程度 |
| 功能性 | 15% | 考察界面可用性,用户是否可无需猜测完成核心操作 |
前端开发场景下通常需要经过5-15轮迭代,单轮完整迭代周期最长可达4小时,经过多轮迭代后可突破AI设计的平庸陷阱,甚至出现创意跃迁。
全栈开发场景评分规则
| 评分维度 | 判定标准 |
|---|---|
| 产品深度 | 考察功能完整性与实用性,是否符合Planner智能体输出的产品规格要求 |
| 功能性 | 考察应用运行稳定性,是否存在BUG、逻辑漏洞、功能缺失等问题 |
| 视觉设计 | 考察前端界面的美观度、交互一致性 |
| 代码质量 | 考察代码的可读性、规范性、安全性,是否存在冗余代码、逻辑漏洞等问题 |
边界与例外
- Evaluator仅负责质量评估与问题反馈,不直接参与代码生成与需求规划工作;
- 评分硬阈值规则不可突破,即使其他维度得分极高,只要有一个维度未达标仍判定迭代失败;
- 仅在Harness架构的多代理协作模式下生效,单代理模式无对应角色配置。