W
AI-Wiki
CONCEPT

Evaluator智能体

基本定义

Evaluator智能体是Harness架构的三大核心智能体角色之一,与Planner智能体Generator智能体共同构成AI自主开发的完整协作链路,是生成与评估分离模式的核心落地单元,其设计灵感源自生成对抗网络的生成-评判对抗思路,旨在解决单代理模式下普遍存在的智能体自我宽容、自我评估失效问题,由Anthropic团队在Claude大模型系列的AI开发实践中迭代完善。

核心职责

Evaluator智能体定位为AI开发体系的「质检员」,承担两大核心职责:

  1. 客观评估Generator智能体的开发成果,全面排查代码BUG、功能缺失、逻辑漏洞、设计缺陷等问题;
  2. 基于标准化规则输出可落地的修改意见,为Generator的迭代优化提供明确方向。

核心运行机制

测试执行逻辑

Evaluator智能体统一基于Playwright MCP实现自动化测试,不同场景下的测试覆盖范围不同:

  • 前端设计场景:直接与真实运行的前端页面交互,自动完成页面浏览、按钮点击、功能切换、截图核验等操作,覆盖视觉呈现、交互逻辑、可用性等维度;
  • 全栈开发场景:模拟真实用户操作路径,覆盖UI交互、API端点调用、数据库读写、边缘场景(非法输入、异常操作)等多维度测试,确保应用的稳定性与可用性。

协作规则

  1. 迭代合约前置:每轮迭代启动前,Evaluator需与Generator提前协商迭代合约,明确本轮迭代的功能目标、测试标准、「完成」的定义,避免后续出现认知分歧;
  2. 最终评估权专属:Generator每轮迭代后的自我评估仅作参考,Evaluator拥有唯一的最终评估权,不受模型自我宽容特性影响;
  3. 反馈闭环回流:评估完成后,Evaluator输出的评分结果与修改意见将直接回流给Generator,作为下一轮迭代的输入,构成完整的AI开发反馈闭环

通信机制

Evaluator与其他智能体的通信全部通过文件完成:读取Generator提交的代码、运行演示等产出物后,生成独立的评估报告文件交还Generator,所有交互记录自动留存,支持后续开发回溯。

标准化评分体系

Evaluator采用四大维度的标准化评分规则,所有维度均设置硬阈值,任意维度未达标则本轮迭代直接判定失败,Generator必须重新优化。不同场景下的评分规则权重与判定标准有所差异:

前端设计场景评分规则

评分维度权重判定标准
设计质量35%考察界面配色、字体、布局、细节的整体统一性,是否符合产品定位的视觉氛围
原创性35%惩罚模板化、套路化的AI痕迹设计,鼓励自定义创意选择
工艺15%考察字阶层级、间距、色彩对比度等基础技术执行的扎实程度
功能性15%考察界面可用性,用户是否可无需猜测完成核心操作

前端开发场景下通常需要经过5-15轮迭代,单轮完整迭代周期最长可达4小时,经过多轮迭代后可突破AI设计的平庸陷阱,甚至出现创意跃迁。

全栈开发场景评分规则

评分维度判定标准
产品深度考察功能完整性与实用性,是否符合Planner智能体输出的产品规格要求
功能性考察应用运行稳定性,是否存在BUG、逻辑漏洞、功能缺失等问题
视觉设计考察前端界面的美观度、交互一致性
代码质量考察代码的可读性、规范性、安全性,是否存在冗余代码、逻辑漏洞等问题

边界与例外

  1. Evaluator仅负责质量评估与问题反馈,不直接参与代码生成与需求规划工作;
  2. 评分硬阈值规则不可突破,即使其他维度得分极高,只要有一个维度未达标仍判定迭代失败;
  3. 仅在Harness架构多代理协作模式下生效,单代理模式无对应角色配置。

相关条目