W
AI-Wiki
SOURCE

Anthropic 2026 Harness架构研究成果 摘要

文档概览

本研究针对朴素AI编程在长时复杂开发场景下的两大核心死穴:上下文焦虑导致的连贯性崩塌、智能体自我宽容导致的自我评估失效,参考生成对抗网络的设计逻辑,先在前端设计场景验证「生成与评估分离」思路的可行性,再迁移到全栈开发场景形成完整的Planner/Generator/Evaluator三代理架构,最终实现Claude大模型系列自主完成数小时复杂应用开发的能力。研究同时提出动态适配模型能力AI工程思维,随Claude Opus 4.6的能力升级完成架构迭代简化,为整个Agentic Coding领域提供了可复用、可迭代的工程化落地框架。

关键事实

  1. 发布信息:2026年3月由Anthropic团队正式发布相关研究成果。
  2. 设计思路:参考生成对抗网络设计逻辑,核心采用生成与评估分离模式、上下文优化、多代理协作等设计。
  3. 核心能力:可支持Claude大模型系列自主完成最长6小时的复杂应用开发,覆盖前端设计、全栈开发等场景。
  4. 核心架构:包含上下文重置机制、Planner/Generator/Evaluator三代理架构两大核心设计。
  5. 落地路径:先在前端设计场景验证核心思路可行性,再迁移到全栈开发场景完成架构升级。
  6. 效果验证:解决了长时自主开发中的需求偏航、BUG频发、自我评估失效三大核心问题;前端场景下经过5-15次迭代可产出高质量设计成果;全栈场景下输出的应用核心功能完整可落地,远优于单代理模式的开发效果。

重要细节

朴素AI编程的核心痛点

  • 上下文焦虑与连贯性崩塌:大模型上下文窗口有限,长时开发中信息填充到上限时会出现草率收尾、需求遗忘、逻辑断裂等问题,早期的上下文压缩方案会丢失细节无法彻底解决;上下文重置机制通过清空上下文、传递结构化工件的方式彻底解决该问题,但会带来编排复杂度上升、token成本增加、开发延迟提升的副作用。
  • 自我评估失效:模型存在智能体自我宽容特性,会对自身产出过度乐观,忽略明显BUG、设计平庸等问题,前端主观设计场景下评估偏差尤为明显,导致开发成果看似完整实则无法使用。

前端设计场景验证方案

  • 制定前端设计四大评分标准:设计质量(35%)、原创性(35%)、工艺(15%)、功能性(15%),将主观审美转化为可量化指标,刻意提升设计质量与原创性权重,推动模型摆脱模板化设计陷阱。
  • 工作流程:Generator智能体生成前端代码→Evaluator智能体通过Playwright MCP与真实运行页面交互,按标准给出评分和修改意见→反馈回流给Generator迭代优化,单项目通常迭代5-15次,最长耗时4小时。
  • 实验效果:可实现创意跃迁,如荷兰艺术博物馆网站案例中,第10轮迭代模型推翻原有2D方案,生成带CSS透视效果的3D空间化交互界面,远超单次生成的质量上限。

全栈开发三代理架构设计

三个智能体形成完整AI开发反馈闭环

  1. Planner智能体:仅需接收1-4句用户简单需求,即可扩展为完整产品规格,包含功能清单、迭代规划、AI功能融入方案,刻意保持高层抽象避免早期技术判断失误,会主动寻找将Claude能力融入产品的机会。
  2. Generator智能体:按迭代为单位完成代码开发,默认技术栈为React、Vite、FastAPI、SQLite/PostgreSQL,支持Git版本管理,每轮迭代完成后先做初步自检再提交评估,可根据反馈调整开发方向甚至推翻原有方案。
  3. Evaluator智能体:作为AI开发质检员,通过Playwright MCP进行全场景真实测试,按产品深度、功能性、视觉设计、代码质量四大标准评估,任意标准未达硬阈值则判定迭代失败;每轮迭代前与Generator签订迭代合约,明确开发目标、测试标准和完成定义,避免认知分歧;代理间通过文件方式完成信息传递,保留完整开发日志。

架构效果对比实验(Claude Opus 4.5环境)

对比维度单代理模式Harness架构
开发需求2D复古游戏制作器2D复古游戏制作器
耗时20分钟6小时
Token成本9美元200美元
开发质量核心功能失效,实体无法交互,界面布局不合理,无引导流程核心功能完整可运行,界面设计统一,内置Claude AI辅助创作功能,仅存在边缘场景细节问题

架构迭代优化(适配Claude Opus 4.6)

遵循动态适配模型能力AI工程思维,随模型能力升级简化架构:

  • 核心优化:移除迭代拆分机制,将Evaluator从「每轮迭代评分」调整为「整轮开发后总评」,仅保留Planner、Evaluator两个核心组件,在不损失开发质量的前提下降低时间与token成本。
  • 效果验证:数字音频工作站开发案例中,耗时3小时50分钟,token成本124.7美元,最终生成的应用具备编曲、混音、AI辅助作曲等核心功能,可在浏览器端正常运行。
  • 迭代原则:架构组件需随模型能力变化持续压力测试,仅保留解决当前模型能力短板的必要组件,避免冗余复杂度。

行业价值

  • 重新定义AI自主开发软件开发范式,为多代理复杂任务落地提供可复用的量化评估与反馈闭环思路,可迁移到内容创作、数据分析、设计策划等多个AI应用场景。
  • 未来方向为人机协作,AI承担重复性基础开发工作,人类聚焦需求规划、创意设计、质量把控等核心环节,大幅降低软件开发门槛,提升创意落地效率。

相关条目

AnthropicClaude大模型系列Claude Opus 4.6Harness架构Planner智能体Generator智能体Evaluator智能体生成对抗网络生成与评估分离模式上下文重置上下文焦虑智能体自我宽容Agentic CodingAI开发反馈闭环量化评估与反馈闭环迭代合约前端设计四大评分标准Playwright MCP动态适配模型能力AI工程思维AI自主开发软件开发范式数字音频工作站多代理协作模式单代理模式