W
AI-Wiki
CONCEPT

朴素AI编程

基本定义

朴素AI编程是**Agentic Coding(智能体编程)**发展早期的主流实践方案,是Harness架构落地前业内通用的AI自主开发实现范式,核心特征为依靠单个大语言模型独立完成从需求理解、代码生成到迭代优化的全流程开发工作,无多智能体分工协作机制。

常见实现方式

朴素AI编程的落地模式已形成行业通用的三类标准实现逻辑:

  1. 需求拆分任务列表:开发者预先将整体开发需求拆解为粒度较小的串行子任务列表,引导大模型按顺序逐个完成子任务,降低单次任务的理解和执行复杂度。
  2. 上下文压缩:对开发过程中产生的对话历史、代码片段、调试记录、需求文档等信息做摘要精简,剔除冗余内容,缓解大模型上下文窗口不足的问题。
  3. 脚本/钩子触发迭代循环:通过预设的自动化脚本、钩子函数触发大模型自动进入下一轮迭代,无需人工介入即可完成简单的循环开发流程。

核心缺陷

朴素AI编程仅适用于小型脚本、单一功能开发等短周期低复杂度场景,在长时高复杂度开发任务中会普遍失效,核心死穴分为两类:

上下文焦虑与连贯性崩塌

大模型的上下文窗口存在物理上限,长时开发过程中不断累积的信息会逐步挤占窗口空间,导致模型对整体任务的把控能力持续下降,出现逻辑断裂、需求遗忘、功能重复开发等问题。当模型感知到上下文即将达到上限时,还会出现上下文焦虑现象,草率收尾跳过核心功能:例如Anthropic团队测试Claude Sonnet 4.5开发复古游戏制作器时,模型在上下文即将满额时直接跳过「游戏实体交互」核心功能,仅完成界面布局导致项目无法使用。 即使采用上下文压缩方案也仅能缓解问题,压缩后的信息会丢失代码注释、特殊需求等大量细节,无法从根本上解决连贯性崩塌的问题。

自我评估失效

该模式下生成与评估职责由同一智能体承担,模型天然存在智能体自我宽容特性,会对自身产出产生偏向性,无法以第三方视角客观评判成果质量:

  • 主观场景(如前端设计)中,模型生成的模板化平庸产出往往会被自评「设计美观、原创性强」,完全不符合前端设计四大评分标准要求;
  • 客观场景(如后端开发)中,即使代码存在参数校验缺失等明显BUG,模型也会自评「功能完整、无逻辑漏洞」。 长时开发过程中这种自我评估偏差会被不断放大,模型会逐步强化错误逻辑,最终导致项目完全偏离原始需求。

适用边界与演进替代

朴素AI编程的能力上限为开发周期不超过30分钟、代码量低于1000行的简单项目,面对全栈应用开发、长时间自主开发等高复杂度任务时完全无法落地。针对其两大核心死穴,Anthropic团队参考生成对抗网络的设计思路,推出了以生成与评估分离模式为核心的Harness架构,通过Planner智能体Generator智能体Evaluator智能体多代理协作的方式,彻底解决了长时复杂开发场景下的AI自主开发落地问题,逐步替代了传统的朴素AI编程模式。

相关条目

Harness架构Agentic Coding上下文焦虑智能体自我宽容生成与评估分离模式Planner智能体Generator智能体Evaluator智能体Claude大模型系列AI自主开发软件开发范式AI开发反馈闭环