W
AI-Wiki
CONCEPT

递归自我改进(RSI)

递归自我改进(RSI)

定义

递归自我改进(Recursive Self-Improvement,RSI)指 AI 参与 AI 研究,并将研究所得用于改进后续版本模型的机制。其核心不是仅让 AI 输出研究建议,而是让 AI 提出研究想法、查找资料、编写代码、运行实验、分析结果,再把研究结果和过程经验用于自身迭代。

本文语境

本文将 RSI 描述为从安全讨论中的高频概念逐渐进入产业与融资叙事的方向。来源称,2026 年 9 月 OpenAI 公开表示已完成“自动化研究实习生”目标,即 AI 能在人类指导下写代码、运行实验和分析结果;下一阶段是 automated AI researcher。该说法是来源对行业进展的转述,并不表示模型已经完全自主完成科研。

完整闭环

RSI 的关键产物是研究轨迹(Research Trajectory),即一次研究中形成的想法、资料检索、代码、实验执行、结果分析以及成败记录。完整闭环可概括为:

  1. AI 针对研究问题提出 idea,并检索相关资料。
  2. AI 编写和运行实验代码,获得可分析的实验结果。
  3. 无论研究成功还是失败,过程都保留为完整的研究轨迹,而非只保留最终答案。
  4. 将这些轨迹回流到模型的训练和后训练,使其直接参与下一版模型的改进。
  5. 新模型以改进后的研究能力执行更多研究,继续产生可用于训练的新经验。 研究轨迹回流训练 是上述闭环中连接研究执行与模型迭代的关键环节:研究一次,模型也随之从该次过程学习一次。

与自动化研究编排的区别

仅在 Agent 或 Harness 层编排自动研究,重点通常是让现有模型调用工具、分解任务和执行流程;这可以提升单次研究任务的自动化程度,但不必然改变模型本身。RSI 进一步把自进化机制推进到模型训练与后训练:研究轨迹不只是运行日志或任务产物,而是下一代模型的训练经验。 因此,RSI 的难点不仅是构建能够做研究的 Agent,还包括获得可靠的研究过程、定义可用于训练的经验形式,以及让经验回流后确实带来可验证的模型能力提升。

规模化对象:Experience

传统模型规模化通常以 Token 和 Compute 为主要对象:增加训练文本、数据 token 或计算资源。本文将 RSI 的规模化对象概括为 Experience,即具有任务上下文、行动过程、工具使用、实验结果和成败反馈的研究经验。 这种表述强调,高价值训练信号不只来自更多静态文本,也可能来自可复用、可评估的研究过程;但 Experience 的质量、真实性、覆盖范围和训练价值仍需通过实验验证。

潜在正反馈

来源将“Research is the engine of RSI”概括为:如果研究—记录—训练—能力提升的闭环能持续有效运转,更擅长研究的下一代模型将产生质量更高的训练经验,从而继续改进后续模型。 这是一种对未来效果的机制性预期,而非已经被本文独立证明的必然结果。若实验设计不可靠、结果分析有误、失败经验难以有效利用,或训练回流不能稳定提升研究能力,正反馈就可能减弱或中断。

边界与前提

RSI 不等同于 AI 已经完全脱离人类的自主科研。来源所述自动化研究能力仍包含人类指导;此外,研究问题选择、数据与资料质量、代码和实验的可复现性、结果评估、训练数据治理及模型更新,都可能需要人类设定约束或进行审核。 能否称为有效的 RSI,取决于研究执行、成功与失败经验记录、训练数据回流和下一版模型能力提升是否构成可持续且可验证的闭环,而不能只凭一次自动化实验或一个编排系统判断。

来源中的产业案例

来源以 超衍智能 为国内案例:该公司称将融资用于基础模型、算力和递归自进化研发,并选择将研究轨迹回流到中训练和后训练,而不只从 Agent 与 Harness 层切入自动研究。其融资金额、成立时间、投资方及研发进展均为来源报道或公司口径,需以独立信息核验。

相关条目