研究轨迹回流训练
定义
研究轨迹回流训练是指:AI 在提出研究想法、检索资料、编写代码、运行实验、分析结果的过程中,持续记录完整的 Research Trajectory(研究轨迹),再将这些轨迹筛选后回流到中训练和后训练,直接参与下一版模型的改进。 它属于递归自我改进(RSI)的一种训练路径,核心不是只让 AI 借助外部工具完成任务,而是让研究过程本身成为模型学习数据。
在本文档中的语境
原文将这一机制放在 RSI(Recursive Self-Improvement,递归自我改进)的讨论中。文章将其概括为“AI 做 AI 研究,然后把研究结果拿回来继续改进自己”,并以超衍智能所宣称的技术路线为案例。 原文提到,AI 可以提出 idea、查资料、写代码、跑实验,并保留成功与失败的完整轨迹;这些轨迹随后被拿回去训练模型,形成“研究一次,模型也顺便学一次”的过程。文中还将这一逻辑称为“Research is the engine of RSI”。 文章同时将其与从 Agent 或 Harness 层切入的 Auto-research 项目区分开来:后者主要通过外部工具编排研究流程,而研究轨迹回流训练试图把自进化继续推进到模型训练内部。
关键机制
- 轨迹生成:模型完成从提出问题或假设、检索资料、编写代码到运行实验和分析结果的连续研究过程。
- 过程留痕:记录研究过程、实验步骤、使用的资料与代码、运行结果、分析判断,以及成功和失败经验,而不只保存最终答案。
- 轨迹回流:将保存的 Research Trajectory 经过筛选后用于中训练和后训练,使其直接参与下一版模型能力改进。
- 经验复用:一次研究同时产生外部研究产出和供模型学习的经验数据;失败轨迹也可用于学习哪些假设、步骤或实现路径不可行。
- 递归闭环:模型能力提高后,能够产出更高质量的研究轨迹;质量更高的轨迹再改善后续训练,进一步提升模型的研究能力。
细节与边界
与传统规模化训练的差异
原文将过去 scaling 的主要单位概括为 Token 和 Compute,而 RSI 希望 scaling 的是 Experience。这里的 Experience 不只是静态文本,而是包含行动、实验、反馈和判断的研究经验。
不等于自动调用工具
仅仅让模型调用Retriever、代码执行器或其他外部 Agent 工具,并不构成研究轨迹回流训练。关键区别在于:工具调用产生的完整研究过程是否被记录、筛选,并进入中训练或后训练流程。
不保证自动变强
该机制的闭环能否有效工作,取决于轨迹是否完整、训练数据筛选是否可靠,以及实验结果能否复现。若只保存最终结论、遗漏失败过程,或将不可复现、低质量的轨迹直接用于训练,回流可能无法带来稳定改进,甚至引入错误经验。
研究对象与训练对象的双重身份
同一条轨迹既是一次研究任务的执行记录,也是模型训练样本。因此需要区分研究结果本身的可信度、轨迹记录的完整性,以及其作为训练数据的适用性。
原文案例中的位置
原文称,OpenAI 在 9 月公开表示已完成“自动化研究实习生”目标,即 AI 能在人类指导下写代码、跑实验和分析结果,下一步目标是 automated AI researcher。文章还称,超衍智能于 2026 年 9 月 16 日宣布完成天使轮和天使加轮、累计融资近 4 亿元,并将资金用于基础模型、算力和递归自进化研发。上述融资、公司与时间信息属于原文报道的案例背景,不等同于该训练机制已经被独立验证。
落地所需条件
- 轨迹记录完整性:覆盖想法、资料、代码、实验步骤、环境、结果、分析以及成功或失败原因。
- 训练筛选质量:判断哪些轨迹具有正确性、信息量、可泛化性和教学价值,避免把错误或偶然结果直接放大。
- 实验结果可复现性:保留足够的代码、依赖、参数、数据和运行条件,使结果能够复核。
- 训练闭环管理:明确轨迹进入中训练还是后训练、如何评估新模型,以及如何防止模型重复学习未经验证的结论。
相关条目
- 递归自我改进(RSI):研究轨迹回流训练所处的总体范式。
- Retriever:研究过程中可被调用的检索组件,但工具调用本身不等于轨迹回流训练。
- 心智模型:模型在研究过程中组织对象、关系和上下文的内部结构,可作为研究轨迹中的一种能力表现。
- 超衍智能:原文报道中采用“将 Research Trajectory 回流到中训练和后训练”路线的案例主体。