W
AI-Wiki
SOURCE

RSI 火了,国内已经有人融了近 4 亿 - 今日头条 摘要

RSI 火了,国内已经有人融了近 4 亿

文档概览

  • 文章讨论的核心概念是 递归自我改进(RSI)(Recursive Self-Improvement)。
  • RSI 的简化定义是:AI 做 AI 研究,然后把研究结果拿回来继续改进自己。这意味着 AI 不仅执行既定任务,还参与提出研究想法、查资料、编写代码、运行实验和分析结果,并把过程与结果转化为下一轮模型改进的经验。
  • 文章将 RSI 描述为从安全讨论中的高频词,扩展为受到资本市场关注的融资关键词,并以 OpenAI、Recursive Superintelligence 和国内超衍智能为案例。

关键事实

RSI 与行业热度

  • RSI 全称为 Recursive Self-Improvement,中文为“递归自我改进”。
  • 其核心闭环是“AI 研究 AI”:AI 产生研究想法、收集资料、写代码、运行实验、分析结果,再把研究所得用于改进自身。
  • 文章称,9 月 OpenAI 公开表示已完成“自动化研究实习生”目标:AI 可以在人类指导下写代码、跑实验和分析结果;下一步目标是 automated AI researcher(自动化 AI 研究员)。
  • 文章称,5 月由田渊栋等人参与创办的 Recursive Superintelligence 获得 6.5 亿美元融资,估值达到 46.5 亿美元。

超衍智能融资

  • 2026 年 9 月 16 日,超衍智能宣布完成天使轮和天使+轮融资,累计融资近 4 亿元。
  • 超衍智能官方称,融资资金将用于基础模型、算力和递归自进化研发。
  • 文章称超衍智能成立于 2026 年 6 月;成立约三个月后,已将 IDG、晶泰科技以及北京、深圳、上海三地国资纳入同一张 Cap table。

创始人背景

  • 文章称,超衍智能创始人陈勇超出生于 1999 年左右、当年 27 岁;2026 年 8 月刚入职清华大学人工智能学院,任助理教授。
  • 文章还称其此前曾在 Google DeepMind、Microsoft 和 MIT-IBM Watson 从事研究。

重要细节

从 Agent 或 Harness 层深入模型训练

  • 文章将超衍智能与许多从 Agent 和 Harness 层切入的 Auto-research 项目进行对比。
  • 这些项目通常在模型外部组织工具、流程或代理行为;超衍智能选择了更重的路线,把自进化机制继续深入模型训练内部,而不只停留在 Agent 或 Harness 层。
  • 其公开描述的关键做法,是让 研究轨迹回流训练(Research Trajectory)进入中训练和后训练流程,并直接参与下一版模型改进。

Research Trajectory 闭环

  • 研究流程包括:AI 提出 idea、查找资料、编写代码、运行实验,并记录成功与失败。
  • 成功和失败不会只作为一次性输出,而是留下完整的 Research Trajectory,即研究过程、尝试路径、实验结果及其反馈形成的轨迹记录。
  • 这些轨迹随后回流模型的中训练和后训练,作为下一版模型的训练经验;文章将其概括为“研究一次,模型也顺便学一次”。
  • 该机制形成递归闭环:下一代模型更擅长研究,因而可以产出质量更高、数量更多的训练经验;更高质量的经验又进一步提升后续模型的研究能力。
  • 团队把这套逻辑称为“Research is the engine of RSI”,即研究本身是 RSI 的发动机。

Scaling 对象的变化

  • 文章认为,过去大模型 scaling 主要围绕 Token 和 Compute 展开:增加训练数据 token 数量或计算资源,以获得能力提升。
  • RSI 试图将可规模化的对象转向 Experience(经验),即规模化积累和利用研究过程中产生的轨迹、结果、失败记录与成功方法。
  • 这里的 Experience 不是单纯增加静态语料,而是把研究活动产生的过程性经验纳入模型训练和后训练。

“Research 平权”判断

  • 陈勇超在文章中被引述为:“下一站是 Research 平权”。
  • 文章借用 Claude Code 缩短普通人与程序员之间距离的例子,推测如果 RSI 路线真正跑通,下一步可能被压缩的是普通人与研究员之间的能力距离。
  • “Research 平权”在本文语境中是对潜在社会影响的判断,表达的是研究能力可能通过自动化研究系统向更多普通人开放,并非已经实现的结果。

边界与待核验事项

  • 本文只记录来源文章的叙述,不将文中融资、估值、成立时间、任职经历或技术效果视为已由独立来源证实的事实。
  • 文章没有给出超衍智能天使轮与天使+轮各自的金额、投资方出资比例、估值或交割条款;“累计融资近 4 亿元”是来源给出的合计表述。
  • 文章没有公开 Research Trajectory 的具体数据格式、训练配方、模型架构、评测指标、实验规模或相对于传统 Auto-research 的量化提升。
  • “下一代模型会更擅长研究”以及“Research 平权”属于文章对闭环潜力的判断或愿景,是否成立取决于研究轨迹质量、训练稳定性、算力成本、评测方法和安全约束等条件。

相关条目

  • 递归自我改进(RSI):RSI 的概念、定义和自我改进闭环。
  • 研究轨迹回流训练:将 Research Trajectory 用于中训练和后训练的机制。
  • 超衍智能:文章重点介绍的国内公司及其融资、创始人背景和技术路线。
  • Agent:与超衍智能路线形成对比的模型外部代理层。
  • Harness:Auto-research 项目可能采用的流程编排或工具控制层。