CosmosMind联合斯坦福、MIT与清华等高校发布MetaRSI-v1,首次构建统一模型、数据与框架的元递归架构。系统无需外部教师模型即可优化“改进过程本身”,推动小模型与前沿旗舰模型性能跨越式提升。
让模型自主合成训练数据、重构提示词或修补代码,这种路径在人工智能领域被称为递归自我改进(Recursive Self-Improvement,RSI)。以往的 RSI 方案大多依赖一套固定的改进逻辑,局限于单一的模型、数据或框架视角。
为了打破这一瓶颈,CosmosMind 联合斯坦福大学、加利福尼亚大学伯克利分校、MIT、清华大学及北京大学等十余家高校团队,正式推出了 MetaRSI-v1。这是业内首个将模型、数据和外部框架统一整合的元递归架构,实现了“对改进过程本身的改进”。

实验显示,在没有任何外部更强教师模型的引导下,MetaRSI-v1 让仅有 30 亿激活参数的小模型在四项权威基准上平均提升 10.9 分;同时使包括前沿闭源旗舰在内的六款顶级大模型在基准评测中平均提升 7.3 分。

MetaRSI-v1 提炼出一套统一的抽象底层——Loop Kernel。它将“自我进步”解构为一个闭环:吸收运行反馈中的学习信号,在数据(Data)、外部框架(Harness)和模型(Model)三个维度生成调整方案,交由验证器判定,再将结果转化为下一轮优化的输入。

这三个维度被具象化为三大协同算子:

为了动态找到最优进化路径,MetaRSI 设计了纵横双轴调度机制:
系统由四个分工明确的 AI 智能体协作驱动:MetaRSI² Agent 学习并优化双轴编排策略;RSI² Agent 执行横向调度与纵向指令分发;RSI² Sub-Agent 专职负责微调算子内部逻辑;Transition Agent 承接算子之间的数据产物流转。这使得系统拥有三个层级的优化深度,且支持人类专家随时切入接管。
评测分为两条路线进行:
在开源小模型测试中,研究团队选用了 Qwen3.5-35B-A3B(35B 总参数,3B 激活),全面启用 Data、Harness、Model 三大算子。在 Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond 及 AIME 基准上,模型不仅平均得分提升 10.9 分,在 SWE-bench Pro 上的任务解决率更是接近翻倍。


在前沿闭源旗舰模型路线上,针对参数未公开的商用大模型,仅启用 Data 与 Harness 算子。测试结果显示,多款前沿模型在 Terminal-Bench 2.1 上取得了平均 7.3 分的显著增长,证明即便未经参数微调,通过外部框架与数据的自适应协同,依然存在广阔的自我增强空间。

基于系统实践,团队总结了关于机器自我进化的五项核心原则:
免费获取企业 AI 成熟度诊断报告,发现转型机会
目前,CosmosMind 已经开源了支持自主学习和策略沉淀的 RSI-Harness 代码库,并发布了 MetaRSI 研究论文。团队下一步计划将该闭环延伸至物理现实场景,利用自动化实验室与可编程实验仪器,让科学假说的提出与检验步入全自动闭环时代。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断