前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.14 · 00:00/4 MIN/编译自 思邈/2 阅读

MetaRSI架构发布:AI递归自我改进进入平方时代

CosmosMind联合斯坦福、MIT与清华等高校发布MetaRSI-v1,首次构建统一模型、数据与框架的元递归架构。系统无需外部教师模型即可优化“改进过程本身”,推动小模型与前沿旗舰模型性能跨越式提升。

让模型自主合成训练数据、重构提示词或修补代码,这种路径在人工智能领域被称为递归自我改进(Recursive Self-Improvement,RSI)。以往的 RSI 方案大多依赖一套固定的改进逻辑,局限于单一的模型、数据或框架视角。

为了打破这一瓶颈,CosmosMind 联合斯坦福大学、加利福尼亚大学伯克利分校、MIT、清华大学及北京大学等十余家高校团队,正式推出了 MetaRSI-v1。这是业内首个将模型、数据和外部框架统一整合的元递归架构,实现了“对改进过程本身的改进”。

论文首页

实验显示,在没有任何外部更强教师模型的引导下,MetaRSI-v1 让仅有 30 亿激活参数的小模型在四项权威基准上平均提升 10.9 分;同时使包括前沿闭源旗舰在内的六款顶级大模型在基准评测中平均提升 7.3 分。

自我改进提升数据

统一的 Loop Kernel 核心范式

MetaRSI-v1 提炼出一套统一的抽象底层——Loop Kernel。它将“自我进步”解构为一个闭环:吸收运行反馈中的学习信号,在数据(Data)、外部框架(Harness)和模型(Model)三个维度生成调整方案,交由验证器判定,再将结果转化为下一轮优化的输入。

MetaRSI-v1概览

这三个维度被具象化为三大协同算子:

  • Data-RSI:分析模型运行轨迹,将有效经验提炼并合成为高质量数据,划定并扩展能力边界。
  • Harness-RSI:在系统提示词、技能库、MCP、工具链及记忆模块五个插槽上灵活增删与迭代。
  • Model-RSI:直接更新模型权重与内部结构,将经过验证的策略永久内化。

Loop Kernel范式

双轴编排与多层智能体系统

为了动态找到最优进化路径,MetaRSI 设计了纵横双轴调度机制:

  • 横轴编排(Horizontal Orchestration):由智能体在每个决策节点评估当前状态,决定接下来调用哪一个算子并完成上下文衔接。
  • 纵轴优化(Vertical Optimization):针对具体算子下发策略调整指令,根据环境反馈动态改写算子内部的进化规则。

系统由四个分工明确的 AI 智能体协作驱动:MetaRSI² Agent 学习并优化双轴编排策略;RSI² Agent 执行横向调度与纵向指令分发;RSI² Sub-Agent 专职负责微调算子内部逻辑;Transition Agent 承接算子之间的数据产物流转。这使得系统拥有三个层级的优化深度,且支持人类专家随时切入接管。

实验验证:开源小模型与旗舰模型双突破

评测分为两条路线进行:

在开源小模型测试中,研究团队选用了 Qwen3.5-35B-A3B(35B 总参数,3B 激活),全面启用 Data、Harness、Model 三大算子。在 Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond 及 AIME 基准上,模型不仅平均得分提升 10.9 分,在 SWE-bench Pro 上的任务解决率更是接近翻倍。

MetaRSI让小模型实现自进化

改进改进者,累计增益扩大

在前沿闭源旗舰模型路线上,针对参数未公开的商用大模型,仅启用 Data 与 Harness 算子。测试结果显示,多款前沿模型在 Terminal-Bench 2.1 上取得了平均 7.3 分的显著增长,证明即便未经参数微调,通过外部框架与数据的自适应协同,依然存在广阔的自我增强空间。

六款前沿模型的自我改进

自我改进的五大基本定律

基于系统实践,团队总结了关于机器自我进化的五项核心原则:

  1. 验证决定演进前沿:自改进系统能否运转,取决于任务输出是否具备可执行、可判定的自动化验证器(Verifier)。
  2. 自我认知动态过期:智能体能力一旦跃升,原有的系统画像即刻失效,重新标定边界是进化的速率瓶颈。
  3. :能力固化在外部 Harness 中每次推理都需要额外消耗 Token 成本,内化进模型权重则一劳永逸。成熟的进化机制应推动能力向成本更低的载体迁移。
标签:递归自我改进大语言模型AI 智能体

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
置顶

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
能力载体与推理成本挂钩
  • 可信度由不可干预面度量:在闭环体系中,真实能力增强与判定标准变松表现一致,必须设立独立的不可写验证基准。
  • 闭环不凭空创造信息:自改进并非凭空造物,本质是对模型潜在能力的激发、梳理以及外部环境反馈信息的内化。
  • 目前,CosmosMind 已经开源了支持自主学习和策略沉淀的 RSI-Harness 代码库,并发布了 MetaRSI 研究论文。团队下一步计划将该闭环延伸至物理现实场景,利用自动化实验室与可编程实验仪器,让科学假说的提出与检验步入全自动闭环时代。

    IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型
    置顶

    IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型

    //

    24小时热榜

    Anthropic CEO呼吁放缓AI研发,中方批其套用“冷战剧本”
    TOP1

    Anthropic CEO呼吁放缓AI研发,中方批其套用“冷战剧本”

    猛犸象千元防晒服被曝不合格,老牌户外品牌陷品控危机
    TOP2

    猛犸象千元防晒服被曝不合格,老牌户外品牌陷品控危机

    3

    Anthropic拟赴纳斯达克IPO 募资规模或超SpaceX

    1天前
    Anthropic拟赴纳斯达克IPO 募资规模或超SpaceX
    4

    2026崇礼论坛观察:AI正在从比拼能力走向定义生活

    1天前
    2026崇礼论坛观察:AI正在从比拼能力走向定义生活
    5

    豆包手机助手发布消费者版:首发搭载努比亚新机

    1天前
    豆包手机助手发布消费者版:首发搭载努比亚新机
    6

    一根头发丝粗细的细针,如何卡住AI万卡集群的脖子?

    1天前
    一根头发丝粗细的细针,如何卡住AI万卡集群的脖子?
    7

    博迈医疗冲刺创业板:实控人配偶套现4.7亿,利润过半靠补助

    1天前
    博迈医疗冲刺创业板:实控人配偶套现4.7亿,利润过半靠补助
    8

    金斯瑞巨资下注AIDD,AI制药开启湿实验基建竞赛

    1天前
    热门标签
    大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

    关注公众号

    前途科技微信公众号

    扫码关注,获取最新 AI 资讯

    免费获取 AI 落地指南

    3 步完成企业诊断,获取专属转型建议

    已有 200+ 企业完成诊断