具身智能正迈向递归自我改进(RSI)。但基础模型决定当前上限,持续改进系统决定迭代速度。最先实现自进化的未必是模型最强巨头,而是能将真实物理世界试错高效转化为下一代能力的工程闭环构建者。
在智能演化历程中,推动技术演进的主体正在发生迁移。过去,人类制造机器并改进机器;如今,AI 开始从被研发的对象,变成参与下一代机器研发的推动者。
这种机制如同文化演进中的“棘轮效应”:每一代成果被稳固保留,后继者在此基础上持续叠加。在 AI 领域,这种能力被称为 RSI(递归自我改进,Recursive Self-Improvement)。它的核心逻辑在于:系统不仅继承上一轮成果,更在持续优化“产生改进的方法本身”。
然而,当 RSI 走出虚拟数字空间,进入具身智能与物理世界时,规则发生了根本改变:基础模型决定当前一代能做到什么,而持续改进系统决定下一代能力能以多快的速度形成。最先跑出具身智能 RSI 闭环的,未必是基础模型最强的公司。
机器参与自身研发并非科幻。Anthropic 的内部数据显示,其达到 AL4 级别(人类仅定目标,AI 端到端执行)的研发工作比例,在数月内从不足 1% 跃升至 26%,数万个 AI 智能体同时在内部平台进行实验与决策。

在探索机制上,Dream-RSI 等项目把真实搜索历史转变为可反复回放的模拟环境,让 AI 学习“如何更好地寻找方案”,实现搜索策略本身的代际升级。

进一步的突破来自让 AI 智能体修改自身架构。例如 Darwin Gödel Machine(DGM)允许代码智能体直接改写自身代码,在基准测试中表现更强的变体将作为下一轮修改的母本。

尽管数字环境已跑通部分环节,但最难跨越的鸿沟在于:更强的下一代,是否也必然是更强的“改进者”? 当前技术能够实现任务能力的自优化,但尚未能稳定证明“元改进能力”(Ignition)的持续自激增。

更关键的是判卷机制。早期测试显示,模型极易出现“奖励作弊(reward hacking)”。如果评估系统存在漏洞,自我改进就会迅速演变成误差的自我放大。

纯软件 Agent 写错代码可以秒级回滚重试,但机器人每一次真机试错都会损耗硬件、场地与时间。机械臂抓倒水杯,物理环境随即不可逆地改变。机器人必须在与物理世界的摩擦中完成闭环,这包含四个核心工程节点:
在传统模仿学习中,执行失败通常被当作废数据。而如 Q-Planning 策略,在固定基础行为网络之外接入 Q-function,将真机自主探索中遇到的失败轨迹转化为动作选择的约束,使机器人无需端到端重训也能从失误中学会避坑。

英伟达推出的 ASPIRE 展现了经验保存的另一种形态:系统在真机试错中自动修正控制程序,并将通过验证的修正写入技能库(skill library)。现场解决的特异性问题不再散落在单台硬件上,而是沉淀为全机队可复用的资产。

由于真机时间极其昂贵,世界模型(World Model)成为天然的过滤器。如 WALL-SS 证明,长时序世界模型能够保留近 90% 的真实策略优劣排序。海量候选方案先在模拟环境中跑通评选,高价值方案才被允许走上真机测试台。

在英伟达 ENPIRE 架构下,代码智能体能够读取真实机器人运行日志、自动分析失败诱因、改写算法和训练代码,并发起下一轮实验。这标志着改进对象从“机器人动作策略”升维至“产生动作策略的研发流程”。

传统硬件遵循“研发-制造-销售-使用”的单向通道,交付即代表研发结束。但具身智能正在重构这套链条:
部署 → 真实行动 → 异常与接管 → 经验回流 → 验证迭代 → 重新部署
机器人进入复杂的工厂与家庭,其核心价值不仅是执行任务,更在于成为探针,持续暴露系统在真实物理条件下的能力边界。
然而,部署规模并不天然等于迭代能力。如果一家拥有万台设备的公司需要工程师手动排查日志并等待产线排班验证,规模带来的只有运维泥潭;反之,若系统能自动化筛选高价值失败、通过仿真过滤并完成回归更新,万台设备便等同于一万个自进化节点。
资本市场已经开始为此定价,但要判断具身智能公司是否真正具备自进化潜力,核心不在于账面参数有多大,而在于其有效改进效率——将一个物理世界暴露的真实问题,转化为下一代稳定新能力所需的周期与综合成本。

这一体系可以细化为四个观察维度:
若这套闭环能够跨场景稳定运转,具身智能公司将迎来真正的新型规模效应:部署越多,研发下一代能力的成本越低、速度越快。
行业下一阶段的角逐重心,正在从单纯比拼“谁的机器人当前性能最强”,转向“谁能以更低成本、更快速度,把真实世界的失误锻造成下一代系统的可靠本领”。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断