生数科技发布第二代具身世界模型 Motus2,在一个架构内集成行动、预测与评估能力,初步实现递归自我改进(RSI)。模型结合轻量级触觉与记忆模块,利用13万小时人类第一视角数据完成迁移,真机操作成功率最高提升33个百分点。
机器人学习拧灯泡时,如果动作拧歪了,谁来指出问题并在下一次做出修正?
具身智能的终极目标之一是「自进化」:现实场景千变万化,人类无法穷尽所有示范轨迹。机器人要想持续提升操作水平,必须具备评估动作结果并从中自我修正的能力。
生数科技近日发布了第二代世界模型 Motus2,在具身智能的核心深水区给出了系统性方案。该模型集成了触觉感知、灵巧操作、第一视角(Ego)数据迁移以及自我闭环进化,在一个大模型中同时融合了行动、预测与评估三种核心能力。

传统机器人策略多采用模仿学习范式,仅记录「看到当前状态 A 就执行动作 B」的表面关联,缺乏对物理因果的理解,环境稍有变化便容易失效。
Motus2 打破了这一局限,在统一架构中整合了三大模块:

这三项能力首尾相接,形成了完整的决策演化链路:生成动作 → 预测后果 → 评估结果 → 更新策略。模型自身的预测与评估结果,直接转化为优化策略的反馈信号,形成了递归自我改进(RSI)的雏形。
为了避免模型在训练时利用未来帧「时序作弊」,Motus2 在中间训练阶段引入了「动作优先(Action-first)」信息流,严格限定模型必须先生成动作,再脑补未来画面,最后给出评分。
在落地应用上,这套机制分为推理和训练两个层面:

这种架构也改变了具身数据的利用方式。以往被视作噪声的失败轨迹,现在能够用来学习因果边界,帮助模型识别无效操作。真机测试显示,在手机放置与多指操作任务中,基础策略成功率为 65%,引入规划与 MBRL 后整体成功率提升至 75%。
纯视觉方案在灵巧操作中往往面临遮挡与受力未知等痛点。例如双手撕纸,仅凭图像无法确认纸张是否已被夹稳或产生微小打滑。
Motus2 引入了轻量级触觉专家模块。该模块复用主干模型的中间计算特征,在执行短动作片段前快速读取最新触觉反馈进行微调,既规避了挂载外置大模型带来的推理延迟,又保证了高频响应。在纸杯抽取与撕纸测试中,加入触觉后成功率从 60% 跃升至 72.5%。
针对长期交互任务,Motus2 配备了记忆机制。在寻找被遮挡方块等需要上下文推断的测试中,保留完整历史观测方案的成功率为 57.5%,显著优于压缩历史的方案。这表明在复杂的物理交互中,高保真历史轨迹对精准决策至关重要。
Motus2 已在拥有 20 至 22 个单手自由度的 Sharpa Wave 和 WUJI Hand 2 等灵巧手平台上部署,完成了翻书、拧灯泡等多指协同任务。
自由度的大幅增加带来了数据稀缺挑战。Motus2 选择以人类第一视角(Ego)经验为主要数据来源,分三步完成控制迁移:

对比实验表明,仅使用人类数据预训练的模型在五项真机任务中的平均成功率为 51%;加入机器人域适配后,成功率跳升至 84%,大幅提升 33 个百分点。同时,将双目人类数据从 2000 小时提升至 20000 小时后,动作预测误差持续走低,显示出人类数据规模化扩展的强大潜力。

业内普遍将通用世界模型的演进划分为五个阶段:L1 生成世界、L2 交互世界、L3 在世界中行动、L4 自主世界智能体、L5 世界组织者。

免费获取企业 AI 成熟度诊断报告,发现转型机会
Motus2 标志着世界模型在跨越 L3 的同时,开始触碰 L4 的核心特征:不仅能够根据当前观测做出动作,更能利用内部预测与价值反馈反哺自身策略,建立起评价与进化的闭环机制。
更多技术细节可参阅 Motus2 项目主页 与 arXiv 研究论文。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断