前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.12 · 00:00/4 MIN/编译自 衡宇/1 阅读

生数科技发布Motus2:世界模型打通具身自进化闭环

生数科技发布第二代具身世界模型 Motus2,在一个架构内集成行动、预测与评估能力,初步实现递归自我改进(RSI)。模型结合轻量级触觉与记忆模块,利用13万小时人类第一视角数据完成迁移,真机操作成功率最高提升33个百分点。

机器人学习拧灯泡时,如果动作拧歪了,谁来指出问题并在下一次做出修正?

具身智能的终极目标之一是「自进化」:现实场景千变万化,人类无法穷尽所有示范轨迹。机器人要想持续提升操作水平,必须具备评估动作结果并从中自我修正的能力。

生数科技近日发布了第二代世界模型 Motus2,在具身智能的核心深水区给出了系统性方案。该模型集成了触觉感知、灵巧操作、第一视角(Ego)数据迁移以及自我闭环进化,在一个大模型中同时融合了行动、预测与评估三种核心能力。

Motus2 概览

构建「行动-预测-评估」闭环,探索递归自改进

传统机器人策略多采用模仿学习范式,仅记录「看到当前状态 A 就执行动作 B」的表面关联,缺乏对物理因果的理解,环境稍有变化便容易失效。

Motus2 打破了这一局限,在统一架构中整合了三大模块:

  • 行动(WAM 世界动作模型):根据当前观测生成动作,回答「接下来做什么」;
  • 预测(AC-WM 条件动作世界模型):模拟动作执行后的环境演变,回答「做完后会发生什么」;
  • 评估(VM 价值模型):评判预测状态的优劣,回答「这个结果好不好」。

模型架构与核心能力

这三项能力首尾相接,形成了完整的决策演化链路:生成动作 → 预测后果 → 评估结果 → 更新策略。模型自身的预测与评估结果,直接转化为优化策略的反馈信号,形成了递归自我改进(RSI)的雏形。

为了避免模型在训练时利用未来帧「时序作弊」,Motus2 在中间训练阶段引入了「动作优先(Action-first)」信息流,严格限定模型必须先生成动作,再脑补未来画面,最后给出评分。

在落地应用上,这套机制分为推理和训练两个层面:

  • 推理阶段(Best-of-N 规划):模型在动作执行前预先构思多个候选动作,脑补执行画面后交由价值模型打分,挑选最高分方案执行。这相当于机器人做决策前在「脑海」中推演多种解法。
  • 训练阶段(基于模型的强化学习,MBRL):候选动作的评分会转化为策略参数的更新梯度,正向引导高分动作。此阶段仅更新动作生成参数,固定预测与评估模块,确保基座稳定。

Best-of-N 推理规划示意

这种架构也改变了具身数据的利用方式。以往被视作噪声的失败轨迹,现在能够用来学习因果边界,帮助模型识别无效操作。真机测试显示,在手机放置与多指操作任务中,基础策略成功率为 65%,引入规划与 MBRL 后整体成功率提升至 75%。

触觉与记忆模块:补全视觉感知盲区

纯视觉方案在灵巧操作中往往面临遮挡与受力未知等痛点。例如双手撕纸,仅凭图像无法确认纸张是否已被夹稳或产生微小打滑。

Motus2 引入了轻量级触觉专家模块。该模块复用主干模型的中间计算特征,在执行短动作片段前快速读取最新触觉反馈进行微调,既规避了挂载外置大模型带来的推理延迟,又保证了高频响应。在纸杯抽取与撕纸测试中,加入触觉后成功率从 60% 跃升至 72.5%。

针对长期交互任务,Motus2 配备了记忆机制。在寻找被遮挡方块等需要上下文推断的测试中,保留完整历史观测方案的成功率为 57.5%,显著优于压缩历史的方案。这表明在复杂的物理交互中,高保真历史轨迹对精准决策至关重要。

13万小时人类数据,迁移至高自由度灵巧手

Motus2 已在拥有 20 至 22 个单手自由度的 Sharpa Wave 和 WUJI Hand 2 等灵巧手平台上部署,完成了翻书、拧灯泡等多指协同任务。

自由度的大幅增加带来了数据稀缺挑战。Motus2 选择以人类第一视角(Ego)经验为主要数据来源,分三步完成控制迁移:

  1. 单目 Ego 视频预训练:理解通用物体形态与场景物理规律;
  2. 双目视频与人体动作学习:捕捉精细的手物交互细节;
  3. 真机适配训练:利用数百小时的人机对齐与真机轨迹,将人类动作映射到机械手的控制空间。

Ego 数据迁移与真机训练对比

对比实验表明,仅使用人类数据预训练的模型在五项真机任务中的平均成功率为 51%;加入机器人域适配后,成功率跳升至 84%,大幅提升 33 个百分点。同时,将双目人类数据从 2000 小时提升至 20000 小时后,动作预测误差持续走低,显示出人类数据规模化扩展的强大潜力。

数据规模与预测误差曲线

迈向 L4 自主世界智能体

业内普遍将通用世界模型的演进划分为五个阶段:L1 生成世界、L2 交互世界、L3 在世界中行动、L4 自主世界智能体、L5 世界组织者。

世界模型演进路径

标签:世界模型具身智能强化学习

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
置顶

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

Motus2 标志着世界模型在跨越 L3 的同时,开始触碰 L4 的核心特征:不仅能够根据当前观测做出动作,更能利用内部预测与价值反馈反哺自身策略,建立起评价与进化的闭环机制。

更多技术细节可参阅 Motus2 项目主页 与 arXiv 研究论文。

IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型
置顶

IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型

//

24小时热榜

别被UMAP骗了:你看到的聚类可能是算法造假
TOP1

别被UMAP骗了:你看到的聚类可能是算法造假

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
TOP2

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

3

支撑10亿用户:OpenAI在线存储平台Habitat演进实录

1天前
支撑10亿用户:OpenAI在线存储平台Habitat演进实录
4

蚂蚁推出灵影系统,搭建AI眼镜与终端Agent基础设施

1天前
蚂蚁推出灵影系统,搭建AI眼镜与终端Agent基础设施
5

Kimi发布K2.8:百万上下文全员开放,性能逼近旗舰K3

1天前
Kimi发布K2.8:百万上下文全员开放,性能逼近旗舰K3
6

具身智能落地三问:告别单次演示,走向低成本规模复制

1天前
具身智能落地三问:告别单次演示,走向低成本规模复制
7

素人IP批量走红:靠情绪出圈,变现考验专业功底

1天前
8

外滩大会观察:AI加速落地产业,数据基础设施成突围核心

1天前
外滩大会观察:AI加速落地产业,数据基础设施成突围核心
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断