生数科技正式发布具身智能世界模型Motus2,将行动生成、后果预测与价值评估融为一体,通过“生成-预测-评估-更新”的闭环探索递归自我改进。模型引入触觉与记忆机制,让高自由度灵巧手操作成功率大幅提升。
机器人学习拧灯泡,拧歪了之后谁来纠错?人类不可能替机器人示范所有异常情况。要让机械臂越做越好,核心在于让机器具备评价动作后果的能力,并借此持续反思与学习。
生数科技发布新一代世界模型 Motus2,尝试将具身智能推向“自我进化”的研究深水区。模型集成了行动、预测与评估三种能力,同时融入触觉反馈、长程记忆以及大规模第一视角(Ego)人类数据迁移。

传统机器人策略模型以“看到状态 A 便执行动作 B”为主,只记忆统计关联,并不理解因果逻辑。一旦外部环境出现扰动,策略容易瞬间失效。
Motus2 则在单一模型中整合了三大核心能力:

这三项能力紧密咬合,构成了“生成动作→预测后果→评估结果→更新策略”的反馈链条,也是 Motus2 对递归自我改进(Recursive Self-Improvement,RSI)的初步落地。
为了避免模型在执行动作前提前“偷看”到未来帧而产生时序作弊,Motus2 在机器人训练阶段采用了 Action-first(动作优先)的信息流设计:必须先根据当前观测决策动作,再去预判结果并评估优劣。
在推理阶段,Motus2 采用 Best-of-N 规划机制:模型预先构想若干候选动作,在脑海中推演画面并打分,挑选最高分方案下发执行。执行一小段后,重新校准真实世界输入。

在训练阶段,候选动作的评分会转化为策略更新信号,高分路径获得强化,低分动作被逐步淘汰。通过基于模型的强化学习(MBRL),失败轨迹不再被视作废弃噪声,而是成为理解错误动作后果的负样本。
真机实验显示,在手机放置与多指操作任务中,基础策略平均成功率为 65%;结合规划与 MBRL 后,成功率提高至 75%,相比基线提升了 10 个百分点。
在灵巧操作中,纯视觉常常存在遮挡盲区,也难以判断手指与物体的微小滑移。Motus2 新增了轻量级触觉专家模块,在短动作执行前读取传感器反馈以微调姿态。该模块直接复用主干网络的计算特征,兼顾了低延迟与低算力开销。在抽取纸杯和撕纸两项任务中,引入触觉后真机成功率由 60% 提高到 72.5%。
针对长期任务,Motus2 建立了历史观测缓存机制。在杯中藏物等需要记忆先验的测试里,保留完整历史上下文的方案取得了 57.5% 的成功率,显著优于压缩历史信息的方案,验证了时序记忆在具身决策中的必要性。
Motus2 已部署在单手 22 自由度的 Sharpa Wave 和单手 20 自由度的 WUJI Hand 2 等硬件平台上,能够完成拧灯泡、翻书和精细多指操作。
为解决高自由度灵巧手的数据匮乏难题,团队构建了分层的人类第一视角数据体系:

实验表明,仅靠人类 Ego 数据预训练的模型,五项真机任务成功率为 51%;经过机器人域适配后,成功率跃升至 84%,提升达 33 个百分点。将双目数据从 2000 小时提升到 20000 小时后,预测误差呈持续下降趋势,证明扩充第一视角人类数据仍然具备明确的 Scaling 效应。

在世界模型演进路径中,生数科技将其划分为五个阶段:L1 生成世界、L2 与世界交互、L3 在世界中行动、L4 自主世界智能体、L5 世界组织者。

Motus2 已经完整覆盖了 L3 阶段的行动与预测要求,并借助评价与策略自迭代机制,初步触碰了 L4 阶段的自主反馈与进化边界。尽管跨机械臂本体的触觉泛化、超长任务推理效率依然面临挑战,但将动作评估转化为自我迭代信号,已为具身智能走出了一条清晰的技术闭环路径。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断