前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.14 · 00:00/5 MIN/编译自 林, 方舟/3 阅读

生数科技发布世界模型Motus2,开启机器人闭环自进化

生数科技正式发布具身智能世界模型Motus2,将行动生成、后果预测与价值评估融为一体,通过“生成-预测-评估-更新”的闭环探索递归自我改进。模型引入触觉与记忆机制,让高自由度灵巧手操作成功率大幅提升。

机器人学习拧灯泡,拧歪了之后谁来纠错?人类不可能替机器人示范所有异常情况。要让机械臂越做越好,核心在于让机器具备评价动作后果的能力,并借此持续反思与学习。

生数科技发布新一代世界模型 Motus2,尝试将具身智能推向“自我进化”的研究深水区。模型集成了行动、预测与评估三种能力,同时融入触觉反馈、长程记忆以及大规模第一视角(Ego)人类数据迁移。

世界模型闭环自进化架构

行动、预测与评估形成闭环

传统机器人策略模型以“看到状态 A 便执行动作 B”为主,只记忆统计关联,并不理解因果逻辑。一旦外部环境出现扰动,策略容易瞬间失效。

Motus2 则在单一模型中整合了三大核心能力:

  • 行动(WAM):世界动作模型负责生成动作,解决“下一步做什么”;
  • 预测(AC-WM):条件动作世界模型负责脑补后果,解决“做完会发生什么”;
  • 评估(VM):价值模型负责打分,解决“这个结果好不好”。

行动、预测、评估三位一体

这三项能力紧密咬合,构成了“生成动作→预测后果→评估结果→更新策略”的反馈链条,也是 Motus2 对递归自我改进(Recursive Self-Improvement,RSI)的初步落地。

为了避免模型在执行动作前提前“偷看”到未来帧而产生时序作弊,Motus2 在机器人训练阶段采用了 Action-first(动作优先)的信息流设计:必须先根据当前观测决策动作,再去预判结果并评估优劣。

在推理阶段,Motus2 采用 Best-of-N 规划机制:模型预先构想若干候选动作,在脑海中推演画面并打分,挑选最高分方案下发执行。执行一小段后,重新校准真实世界输入。

推理阶段规划机制

在训练阶段,候选动作的评分会转化为策略更新信号,高分路径获得强化,低分动作被逐步淘汰。通过基于模型的强化学习(MBRL),失败轨迹不再被视作废弃噪声,而是成为理解错误动作后果的负样本。

真机实验显示,在手机放置与多指操作任务中,基础策略平均成功率为 65%;结合规划与 MBRL 后,成功率提高至 75%,相比基线提升了 10 个百分点。

补齐触觉与记忆短板

在灵巧操作中,纯视觉常常存在遮挡盲区,也难以判断手指与物体的微小滑移。Motus2 新增了轻量级触觉专家模块,在短动作执行前读取传感器反馈以微调姿态。该模块直接复用主干网络的计算特征,兼顾了低延迟与低算力开销。在抽取纸杯和撕纸两项任务中,引入触觉后真机成功率由 60% 提高到 72.5%。

针对长期任务,Motus2 建立了历史观测缓存机制。在杯中藏物等需要记忆先验的测试里,保留完整历史上下文的方案取得了 57.5% 的成功率,显著优于压缩历史信息的方案,验证了时序记忆在具身决策中的必要性。

将人类经验迁移至高自由度灵巧手

Motus2 已部署在单手 22 自由度的 Sharpa Wave 和单手 20 自由度的 WUJI Hand 2 等硬件平台上,能够完成拧灯泡、翻书和精细多指操作。

为解决高自由度灵巧手的数据匮乏难题,团队构建了分层的人类第一视角数据体系:

  1. 利用约 13 万小时单目 Ego 视频进行预训练,学习常识物理规律;
  2. 引入双目视频与人类动作数据,捕捉手部与物体的精细交互;
  3. 通过百小时级机器人真机数据和人机对齐数据,将知识迁移至机器人动作空间。

数据消融实验对比

实验表明,仅靠人类 Ego 数据预训练的模型,五项真机任务成功率为 51%;经过机器人域适配后,成功率跃升至 84%,提升达 33 个百分点。将双目数据从 2000 小时提升到 20000 小时后,预测误差呈持续下降趋势,证明扩充第一视角人类数据仍然具备明确的 Scaling 效应。

数据规模增长曲线

通向自主世界智能体

在世界模型演进路径中,生数科技将其划分为五个阶段:L1 生成世界、L2 与世界交互、L3 在世界中行动、L4 自主世界智能体、L5 世界组织者。

世界模型演进五级体系

Motus2 已经完整覆盖了 L3 阶段的行动与预测要求,并借助评价与策略自迭代机制,初步触碰了 L4 阶段的自主反馈与进化边界。尽管跨机械臂本体的触觉泛化、超长任务推理效率依然面临挑战,但将动作评估转化为自我迭代信号,已为具身智能走出了一条清晰的技术闭环路径。

更多技术细节可参阅 Motus2 项目主页与真机演示 与 arXiv 论文。

标签:世界模型具身智能强化学习

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半
置顶

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
置顶

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

//

24小时热榜

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify
TOP1

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者
TOP2

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者

3

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么

20小时前
12分钟跑完5亿元地产投资模型:Claude 颠覆了什么
4

别等想清楚再动手:用AI拆解庞大任务的“最小第一步”

20小时前
别等想清楚再动手:用AI拆解庞大任务的“最小第一步”
5

AI竞争的终局不是做大模型,而是争夺基建与权力

20小时前
AI竞争的终局不是做大模型,而是争夺基建与权力
6

AI在狂飙,但人类习惯走得很慢

20小时前
AI在狂飙,但人类习惯走得很慢
7

逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时

20小时前
逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时
8

软件正在吃掉自己:当所有专业都被冠上“产品”前缀

20小时前
软件正在吃掉自己:当所有专业都被冠上“产品”前缀
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断