美梦空间与索辰科技联合发布物理世界动作模型 Physical-WAM 与开源评测基准 RoboTwin-Phys。该方案通过引入物理 Token,让具身机器人不仅能根据画面做反应,更能显式推断摩擦力、质量与重心,有效应对物理扰动。
具身智能的商业化探索正在遭遇瓶颈。近期学术界的多项研究揭示了现有架构的软肋:前沿的视觉-语言-动作(VLA)模型在固定环境中表现稳定,但一旦遭遇空间布局变化或物理参数扰动,任务成功率便出现断崖式下跌。
根本原因在于,传统 VLA 驱动的机器人多依赖统计学模仿,只知道“看到杯子便去抓”,却无法感知“杯壁有多薄、摩擦力是否足够、注水后重心是否改变”。为破解这一难题,“世界模型”正在成为具身智能实现跨越的关键路径。
在第五届全球数字贸易博览会上,由北京大学信息技术高等研究院高文院士团队孵化、获索辰科技战略投资的杭州美梦空间科技(Memo),正式发布了物理-世界动作模型基模 Physical-WAM 以及业内首个物理漂移评测基准 RoboTwin-Phys。

相比大语言模型与计算机视觉,机器人领域的数据采集成本极高。有效的物理交互必须依赖真机运动或高保真物理仿真,真实物理交互样本目前仅维持在百万级,与互联网数十亿级的图文数据相比存在数万倍差距。

针对数据瓶颈与物理感知缺失,Physical-WAM 在感知输入与动作输出之间插入了一层显式的**“物理 Token”表征**。
以往世界模型多采用像素或隐空间向量作为中间态,仅能预测“下一帧图像如何变化”,却无法解释“变化的动力学机理”。Physical-WAM 通过融合可观测数据与深层物理参数,使模型在真实交互中具备了实时预判与纠偏能力。

该模型由三个关键模块构成,形成闭环链路:

例如在抓握纸杯注水的场景中,PhysLens 识别纸杯的低刚度特性,PhysDream 预判注水负载可能导致杯体形变滑脱,PhysAct 则动态调整抓握力与接触位姿,使机器人表现出类似人类的“物理直觉”。
除了模型研发,具身智能领域长期缺乏针对物理适应度的量化标准。传统基准大多只考察“任务是否完成”,模型往往通过在固定物理参数下死记硬背来刷榜,现实场景中稍有摩擦或质量改变便告失效。

美梦空间推出的 RoboTwin-Phys 是业内首个以物理扰动为核心的评测基准。该基准在物体属性、接触属性、阻尼、环境及相机配置 5 大维度引入了 13 类真实物理扰动因素,把现实中模糊的物理变量转化为可控、可复现的评测指标。

该基准的设计具备三项核心特性:
目前,RoboTwin-Phys 的代码、数据集及榜单已全面开源,供全球研究者复现与评测。
世界模型在不同学术领域定义各异。毕马威此前发布的产业报告指出,世界模型正从表征式、生成式、交互式向“理解-生成-预测一体化”演进。

物理 AI 的工程化落地仍面临多项前沿挑战:物理 Token 在面对非线性弹性变形或微观粗糙度时的表征粒度、不同形态末端执行器(如双指夹爪与多指灵巧手)之间的物理迁移效率,以及仿真环境与真实物理之间 Sim-to-Real 的保真度界限。
美梦空间团队表示,未来将沿“视觉先行,力触声递进”的技术路线,持续扩大物理交互数据体量,并携手索辰科技推进世界模型在工业级场景中的深度落地。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断