神秘具身模型MVP放出多段一镜到底Demo:机器人端水遇扰不洒、双机协作抖床单、一次带走全部物品,展现对物理规律和人类习惯的理解。团队称zero-shot成功率80%,下一步将上街实测。
还记得上周具身智能圈流传的那段 10 分钟一镜到底视频吗?它当时让许多人直呼“太科幻”,还有人给出最高评价:不会是 AI 生成的吧?质疑者则怀疑是远程操控。
面对争议,这个神秘团队没有过多解释,而是又接连放出几个新 Demo,依旧不剪辑、一镜到底,像是在回应:“智能,不管你信不信,它真的要来了。”

团队透露,模型内部代号是 MVP,全称 Make Veritable People,意思是让模型能力像真人一样。他们开玩笑说,这个名字可以直译成“做个人吧”。
第一个 Demo 里,机器人左手端着一杯水。有人用木棍戳它的胳膊,它顺势躲向另一侧,又平稳归位,杯中水没有洒出半滴;紧接着,木棍又推倒旁边的易拉罐,它的右手竟然同步扶住了易拉罐。两只手一个稳住水杯、一个抢救易拉罐,还要应对持续的物理干扰——这种手眼协调能力,很多普通人都未必做得到。
主流 VLA 和 WAM 模型常在遮挡、接触、形变等需要物理推理的任务中失效,因为它们只是在模仿动作样子,并不理解背后的物理规则。而 MVP 模型表现出的是对动力学状态的把握:动作不是“猜”出来的,而是像人一样基于物理理解“学”出来的。
第二个 Demo 是客厅整理。机器人先把小玩偶放回玄关置物台,接着拖过一只收纳篮,微微下蹲,掏出黑色帽子和紫色健身环,依次挂上衣帽架。最后拿出一只巨大的花朵坐垫时,它明明可以弯腰,却选择直接扔到沙发上。
团队称,这是 zero-shot 完成任务的视频,成功率已达 80%。机器人看起来知道光滑地面上的篮子可以拖,环形物体能挂,坐垫平整柔软、扔出去会自行展开——它甚至已经学会“能省力就省力”。这种对空间、物体属性与人类生活习惯的统一理解,恰恰是许多 VLA 模型做不到的。
第三个 Demo 里出现了两台不同型号的机器人。较高的机器人拽住床单一头,较矮的机器人牵住另一头,跨步、弯腰,把床单扯平,高个机器人再轻轻抖几下床单。据称,它们的训练全都来自人类视频,这次却完成了跨本体协作。
动作虽然还有点僵硬,但行为逻辑和人类抖床单如出一辙:把织物抖开、减少褶皱。相比只能靠大量数据硬算的 VLA 或拼积木式的 WAM,这种“一脑多形”显得更接近人的迁移能力。
第四个 Demo 更像一个贪心的收纳员。机器人抽出一条黑色围巾搭在肩上,把紫色圆环套进小臂,再让它滑到肘关节,接着挂上拖鞋、耳机……直到身上挂满物品,才淡定转身离开。
它的决策方式看起来不是“下一步做什么”,而是顺着能量下降的方向,选择最省力的路径。主流模型做同类任务,大概率会一件一件单独搬运,因为本质上仍是统计拟合;MVP 则更像一个有自主意图的人,在理解世界的基础上组织长程动作。
四个 Demo 看下来,机器人展现出几种类人特质:动作一致性让它全程逻辑自洽、手眼协调;思考持续性让长时序任务环环相扣;不同机器人甚至流露出不同的做事风格,仿佛各自有了性格。

团队还说,下一步会让机器人自己上街,在完全开放的环境里跑起来。到那时,关于“是不是遥操”“是不是概率预测”的争议,也许才会有更直接的答案。智能是不是真的已经涌现?等公开实测见分晓。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断