估值390亿美元的人形机器人独角兽Figure AI发布Helix 2.5,展示在30个陌生住宅完成家务的能力,并宣称发现了机器人领域的Scaling Law。然而其56%的综合成功率引发业内关于模仿学习路线与泛化能力的激烈争议。
「这是 Figure AI 成立以来最重要的项目。」在 Helix 2.5 的发布视频里,Figure AI 创始人 Brett Adcock 表现出十足的信心。
作为目前估值高达 390 亿美元的人形机器人独角兽,Figure AI 此前的演示大多停留在光线充足、环境可控的样板间内。Helix 2.5 试图迈出关键一步:团队在旧金山湾区租下 30 套陌生住宅,将机器人直接运到现场,要求它完成整理客厅、铺床和折叠毛巾等家务。
Figure AI 表示,在没有针对这些住宅和具体物品进行微调或现场训练的情况下,30 套房屋中都出现了成功案例。然而,随着官方测试数据的公布,业内同行却给出了完全不同的评价。
与上一代 Helix 02 依赖具体工作环境的数据不同,Helix 2.5 采用了全新训练范式:模型从随机初始化开始,首先在 Figure AI 自建的人类行为数据集「Index」上进行大规模预训练,随后针对整理玩具、折叠毛巾和铺床三项任务进行行为适配。
随后,机器人被运往 30 套未曾采集过数据的住宅中进行测试。三项任务各进行了 140 次测试,共计 420 次:
综合完整任务成功率为 56%(成功 237 次)。在测试过程中,Helix 2.5 展现了一定的全身纠错能力,例如发现站位不合适时会主动后退调整。而在没有 Index 预训练的对照组中,任务成功率仅为 9%。
大语言模型之所以能吸引海量资本,关键在于其 Scaling Law(尺度定律)的可预测性——增加计算量、参数与数据,性能损失就会沿稳定曲线下降。但在机器人领域,数据昂贵且硬件异构,一直难以验证类似的规律。
Figure AI 宣称,团队首次在全尺寸人形机器人上测得了「人类到机器人迁移的 Scaling Law」。

实验显示,在固定模型大小与下游任务评估标准的前提下,人类行为数据集 Index 每翻一倍,模型预测动作的误差就会持续降低。为此,Figure AI 已与算力供应商 Nscale 签订协议,承诺投入 35 亿美元初始算力,计划部署最多 10 万块 NVIDIA Vera Rubin GPU。
在 Figure AI 的蓝图里,当前的失败仅仅是规模问题,只要持续堆叠算力与数据,成功率就会水涨船高。
然而,机器人行业的同行并不买账,质疑声主要集中在可靠性与技术路线上。
Sunday Robotics 联合创始人兼 CEO Tony Zhao(ACT 与 ALOHA 系统核心作者)直言不讳:「有用的工作=泛化+可靠性。」他指出,237 次成功的同时意味着 183 次失败。在家庭环境中,接近一半的失败率不仅意味着体验糟糕,还伴随着打碎物品或伤害人宠的安全隐患。

前 Synapticon CEO Nikolai Ensslen 的评价则更为直接:这组数据本身就证明了纯模仿学习系统根本无法实现真正泛化。在机器人工程中,换一个环境且每次都能成功才叫泛化,44% 的失误率说明系统缺乏对三维物理世界和任务语义的底层理解。
传统视觉-语言-动作模型往往是在拟合视觉特征到动作轨迹的映射。一旦遇到训练分布之外的扰动,系统很容易陷入机械重复或崩溃。争议的焦点在于:光靠扩大人类行为数据集,究竟能不能让 56% 跨越到可商用的 90% 以上?还是说,模仿学习本身存在难以突破的隐形天花板?这仍待整个具身智能行业给出答案。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断