Figure、Dyna 与亮源新创近期公布多项突破,证实通过预训练大规模人类行为视频,机器人动作预测误差呈幂律下降,真机执行成功率显著提升,标志着人类经验正成为具身智能可规模化扩展的核心数据资产。
机器人如何像大语言模型一样迎来真正的规模定律(Scaling Law)?行业正在将筹码押向人类行为数据。
近期,Figure 将搭载 Helix 2.5 系统的机器人带进湾区 30 个陌生家庭,在不针对新环境重新训练的条件下执行收拾客厅、叠毛巾等家务。消融实验显示,采用 Index 人类行为预训练的模型完整任务成功率达到 56%,而随机初始化模型仅为 9%。同时,随着预训练数据规模翻倍,动作预测损失规律下降。

这引发了具身智能领域的核心追问:人类经验能否像文本之于大模型那样,成为一种可预测下游收益、能持续扩展的机器人预训练底座?
Figure 并非唯一在此发力的团队。此前 Dyna Robotics 发布的 Dyna-2,分别使用 1000 小时到 100 万小时的第一视角人类视频完成预训练,再经过相同的机器人后训练,适配到 14 个真实任务。随着规模递增,四档模型的平均归一化表现从 20% 稳步提升至 53%,首次证实了从人类视频规模化到真机闭环执行的连续迁移链条。

进一步的消融实验表明,单纯预测动作容易导致过拟合,而结合视频世界建模、增加无动作标签的纯视觉人类经验,跨本体表现才会稳定单调提升。这说明,数据形态与训练任务的定义共同决定了规模效应能否成立。
在数据获取路径上,行业分化为截然不同的两条技术路线。
第一条路线以 Figure 为代表,选择搭建高可控的人类数据基础设施。Figure 认为通用机器人所需的数据并不存在于现成网络视频中。为此,它通过创作者网络组织人员在真实场景录制任务,平台已收集超过 1600 万条视频,并配以严格的质量过滤与去重重平衡流水线。此外,Figure 与 Nscale 展开算力合作,计划部署最高 10 万颗 GPU。

这种做法重金投入,但能主动控制数据分布,哪里不足补哪里。
第二条路线则尝试直接吸收海量互联网公开视频。互联网视频拥有极高的多样性,但存在遮挡严重、缺乏相机标定、无触觉与本体感知信号等巨大领域差异(Domain Gap)。CoMo、HuRo 等方案尝试将视频动作“机器人化”或学习潜在表征。
亮源新创(Light Origins)更进一步,其技术报告展示了从纯互联网第三视角视频中学习的可行性。Light-O1 模型先从海量视频恢复结构化动作,再统一为人形动作表示,与视觉、语言信息联合进行自回归预训练,形成动作先验。

在 37.5 亿至 1200 亿 Token(约 10 万小时)的人类动作预训练中,随着规模扩大,下游适配的全身姿态和腕部预测误差在多款机器人本体上均呈现幂律下降,验证了迁移缩放定律(Transfer Scaling Law)。

目前学界与产业界观察到的“规模效应”存在不同层级:最底层是预训练本身的表征优化;中间层是适配目标机器人时的动作预测离线指标;最高层才是机器人执行真实任务的闭环成功率。

行业常以“数据小时数”来评估成本,但这并不完整。自主采集人类数据的物理成本看似高昂,但数据分布可控;互联网原生路线看似免费,但在动作恢复、滤波清洗、跨本体对齐和算力消耗上需要付出更高代价。
未来机器人能力的跃升,竞争重点不在于单纯囤积视频时长,而在于如何优化整条数据转化链条,以最低的端到端成本将人类物理世界经验固化为智能体可执行的能力。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断