具身智能迈向“ChatGPT时刻”面临千万小时级的真实动作数据缺口,可用数据严重供不应求。面对真机遥操作的高昂成本与场景限制,业界开始通过轻量硬件与众包采集模式破局,重塑物理AI基础设施。
戴上一台轻量化头环,记录日常做饭、叠衣服、整理收纳的动作并上传系统,普通人每月即可获得数千元的兼职报酬。这种新型众包背后,是正在悄然升温的具身智能训练数据争夺战。
大语言模型依靠互联网上沉淀四十余年的海量文本完成预训练,而机器人要学会在物理世界中拧螺丝、修水管、做家务,却面临一个核心困境:物理世界中不存在现成且系统记录人类行为的数据库,一切必须从零构建。
![]()
过去两年,人形机器人展现了翻跟头、舞蹈和越野跑的机械运动能力,但要真正进入工业制造、商用服务和家庭生活,仍受困于缺乏真实环境中的动作交互数据。
中国信通院人工智能研究所等机构发布的《具身智能训练场研究报告(2026年)》指出,具身基础模型要迎来类似大语言模型的质变阶段,至少需要千万小时级的真实场景数据。若单纯依赖真机采集,按照每台机器人每天采集2小时、年工作300天计算,需要超过两万台机器人连续运行整整一年。而目前全球可用、合规的高质量真实数据仅在数十万至百万小时级别,供需缺口超过99%。
数据的规模效应已在海外被验证。今年9月,美国人形机器人企业Figure发布Helix 2.5模型,并在未做现场微调的情况下,在旧金山湾区30套陌生住宅内进行盲测。结果显示,经过人类行为数据集预训练的模型,其任务完成率达到56%,而从随机权重初始化的对照组成功率仅有9%。这表明,大规模人类行为预训练能够显著提升机器人在未知环境下的泛化工作能力。
与此同时,行业对数据的需求正从几十万小时快速跃升至千万小时预算级别,且需求重心正逐步转向修车、管道维修、专业装配等长尾高难度场景。
在数据采集路径上,业界此前普遍依赖真机遥操作——由操作员头戴VR或手持外骨骼手柄控制机器人完成动作示范。该方案采集的数据与机器人本体直接对齐,但扩张成本极其昂贵。
截至2026年年中,全国已建成及规划中的具身智能训练场超过100家。这类训练场属于典型重资产运营,单部署100台本体设备的采购成本就达数千万元,且环境大多人工搭建,任务重复度高,很难覆盖家庭和真实工厂的复杂工况。
更为核心的制约在于“场景资源”。业内普遍认为,采集设备和云端系统可随资本投入迅速复制,但真实物理场景的进入门槛却极高。如何合规进入工厂、酒店、餐厅和私人住宅,同时解决现场生产安全、人员隐私及数据脱敏,是规模化开采数据的核心难点。
此外,行业早期往往要求采集人员放慢动作以适应算法识别,但这导致采集到的动作分布严重失真。大量清洗后,部分采集管道最终能被模型使用的有效数据率不足10%。
为了打破重资产遥操作的瓶颈,本土具身智能数据服务商开始探索“无本体、轻量化”的众包采集方案。以觅蜂科技为例,其尝试通过低门槛硬件设备,将数据采集分发给普通人。
该方案通过自研的超广角头戴式视觉设备与无线微型手部追踪器(Gripper),实现对视线、手部轨迹和触觉交互信息的毫秒级记录。采集者无需购置昂贵本体,在日常工作与家务中即可完成标准化录制。采集到的多维数据经云端引擎切片、标注及三维空间重建后,由评估体系在语义、轨迹和物理交互层面进行分级质检,使得综合数据可用率大幅提升。
目前,这种分布式模式已在家庭、零售、餐饮和制造等场景铺开数万套设备,累计沉淀百万小时真实数据,并已向腾讯Robotics X实验室、蚂蚁灵波等机构输出。同时,通过联合酒店、养老院、医疗及制造供应链企业共建场景数据联盟,将具体采集任务拆解为精细货架,以匹配算法端日益严苛的数据需求。
具身智能的下一阶段竞争,正在从单一的模型参数演进转向真实世界的规模化感知闭环。谁能以更低成本、更高质量把人类日常生活与专业操作转化为机器可理解的“教材”,谁就将掌握机器人产业化的核心基石。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断