针对具身智能领域盲目崇拜数据规模的现状,学者在IROS大会上指出,海量数据并不等同于高信息量。从无人机滑翔、多机低带宽协同到机械臂策略过拟合,按需采集关键信息与针对性策略修复,远比无差别堆砌数据更有效。
在生成式 AI 浪潮下,机器人研究正在从传统控制范式向端到端学习加速迁移。随之而来的,是一股对数据规模的盲目崇拜——不少人坚信只要数据足够庞大,就能自然通往通用具身智能。然而,在 IEEE/RSJ 智能机器人与系统国际会议(IROS)上,昆士兰大学学者 Jen Jen Chung 结合多年研究指出:并非所有数据都具备同等价值,盲目堆砌冗余数据不仅无法提升性能,甚至会导致系统决策失能。

Chung 强调,海量数据并不等同于高信息密度。在通往自主系统的演进过程中,决定智能上限的关键在于数据的质量与信息增益,而非绝对规模。

在无人机自主滑翔研究中,固定翼无人机需要像鸟类一样从风场上升气流中汲取能量以延长滞空时间。这一任务的底层逻辑是:飞行时间越长,探索“状态-动作空间”的机会越多。

然而,探索本身具有实体代价。探索未知空间需要消耗无人机有限的能量储备,如果进行盲目、均匀的无差别采样,不仅浪费资源,还可能拖慢学习进程。实验分析表明,当飞行空速超过特定阈值后,无人机将直接穿过气流而无法截留能量,净能量收益归零。当控制策略明确该区域无增益后,继续在此采集更多数据对策略优化毫无帮助。
这一原理同样适用于未知代价场中的路径规划。算法的终极目标是寻找两点间的最优路径,而非完整重构整个地图。只要预判某处的观测不会改变对全局最短路径的判断,该次采样便属冗余。

在分布式多机器人系统中,盲目灌入数据往往会带来更严重的后果——网络拥堵与系统瘫痪。真实环境中的无线信道面临严重的带宽瓶颈与高延迟,向所有节点全量广播所有观测数据并不现实。
Chung 团队提出了衡量数据共享价值的核心准则:“这一项信息是否会改变接收方的行为决策?”

以多机协同防碰撞为例,只有当自身对邻近个体的轨迹预测置信度不足时,才触发状态查询与通信。而在协同建图场景中,直接传输详尽轨迹会造成信道过载,团队引入布隆过滤器对遍历状态进行高密度哈希压缩。针对有损压缩产生的误报率,通过对每次通信引入独立“加盐”机制打破关联性,利用贝叶斯推断跨周期融合多源信息,在低带宽占用下依然保证了极高精度的全局地图同步。

此外,团队借鉴网络流媒体思想,开发了渐进式多细节层次的流式传输方案。机器人无需等待完整数据包接收完毕即可先行解码、即时决策,在弱网和丢包环境下表现出远超全量同步机制的系统弹性。


当前机器人策略学习普遍尝试通过喂入海量多模态数据来“炼”出通用技能。但在复杂的富接触装配任务中,这种范式遭遇了现实瓶颈。

在零件装配实验中,机械臂被输入了包含 RGB-D 双模态视觉、末端六维力矩传感器读数以及本体关节状态的全维度数据。然而部署后发现,机械臂仅机械地重复示教轨迹,甚至在料盒空置时仍旧执行插入动作。这说明模型彻底无视了视觉与力觉信号,单纯依据关节本体感觉死记硬背示范动作,产生了严重的过拟合。

传统解法通常是追加更多人工示教数据,但 Chung 与澳大利亚联邦科学与工业研究组织的合作成果表明,微小的光照或背景扰动就会引发策略崩溃,盲目扩大标称数据量无法解决泛化问题。

为此,研究人员转而分析策略模型内部的微观变化,比对在标称场景与扰动漂移场景下策略动作分布的偏移,映射出诱发策略崩溃的动作漂移空间分布。随后,团队针对性反向检索能够覆盖特征盲区的特定场景样本进行“策略修复”。

实验表明,在完全相同的示教数据预算下,定向选取修复性样本比单纯扩增数据规模带来的泛化性能提升要显著得多。

机器人智能体的进化,不应演变为单纯比拼数据吞吐的数字竞赛。无论是无人机、多智能体协同,还是端到端控制模型,唯有聚焦高信息密度的核心样本与决策相关度,才能真正构建起兼具鲁棒性与泛化能力的自主系统。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断