针对机器人训练数据短缺瓶颈,NVIDIA研究科学家李柏依展示了两项新成果:MultiGen利用生成模型为物理仿真补充对齐的声音感知;DexImit则直接从单目人类视频中重建4D交互轨迹,实现双手灵巧操作的真机零样本部署。
机器人要走进现实环境,所面对的信息远比纯视觉复杂得多。在倒水时,水流注入的声音可以帮助预判容器何时溢满;碰撞发生时,不同材质会发出独特的清脆或低沉声响;哪怕是在不同容积的房间里,空间回声也能直接指示物理距离。
然而,这些人类赖以判断的多模态感知,以及诸如削皮、切菜、叠杯等复杂的双手灵巧操作,在机器人训练阶段都面临极高的数据采集门槛——真实世界采集成本高昂,而传统物理仿真模拟器虽然能模拟逼真的几何物理运动,却往往缺失声音等辅助感知模态。

在相关学术研讨会上,NVIDIA Research 科学家、UC Berkeley 研究员李柏依(Boyi Li)分享了团队在具身智能高效多模态学习上的两项代表性工作:MultiGen 与 DexImit。她的核心解题思路可以概括为两点:模拟器里没有的声音,可以通过模型“生成”出来;机器人难以直接采集的双手操作数据,可以直接从人类单目视频中转化。
当前的物理模拟器已经能逼真模拟倒水等流体物理过程,但画面是完全静音的。机器人如果仅依赖视觉,面对不透明容器或光照剧烈变化的环境时往往极其脆弱。

李柏依团队的核心思路是:“Don’t just simulate physics – generate perception”(不只模拟物理过程,更要生成感知)。

团队利用互联网上大量包含真实音视频的野外数据,训练了一个基于扩散模型(Diffusion Model)的音频生成模型。该模型能够输入一段无声视频,自动生成在时间维度上精准对齐的音轨。
随后,研究人员将该模型接入物理模拟器生成的流体与交互视频中,补齐了时间对齐的音频信号,由此合成出一套低成本的多模态仿真数据集。

基于该数据集训练的多模态机器人策略,在真机部署测试中展现出了显著的鲁棒性:

解决感知生成的缺失后,另一个瓶颈在于动作策略:双手灵巧操作(Bimanual Dexterous Manipulation)对通用人形机器人至关重要,但真机遥操作与示范采集极其昂贵。
与稀缺的机械手操作数据相比,人类日常生活的单目操作视频近乎无穷。团队提出的 DexImit 框架,旨在直接从单目人类视频中学习高自由度的双手灵巧操作。

DexImit 的完整处理管线包含四个阶段:


实验结果表明,DexImit 在切苹果、叠杯子、倒饮料等兼具长时序、强接触(contact-rich)与精细操作的任务上均能生成物理合理的轨迹,并成功完成了真机零样本部署(Zero-shot Real-world Deployment)。
免费获取企业 AI 成熟度诊断报告,发现转型机会

在演讲与现场问答环节中,李柏依也指出了 DexImit 当前的演进瓶颈:
通过 MultiGen 与 DexImit 两项工作可以看出,具身智能正在经历从“纯粹模拟物理环境”向“主动生成所需感知与交互数据”的转变。将生成模型的先验与仿真环境结合,有望成为打破具身数据壁垒的关键路径。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断