AI 读过一切,却没经历过任何事。Ropedia 发布新一代多模态采集系统 HOMIE Gen2,用 380 克头戴设备完整记录人类的动作、意图与环境变化,将真实世界经验工业化,为具身智能补上最稀缺的数据训练。
8 月中旬,南洋理工大学副教授、Ropedia 首席科学家刘子纬在新加坡一场公开演讲中抛出一个问题:为什么读过整个互联网的 AI,进了物理世界,却连一杯咖啡都冲不好?他的回答是:“AI 读过一切,却几乎没有经历过任何事——它从未真正冲过一杯咖啡,自然也不知道该怎么做。”
这种分裂在今天的 AI 身上随处可见:感知模型能把冲咖啡的教程讲得头头是道,生成式模型能合成一段以假乱真的冲咖啡视频;可一旦真的伸出机械臂,同样的智能常常连一次可靠的抓取都完不成。能听懂、能想象,就是做不好。这道裂缝正卡着整个具身智能行业。

就在这场演讲之后不久,Physical AI 公司 Rodepia 发布了新一代多模态采集系统 HOMIE Gen2。这套关于“经验”的判断,最终落到了一台约 380 克的头戴设备上:让 AI 从人类真实行为中,补上缺失已久的经验。CEO 陈昭熹有个形象的说法:学做一道菜,只看别人做的视频,可能知道成品长什么样;但亲手做过,才会知道什么时候下锅、该用多大力、食材发生了什么变化。HOMIE Gen2 要做的,就是把真实操作中的动作、时机和环境变化完整记录下来,让机器人学到的不只是结果,还有过程。

HOMIE Gen2 背后的思路,可以追溯到刘子纬更早的研究。他的团队做过一个名为 EgoLife 的项目:六个人共同生活七天,录下约五十小时的第一视角视频,并同步了外部视角、音频、视线与动作。模型要回答的不是“画面里有什么”,而是“那罐咖啡豆昨天被谁挪去了哪里”“上一次冲煮为什么失败”。用他的话说,这是在为物理世界构建“记忆层”。真正的 Physical AI 要能跨越数小时、数天甚至不同的人去推理,这是语言模型从未面对过的时间尺度。
除了时间,他还强调另一个常被忽略的约束:行动。今天的 AI 可以慢慢想,物理世界却不会停下来等。他称之为“延迟约束下的智能”:数字智能只需要答对,Physical AI 必须在毫秒之间答对。跨越时间的记忆、延迟约束下的行动,两条线索指向同一个结论:Physical AI 需要的,不只是关于世界的描述,而是真实发生在物理世界中的完整经验。

每一代 AI 系统都从不同的数据基本单元中学习。感知 AI 把像素变成标签,回答“那里有什么”;生成式 AI 把提示词变成内容,回答“它可能是什么样子”;Physical AI 的基本单元是完整的经验片段,回答“如果我这样做,会发生什么,下一步该怎么办”。
Ropedia 给“经验”划出了明确的边界:视频不是经验,RGB、动作捕捉、深度中的任何单一模态都不是;只有当动作、意图、环境、时序上下文与多模态信息同时在场、互相对齐,一段记录才配得上这个词。语言模型学的是人类写下来的东西,Physical AI 要学的,是人类做了什么、世界如何回应、接下来又发生了什么。文字可以被爬取,经验却必须在真实世界中发生。

Ropedia 将这一趋势概括为 Human Experience Scaling Law:机器人能力随着高质量人类经验的规模化而提升。人类不是要被过滤掉的噪声,而是最能理解物理世界的老师。业内进展也验证了这一点:Generalist AI 发布的具身基础模型 GEN-1.5 展示了物理提示(physical prompting)——把几秒钟的人类演示放进上下文,机器人不经重新训练就能上手新任务,单次演示平均成功率约六成。公开研究同样显示,即便只用单摄像头第一视角视频,从两万小时堆到百万小时,规模定律始终成立。竞争的焦点,正从“能不能采到”转向“采得够不够完整”。
要把这样的经验真正记录下来,HOMIE Gen2 从三个关键词出发:
沉浸式人类经验:设备用 4 目全景实现 360° 覆盖,外加 4 路空间音频,把人看到的、听到的、身处的环境一次收齐;多台设备还能同步作业,从不同的人、不同的视角记录同一个场景。
丰富的多模态理解:设备把十余种模态压进同一时间轴、同一坐标系,多传感器同步精度做到 50µs。这意味着任何一帧画面,都能找到与它严格对应的动作、深度与标注。
开箱即用的高精度训练级数据:据 Ropedia 基于金标准样本集的测试,空间定位平均相对误差约千分之二,手部 21 关键点动捕平均误差 4.68 mm,深度范围误差低于 2.5%,动作语义标注准确率 96.0%。

硬件本身也为“随时随地采经验”做好了准备:不需要外部布置,可以在家庭、工厂、商场等开放环境里全天候工作。部署速度比上一代快约 10 倍,采集成本降到约 1/12.5。一台约 380 克、可连续采集约 13 小时的设备,承担的是整套体系最前端的一环:尽可能完整、准确地把真实世界中的人类经验记录下来。

刘子纬认为:“如果经验是稀缺资源,那么就必须有人把它工业化。”对 Ropedia 来说,起点不是模型,而是采集——采集那一刻丢掉的信息,后续任何算法都补不回来。CEO 陈昭熹把它称作“物理世界进入数字世界的入口”。
真正把经验变成可规模化生产的数据资产,靠的是一整套自我演进的基础设施,自下而上分为三层:硬件采集经验,数据基础设施加工经验,模型理解经验并反哺整个系统,最终以 Xperience Dataset 的形式向客户交付。模型层在自有数据上训练统一多模态模型,既自动标注新流入的经验,也部署回硬件,为下游策略模型提供能力。
免费获取企业 AI 成熟度诊断报告,发现转型机会

这套流程已有产出。此前发布的 Xperience-10M,包含约 1000 万个真实世界交互片段、1 万小时带音频的第一视角视频,总规模接近 1PB。数据交付也不是终点:模型训练中暴露的能力缺口,会反过来影响下一轮采集什么、如何采集,形成持续反馈。
过去十二个月,硬件更迭了四次:3D 打印原型机“竹蜻蜓”验证了采得到;第二代 R-Ego 卖出第一台;Gen1 走向产品化,撑起 Xperience-10M;今天的 Gen2 完成规格与佩戴系统的整体升级,让人类经验的大规模工业化生产成为可能。
CEO 陈昭熹曾在访谈中提到,HOMIE 的形态在未来几代还会继续演化,但核心能力不变:一台随身的可穿戴 AI 助手,随时随地帮助人类理解身边的世界。据了解,这家公司已服务超过 20 家全球机器人及基础模型团队。
那场演讲的结尾,刘子纬给行业留了一句话:“不要只是构建更大的大脑,而要构建更好的经验闭环。”过去二十年,互联网把人类知识数字化,喂出了大语言模型;Ropedia 押注的是下一个二十年:把人类经验数字化,喂出真正能做事的机器。
原文链接:雷锋网
本文由前途科技编辑整理
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断