具身智能资本狂热与行业质疑并存。伯克利Allen Yang博士深度剖析通用机器人技术栈瓶颈,指出具身智能需先达标动物级行为智能,不必盲目迷信世界模型,并阐明机器人在工业与竞技场景的商业拐点。
二级市场经历剧烈回撤,一级市场却热钱涌动,具身智能赛道正陷入一场剧烈的分歧之中。针对当前人形机器人热潮中的狂热与质疑,加州大学伯克利分校ROAR项目主席、Hitch Open联合创始人Allen Yang博士围绕技术栈瓶颈、世界模型边界以及商业落地给出了深入解答。

很多人将具身智能(Embodied AI)简单等同于“AI加一个身体”。Allen Yang认为,更准确的定义在于用物理形体改变现实环境。扫地机器人、自动驾驶汽车、特种作业机械都属于具身智能,终极形态才是人形机器人。而会写代码、下棋的大语言模型,如果不直接驱动物理世界,则不算狭义上的具身智能。
大语言模型的负担是算力消耗大、训练周期长。如果具身智能的核心能力脱离对大语言模型的依赖,落地反而更快。动物没有语言符号体系,但松鼠可以灵巧爬树、猎豹可以高速奔跑。提高物理生产力,语言并非前置条件。动物的DNA就像一个成熟的预训练模型,让它们能在现实世界实现少样本甚至零样本学习。
打造通用机器人通常包含五层技术栈:底层硬件(本体与灵巧手)、感知、小脑(运动控制)、大脑(任务规划)以及最顶层的训练(数据与仿真)。

如果目标是扫地机或自动驾驶,多项技术已经成熟;但若期望人形机器人完成看护、复杂作业等高危劳动,五层技术目前均存在显著卡点:
世界模型(World Model)是通往空间智能的探索路径,但并非机器人的唯一解。自动驾驶并没有等待生成式世界模型成型,而是直接采集真实道路的物理模型;工厂产线定制化极高、公差精细,通过严格的工程规则即可运行。

世界模型真正不可替代的场景,是那些无法规模化公开采集数据的私密与非标环境,例如千家万户的居家布局和医院病房。而在具有明确规则、能够海量获取数据的场景中(如赛事竞技、公共道路行驶),依赖世界模型进行生成的紧迫性要低得多。
历史上的技术拐点往往通过做减法实现。深蓝战胜国际象棋冠军、AlphaGo攻克围棋,都不是以制造一个“全能的人”为目标。具身智能的破局点,同样在于选定物理规则清晰、变量可控的具体项目,实现对人类最高水平的超越。
例如乒乓球项目,规则标准明确,受牛顿力学支配,球体形变极小,机器人握紧球拍后手的自由度问题被大幅压缩。在这些约束边界内探索软硬件极限,能以最快速度完成技术收敛并验证端到端系统的稳定性。
为什么人形机器人具备无可替代的战略价值?这取决于人类社会的生产力分布。全球统计数据显示,普通人每天与电脑交互的时间极为有限,其余大部分时间都在物理空间中活动。现有的家庭、办公楼和工厂完全是依照人体工学建立的,因此人形形态能覆盖的潜在替代空间最大。
硅谷常说的“夹起尾巴做人,不要做狗”,本质上是对商业化ROI的考量。机器狗的生态价值偏向伴侣或特定巡检,市场空间有限;人形机器人的目标则是直接替代三班倒岗位。
工业老板的核心逻辑是成本精确核算:只要一台全天候运转的机器人总成本比三班工人低一分钱,置换就会瞬间发生。单一工种、高人力成本的国家和地区将最先跨过这个财务临界点。

从赛场上的极限性能验证,到走进真实商业场景,具身智能还需跨过两道鸿沟:
技术演进具有明确的历史规律。西方在算力与顶层算法探索上具备优势,亚洲在精密制造、供应链集成和场景数据上不可或缺。具身智能的最终成熟,仍将建立在软硬件生态的深度配合之上。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断