外滩大会上,多位学者与产业界专家围绕世界模型与具身智能展开深入探讨。面对真实物理环境的低容错率与高泛化需求,世界模型正从视频生成转向动作预测与闭环控制,但也面临高质量数据成本与商业化闭环考验。
当人工智能从屏幕内的对话与编程,迈向真实世界的感知、决策与执行,自动驾驶与机器人等物理 AI 面临着更严苛的考验:模型不仅要理解空间关系,还要在行动前推演未来后果,并根据反馈实时修正。
近期举行的外滩大会上,香港大学计算与数据科学学院主办了“世界模型是 AI 走向物理世界的新大陆吗”见解论坛,来自高校与业界的专家围绕世界模型的技术边界、具身智能路径与商业化挑战进行了深入交流。

香港大学计算与数据科学学院创始院长马毅指出,AI 的飞速发展正打破教学、科研与产业转化的边界,需要更紧密的产学研协同。

马毅认为,传统计算机视觉主要解决三维重建与物体识别,而今天的世界模型已延伸至机器人在开放环境中的认知、学习与交互。这一演进为前沿研究走向产业落地开辟了新空间。
大晓机器人董事长、商汤科技联合创始人王晓刚提出,具身智能要走向通用,必须突破数据与模型的双重瓶颈。单一任务反复采集真机数据的成本难以持续,大晓推出的 ACE 研发范式通过穿戴式设备采集人类行为数据并与真机融合,显著降低了新任务的适配门槛。

在模型设计上,王晓刚介绍了“理解、生成、预测”一体化架构:理解任务状态,生成推演后果,预测指导控制。这三项能力共享特征并形成闭环,使机器人能够自主应对如洗衣等长程复杂任务。大晓正以“一脑多形”方案适配不同机器人本体,在即时零售与酒店运营等场景推进落地。
生数科技联合创始人兼 CEO 骆怡航表示,通用世界模型必须具备“理解-预测-行动”闭环,单独的视频生成或策略控制都只是局部能力。

生数科技提出了涵盖模拟生成、实时交互、物理行动、自主规划及多智能体协同的五级路线,并在现场发布了面向灵巧操作的通用世界模型 Motus2。该模型将触觉信息纳入统一建模,通过动作采样、后果推演与价值评估形成闭环,并引入记忆机制以应对遮挡与连续操作挑战。骆怡航坦言,长期记忆与高效部署仍是通向自主智能体需克服的核心难题。
圆桌讨论环节由香港大学副教授罗平主持,杨言超(忆生科技/港大)、石野(瞬适科技/上科大)、朱政(极佳视界)与李天羽(源策未来)共同探讨了世界模型的技术本质与落地难点。

定义与能力门槛:专家们认为,具身世界模型区别于视频生成的关键,在于与真实物理环境的双向交互及持续记忆进化。传统物理仿真包含确定性规律,而数据驱动模型则能吸收更多未知变化,两者具备互补性。
驱动因素与高估风险:李天羽强调,物理 AI 容错率极低,部署必须保证高可靠性。杨言超提醒,“生成逼真”绝不等于“理解正确”,机器人交互的关键在于学到对行动有效的结构。朱政则指出,模型规模扩展必须算清算力账与商业回报账。
应用场景取舍:世界模型并非所有场景的必需品。杨言超与石野认为,在现实试错成本高昂、环境重置繁琐的环节,事前推演极具价值;而对于变数较少的简单任务,现有 VLA 模型已足以应对。
从生成虚拟画面到可靠操控实体硬件,世界模型的价值最终需要在开放场景中验证。降低适配成本、实现从失败中持续学习,将是该路线走向商业成功的必经之路。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断