深度机智正式开源物理AI基座模型PhysBrain 1.5,涵盖2B与8B版本。在28项基准测试中,8B版本以72.5分登顶全球开源榜首,与闭源顶尖模型GPT-6 Astra差距收窄至1分以内,为机器人走向物理世界提供了统一的系统底座。
物理AI正成为全球人工智能竞技的新赛道。大语言模型已经证明了其出色的思考和语言能力,但当模型尝试进入物理现实、操控机械臂时,瓶颈随之而来。在真实的机械臂测试中,顶尖模型在面对毫米级精细任务(如精准插槽)时,成功率往往急剧下滑。
通用语言能力难以直接填补精细接触与动力学控制的鸿沟。物理智能需要专门构建的基座模型。
针对这一痛点,中国AI公司深度机智正式发布并开源了物理基座模型PhysBrain 1.5,在具身感知、动作生成与未来预测等多维度上取得了关键突破。

评估具身智能的综合能力并不容易。深度机智在一组涵盖视觉空间感知、多视角理解、具身认知与规划、空间指向与可供性、视觉轨迹推理五大维度的28项公开基准上对模型进行了严格评估。
测评结果显示,PhysBrain 1.5-8B拿下了72.5的综合均分,位列开源阵营第一,并在其中14项指标中拿下开源最佳。相较此前较强的开源模型Hy-Embodied-VLM-1.0(66.0分)高出约6.5分。
更具突破性的是其与闭源模型的差距:PhysBrain 1.5-8B的72.5分,与GPT-6 Astra(73.3分)以及Gemini 3.6 Flash(73.0分)的差距已收窄至1分以内。

在分项测试中:
除8B主力版本外,团队同步开放了轻量级的PhysBrain 1.5-2B版本。在相同评测集上,2B版本取得66.6分,超越了此前表中所有参评的非PhysBrain开源大模型。这大幅降低了开发者本地部署和轻量化微调的门槛。
目前,PhysBrain 1.5的技术报告、2B与8B模型权重及评测工具包已全部上线 Hugging Face 项目主页 与社区开放测试。

过去的物理AI方案普遍采用模块拼接方式:感知模型看懂画面,动作模型规划轨迹,预测模型推断变化。拼装架构导致子系统间训练脱节,难以实现动态反馈。
PhysBrain 1.5采用了“Physical Loop”(物理智能循环)架构。团队认为,真正的物理智能是由“观察世界、理解空间、判断后果、执行动作、反馈修正”组成的连贯闭环。

PhysBrain 1.5将原本分散的三个核心环节收敛到同一个自回归模型中:
三个子任务在同一套框架内互为约束、协同优化,终结了多模块松散拼装的工程模式。

如果训练数据仅包含静态图片或孤立动作,模型便无法学会真实的物理交互逻辑。深度机智选择将人类真实经验作为预训练的核心来源。
团队构建了Ego360全景真实数据体系,通过全景第一视角视频记录周围环境,并同步保留操作者的身体姿态、手部轨迹和任务语音,使数据具备连续的任务推进与状态变化上下文。

配合Human-as-Humanoid转换框架,人类动作能够直接转译为机器人本体能够学习的控制量。在此前自研60自由度拟人体机器人Prime U的验证中,该方案的数据吞吐效率达到传统遥操作的4.8至7.2倍,并在多项任务中完成了从人类视频到真机执行的零样本迁移。

从全景数据采集(Ego360)、物理基座模型(PhysBrain)、动作转译框架(Human-as-Humanoid)到本体真机(Prime系列),深度机智打通了物理AI的全栈闭环。PhysBrain 1.5的开源,不仅展示了以人类学习范式构建物理智能的有效性,也为全球具身智能开发者提供了可对标顶尖商业模型的基础底座。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断