清华大学智能产业研究院(AIR)首届博士生李健雄创立具身智能公司本溯智能,并获五源资本领投。团队避开以语言为中心的主流 VLA 路线,押注动作原生的上下文学习具身基础模型,力求让机器人在新场景下免于重新训练。
清华大学智能产业研究院(AIR)首届博士生李健雄已完成学业并创办具身智能企业「本溯智能」(BASAL Intelligence)。目前,该公司已完成新一轮融资,由五源资本领投,常春藤资本、线性资本、华山资本(WestSummit Capital)跟投。
本溯智能团队核心成员包括首席科学家、清华 AIR 副教授詹仙园,以及 7 名长期合作的青年研究学者。与行业普遍采用的“预训练基模+后训练部署”范式不同,本溯智能选择押注动作原生(Action-native)的 In-Context 具身基础模型,目标是让机器人在面对全新场景时无需重新微调,直接在现场完成自主学习与适应。
当前具身智能的主流路线,主要依赖针对每个任务进行后训练与专门部署。这种模式在工厂高度标准化的产线上能够落地,但环境、物体或操作流程一旦变动,往往需要重新采集数据并重新微调模型。面对长尾任务,边际部署成本急剧攀升。
本溯智能认为,这一现状本质上仍是工业自动化的延续,并非真正的具身智能。真实世界中与物理环境交互的动作信号,很难被自然语言完整描述。现阶段以语言为中心的视觉-语言-动作(VLA)模型,在执行精细操作与跨场景泛化时存在先天瓶颈。
团队给出的解法是让机器人具备现场学习能力:遇到未见过的场景、任务或机器人本体时,机器人只需通过极少量的人类示范与自主试错,便可在数分钟内自适应环境变化,无需重新训练网络权重。

本溯智能主张回归智能决策的第一性原理,将“动作”作为模型的核心表达介质,直接学习物理动作、环境反馈、失败纠偏与示范动作之间的动态映射。
在该架构中,模型的大部分参数容量分配给动作生成,借助长上下文窗口(Context Window)组织连续物理交互过程,使机器人能基于过往动作与试错反馈持续修正决策。相比自然语言,动作更能触及物理世界交互的本质,而 In-Context Learning 则赋予了模型在部署现场即时进化的空间。
支撑该体系的技术底座包括两项核心自研成果:
从预先编程走向即时适应,不仅是技术范式的转变,也直击具身机器人规模化落地的核心成本痛点。若该技术路线顺利跑通,机器人的综合部署成本将随交互经验的积累而逐步降低。团队当下的首要课题,是在更多真实的硬件本体与复杂任务中,持续检验数分钟现场学习的鲁棒性。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断