清华AIR与域变换联合发布Zeva,一种支持上下文内因果学习(ICCL)的具身自进化模型。它在参数完全冻结的情况下,从交互经验中持续学习,将基准任务累计成功率从26%提升至73%,并支持一次人类演示学会新操作。
清华AIR与域变换联合发布Zeva,一个参数完全冻结、却能在部署中持续进化的具身模型。在RoboCasa365基准上,它的累计成功率从26%提升到73%;在真实化学实验室,机械臂越用越稳;一次人类演示,就能让模型学会新操作。Zeva称得上是首个实现上下文内因果学习(In-Context Causal Learning,ICCL)的具身WAM。
具身智能的真正瓶颈,是模型到了现场能不能越做越好。传统思路下,想让机器人适应新环境,通常要重新采集数据、微调模型或做test-time training。但这些方法依赖梯度更新,速度慢、成本高,还可能破坏已有能力。另一类in-context learning方法可以让模型根据演示或任务描述调整行为,但主要解决“任务理解”,无法让模型从自己的动作后果中学习物理因果。
以往的跨域迁移,如sim-to-real、跨本体迁移、跨任务泛化,本质上是在不同域之间搬运“任务经验”。Zeva更进一步:它迁移的是“动作与状态变化之间的因果关系”。
同一个模型,在仿真中学到的物理因果可以带到真实机械臂;一次尝试中积累的失败经验,可以指导另一次相似物理过程的尝试;人类的一次演示,也可以直接变成机器人的因果上下文。
这种跨域迁移通过上下文完成:模型在上下文中推断环境因果结构,并把因果知识用于下一次动作生成。这就是Zeva定义的In-Context Causal Learning。

在每个环境步,Zeva提取三类信号:视觉状态、动作编码、观察到的状态变化。它们被递归编码为Causal Interaction State,并进一步投影为Phase Token和Causal Interaction Signal。这些因果信号被组织成双时标上下文:Brief Interaction Trace负责当前尝试内的连贯执行,Persistent Interaction Memory跨尝试累积可复用经验。
决策时,Zeva检索与当前任务阶段匹配的交互证据,构造Causal Prompt,注入冻结的Cosmos3动作生成模型。整个过程零梯度更新。
Causal Transition Encoder让模型显式学习动作引起的状态变化。训练目标包括因果效果预测、任务聚类和阶段进度,让Causal Interaction Signal真正携带物理因果信息。
双时标因果记忆让模型跨尝试自我进化。Brief Interaction Trace保证当前执行的连贯性,Persistent Interaction Memory把失败、修正和成功沉淀为后续可检索的上下文。同一个模型在多次尝试中越用越强。
In-Context Policy Injection通过Causal Prompt把任务、阶段和交互证据注入生成模型。它不参与flow loss,只作为条件影响后续动作。这是“不调权重也能进化”的关键设计。
和传统Test-Time Training相比,差异很直接:

在RoboCasa365-Atomic5上,Zeva平均成功率76.8%。更重要的是部署后的自进化曲线:累计成功率从Evolve 1的26%提升到Evolve 4的73%。
在真实化学实验室ChemLab-Evo上,三个原子任务同样单调增长:Pick Up Test Tube从65%到100%,Place Beaker从25%到70%,Pour Water从30%到80%。
Zeva还支持one-shot human demonstration enhancement:一次人类演示初始化Persistent Interaction Memory后,模型无需微调即可复现关键操作。量化结果显示,人类warm-up在Place Beaker上最高带来20个百分点提升,在Pour Water上带来15个百分点提升。



Zeva的深层意义,是把具身模型的scaling从“参数空间”延伸到“上下文空间”。传统scaling通过扩大数据、参数、算力来提升能力;Zeva展示的另一种scaling,是在部署过程中不断增加可供模型消费的因果上下文。
每一次尝试都会产生新的交互证据,这些证据被压缩为Causal Interaction Signal并进入双时标记忆。模型每多一次交互,就多一次对当前物理环境的“隐式系统辨识”。物体质量、关节约束、接触特性、摩擦条件,都可以通过交互信号被隐式估计。冻结策略因此可以在不改变参数的情况下,不断逼近当前物理系统的真实动态。
Causal Interaction Signal是一个效应空间中的紧凑表示,直接编码物理效应。跨任务effect retrieval实验显示,不同物体、视角和任务指令下的等价物理效应,会在该空间中彼此靠近。这意味着模型学到的不只是具体任务的做法,更是“这类物理效应如何产生”,天然支持跨域迁移。
如果把VLA看作“任务理解与动作生成”的基础设施,世界模型看作“经验想象”的基础设施,那么Zeva定义的ICCL就是“现场因果学习”的基础设施。它把部署从“能力消耗”变成“能力积累”,把每一次失败从噪声变成可检索的因果证据。
如果ICCL成立,具身智能的scaling将多出一条独立于参数规模的曲线:交互次数越多,因果上下文越丰富,模型对当前物理域的辨识越准,任务成功率越高。
清华AIR与域变换联手发布的Zeva,重新定义了具身模型的自进化:不调权重,也能越用越强;不重新训练,也能从一次人类演示中学会新操作。域变换开启的,可能是一条新的scaling路径:让机器人在真实物理世界中,自己学会因果,自己完成进化。
论文:Zeva: In-Context Causal Interaction Memory for Embodied Action Generalization
项目主页:https://air-embodied-brain.github.io/Zeva/
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断