Zeva团队 投稿
量子位 | 公众号 QbitAI
模型不更新,能力却持续增长。
这是Zeva最反直觉的地方,也是清华AIR域变换联手给出的新答案。
在多个典型具身基准任务上,将冻结模型的累计成功率从26%提升到73%;在真实化学实验室,机械臂在多次尝试中越用越稳。
更关键的是,一次人类演示就能让模型“学会”一个新操作。
Zeva首个实现In-Context Causal Learning(ICCL)的具身WAM
它让模型可以在不更新权重的情况下,从自己的交互经验中持续学习。当这种能力逐步成熟,具身智能将迎来属于自己的“GPT时刻”
项目信息
项目名称:Zeva
发布机构:清华AIR、域变换
论文题目:Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
项目主页:https://air-embodied-brain.github.io/Zeva/

具身模型的自进化,为什么过去很难?
具身智能的真正瓶颈,是“模型到了现场能不能越做越好”。
传统思路里,想让机器人适应新环境,通常要重新采集数据、微调模型或做test-time training。
但这些方法依赖梯度更新,速度慢、成本高,还可能在适应新任务时破坏已有能力。
另一类in-context learning方法可以让模型根据演示或任务描述调整行为,但主要解决“任务理解”,并没有让模型从自己的动作后果中学习物理因果。
从“任务泛化”到“因果迁移”
过去我们谈跨域,更多是sim-to-real、跨本体迁移、跨任务泛化。这些方法大多依赖数据对齐或表征对齐,本质上是在不同域之间搬运“任务经验”。
Zeva更进一步:它迁移的是“动作与状态变化之间的因果关系”。
同一个模型,在仿真里学到的物理因果,可以被带到真实机械臂;在一次尝试里积累的失败经验,可以指导另一个相似物理过程的尝试;人类的一次演示,也可以直接变成机器人的因果上下文。
这种跨域迁移通过上下文完成。模型在上下文中推断环境因果结构,并把因果知识用于下一次动作生成。这就是Zeva所定义的In-Context Causal Learning。
示例一:从放置称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。
示例二:从称取试剂至称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。
示例三:从一次人类演示中完成上下文内因果学习。
Zeva:把“因果学习”装进模型上下文

△Zeva总体框架。模型通过Causal Interaction Extraction、Dual-timescale Causal Memory、In-Context Policy Injection,在不更新权重的情况下实现部署中自进化。图片来源:论文
Zeva是一个模型。它的Causal Transition Encoder、Dual-timescale Causal Memory、In-Context Policy Injection,都属于模型推理链路的一部分。
在每个环境步,Zeva提取三类信号:视觉状态、动作编码、观察到的状态变化。
它们被递归编码为Causal Interaction State,并进一步投影为Phase Token和Causal Interaction Signal。
这些因果信号被组织成双时标上下文:Brief Interaction Trace负责当前尝试内的连贯执行,Persistent Interaction Memory跨尝试累积可复用经验。
决策时,Zeva检索与当前任务阶段匹配的交互证据,构造Causal Prompt,注入冻结的Cosmos3动作生成模型。整个过程零梯度更新。
技术拆解:Zeva如何“以小博大”
亮点一:Causal Transition Encoder,让模型看见“动作→结果”。
模型显式学习动作引起的状态变化。训练目标包括因果效果预测、任务聚类和阶段进度,让Causal Interaction Signal真正携带物理因果信息。
亮点二:双时标因果记忆,让模型可以跨尝试自我进化。
BIT保证当前执行的连贯性,PIM把一次失败、一次修正、一次成功沉淀为后续可检索的上下文。同一个模型在repeated attempts中越用越强。
亮点三:In-Context Policy Injection,让冻结模型直接消费因果上下文。
通过Causal Prompt把任务、阶段和交互证据注入生成模型,不加额外噪声、不参与flow loss,只作为条件影响后续动作。这是“不调权重也能进化”的关键设计。
和传统Test-Time Training相比,Zeva的差异很直接:

数据说话:自进化+One-Shot人类演示增强
在RoboCasa365-Atomic5上,Zeva平均成功率76.8%,效果最优。
更重要的是部署后的self-evolution曲线:累计成功率从Evolve 1的26%提升到Evolve 4的73%。
真实化学实验室ChemLab-Evo上,三个原子任务同样呈现单调增长:Pick Up Test Tube从65%到100%,Place Beaker从25%到70%,Pour Water从30%到80%。
Zeva还支持one-shot human demonstration enhancement:一次人类演示初始化PIM后,模型无需微调即可复现关键操作。
量化结果显示,人类warm-up在Place Beaker上最高带来20个百分点的提升,在Pour Water上带来15个百分点的提升。

△RoboCasa365上,Zeva在模型权重完全冻结的情况下,累计成功率从Evolve 1的26%提升到Evolve 4的73%。图片来源:论文

△真实化学实验室中,三个原子任务累计成功率随尝试里程碑提升。模型参数未更新。图片来源:论文

△One-shot人类演示warm-up对三个原子任务的影响。虚线为有人类演示初始化,实线为纯自进化。图片来源:论文
为什么Zeva是一个新范式?
Zeva的深层意义,是把具身模型的scaling从“参数空间”延伸到“上下文空间”。
传统scaling通过扩大数据、参数、算力来提升模型能力。
Zeva展示的另一种scaling是:在部署过程中不断增加可供模型消费的因果上下文。
每一次尝试都会产生新的interaction evidence,这些证据被压缩为Causal Interaction Signal并进入双时标记忆。
模型每多一次交互,就多一次对当前物理环境的“隐式系统辨识”。
这里的理论基础是:模型可以把每个新场景的环境属性作为隐变量,在推理时从过去的动作-效果证据中推断出来。
物体质量、关节约束、接触特性、摩擦条件,都可以通过交互信号被隐式估计。冻结策略因此可以在不改变参数的情况下,不断逼近当前物理系统的真实动态。
更进一步,Zeva的Causal Interaction Signal是一个效应空间中的紧凑表示,直接编码物理效应信息。
跨任务effect retrieval实验显示,不同物体、视角和任务指令下的等价物理效应,会在该空间中彼此靠近。
这意味着模型学到的是“这类物理效应如何产生”,同时也覆盖具体任务的做法。这种表示天然支持跨域迁移,也让“域变换”成为一个可计算、可检索、可复用的技术概念。
如果把VLA看作“任务理解与动作生成”的基础设施,世界模型看作“经验想象”的基础设施,那么Zeva定义的ICCL就是“现场因果学习”的基础设施。
它把部署从“能力消耗”变成“能力积累”,把每一次失败从噪声变成可检索的因果证据。
如果ICCL成立,具身智能的scaling将多出一条独立于参数规模的曲线:交互次数越多,因果上下文越丰富,模型对当前物理域的辨识越准,任务成功率越高。这才是“域变换”作为新范式的真正含义。
结语
清华AIR与域变换联手发布的Zeva,重新定义了具身模型的自进化:
不调权重,也能越用越强;不重新训练,也能从一次人类演示中学会新操作。
域变换开启的,可能是一条新的scaling路径:让机器人在真实物理世界中,自己学会因果,自己完成进化。
[1]论文:Zeva: In-Context Causal Interaction Memory for Embodied Action Generalization
[2]项目主页:https://air-embodied-brain.github.io/Zeva/
关于清华AIR与域变换
清华AIR(Institute for AI Industry Research, Tsinghua University)是清华大学面向第四次工业革命的国际化、智能化、产业化的研究机构,被视为中国AI产学研结合的第一梯队。
域变换是清华AIR面向物理智能自进化时代孵化的公司,由刘云新教授和曹婷教授发起,本次发布的Zeva是清华AIR在具身智能方向从前沿研究走向产业落地的重要标志。

刘云新
清华大学智能产业研究院副院长、博导、万国数据冠名教授、首席研究员,国家级高层次人才、IEEE Fellow
前微软亚洲研究院首席研究主管,长期从事AIoT、端侧智能研究
获得了MobiCom、MobiSys、SenSys等多个国际顶级学术会议奖励,以及CCF科技进步一等奖等奖项。

曹婷
清华大学教授,北京市高层次引进人才
前微软亚洲研究院首席研究主管,研究方向为边缘智能、具身智能等
获顶级会议最佳论文奖四次,工作入选ACM/Microsoft研究亮点等,其中ACM研究亮点由图灵奖获得者David Patterson亲自撰文推荐。
*本文系量子位获授权刊载,观点仅为原作者所有。