

一张新榜单能证明什么,又不能证明什么。
作者|七月
编辑|栗子
假设一台双臂机器人正在把罐子放进锅里。
头部相机显示任务已经完成,左腕画面里的罐子却还留在夹爪中;右腕画面里,另一只机械臂甚至出现了不该发生的移动。三段视频分开看都足够流畅,合在一起,物理世界却裂成了三份。
机器人不会被一段好看的视频安抚,它必须在同一个世界里行动。
这正是TriWorldBench(首个面向机器人三视角视频生成与理解的具身世界模型评测基准)想解决的问题。过去,机器人世界模型的评测往往盯着单一外部视角,看画面是否清晰、连贯、接近参考视频。TriWorldBench同时检查头部、左腕和右腕三个视角,要求它们描述同一次操作、同一个物体状态和同一段动作进程。它还把任务完成度、接触合理性、轨迹、时间稳定性和视觉质量放进同一套评测里。
就在最近,TriWorldBench更新了他们榜单的排名,Aether AI最新发布的首个因果世界模型——CausalWM以66.04的高分登顶榜首。

图源:Aether AI创始人黄碧薇X账号官宣发布CausalWM
除了在聚焦机器人三视角一致性的TriWorldBench上取得第一,CWM还在覆盖更广泛物理场景的Physical AI Bench(PAI-Bench)中获得验证。
在接收到一个观察结果和语言指令后,因果工作记忆系统会通过明确的运动和几何预测来生成未来的情景 图源:Aether AI官网
第一名的成绩当然值得欣喜。但身处世界模型这样一个定义仍在快速变化的赛道,对Aether AI来说更重要的问题或许是:这66.04分究竟测到了什么?
1.第一名的背后
Aether AI的此次发布,带来了模型机制和榜单成绩两项公开信息。

CausalWM(下文简称CWM)是一个16B的模型。给定当前观测,并结合语言指令或机器人动作条件,CWM先预测光流,再生成三维点图(pointmap),最后生成未来RGB视频。前一步的结果会成为后一步的上下文,后续信息则由注意力掩码挡住,不能提前“泄题”。Aether AI团队把这套顺序预测机制称为Causal CoT(因果思维链)。
这次发布也带来了一项榜单结果。
在最近更新的TriWorldBench榜单中,共收录了36个模型,CWM以66.04分排名第一,第二名dream4act为65.66分。

从分项看,CausalWM在跨视角、任务和运动相关指标上表现靠前,同时又在世界合理性和视觉质量上斩获第一——
在三视角一致性维度排名第2,任务对齐维度排第3,运动质量维度排第2,视觉质量维度排第2,透视合理性和图像质量则拿到了单项第一。
因此,这次第一名可以证明CausalWM其背后采用的因果路线展现出了对物理世界更强的建模能力。
它也释放了一个产业信号:世界模型的一部分评测重心,正从“谁的视频更像”,转向“谁能生成一个可供行动的统一世界”。
2.CausalWM:把中间物理过程写进预测链
传统世界模型已经能做动作条件预测:给定当前状态和控制信号,生成未来画面。CausalWM想进一步处理的是另一个问题——模型究竟依靠什么中间物理变量完成预测。
Aether AI选择把这部分过程显式展开。团队将光流、深度、几何等可自动提取的物理变量组织成一条有顺序的推理链:
Observation→Motion→Geometry→Future

这里的关键不是多预测几个额外特征,而是让前一步结果真正成为下一步的条件。先描述运动,再补充空间结构,最终共同参与未来视频的生成。训练中,后续变量不会提前泄露给前序阶段;推理时,模型也按照同样的顺序逐级生成。因此,CausalWM试图把原本压缩在隐变量里的物理过程,变成一条可以显式监督和复用的因果思维链(Causal CoT)。

在接收到一个观察结果和语言指令后,因果工作记忆系统会通过明确的运动和几何预测来生成未来的情景 图源:Aether AI官网
为了训练CausalWM,Aether AI构建了一个约30K小时的视频数据集,覆盖机器人操作、第一视角视频和多视角交互场景。

训练分成三个阶段:
第一阶段先解决生成能力。CausalWM基于LTX-2.3-22B继续训练,学习语言条件、动作条件和多视角未来预测。
第二阶段加入Causal CoT。光流、深度和点云信息被作为中间物理变量,按照固定顺序参与预测。前一阶段生成的特征会重新进入上下文,后续预测再以此为条件。由于这些监督信号可以从原始视频自动提取,这套CoT训练可以扩展到大规模视频数据,而不依赖人工逐帧标注。
第三阶段再用多目标强化学习优化完整生成结果。视频预测本身具有开放性,同一个状态可能对应多个合理未来,单纯监督学习并不能直接保证物理一致性、视觉质量和任务完成度。CausalWM因此对同一上下文采样多个未来,并根据多类奖励进行组内优化。这样一来,中间CoT也不再只是模仿固定模式,而可以根据最终视频质量被进一步调整。

CausalWM训练的三个阶段:一种共享扩散式转换器先预测光流,然后生成点图,最后预测未来的RGB图像。每个完成的流段都会保持不变,作为下一个流段的背景信息;因果注意力机制会屏蔽后续阶段的信息。 图源:Aether AI官网
CausalWM还有一个比较有意思的结果:训练CoT之后,模型不仅会预测这些中间变量,也更擅长利用新的上下文信息控制。这给模型留下了一个相对通用的控制接口:只要某种控制信号可以被表示成视觉形式,就可以沿着现有 上下文窗口注入模型,实现上下文学习(In-context Learning)。
例如,在机器人场景中,可以把simulator给出的机器臂轨迹渲染成运动视频,经过少量微调后,模型就可以根据这些轨迹生成相匹配的未来视频。这意味着,中间变量不再只是“解释模型预测”的辅助信息,也可以反过来成为因果干涉(Causal Intervention)的窗口。类似机制还可以扩展到物体轨迹、目标姿态等信号。

图源:Aether AI官网
3.因果路线真正想省下的是“重训税”
机器人完成一次演示,离规模化部署还很远。
机械臂换了夹爪,工厂换上一批反光零件,家庭环境里多了一张粗糙桌面,模型都可能需要重新采集数据、增加遥操作示范,再做一轮微调。部署方关心演示视频里的成功率,也会追问模型遇到变化后的恢复成本:需要补多少数据?跑多少次真机?投入多少工程人/天?
这些重复投入,我们认为可以叫作“重训税”。如果因果方法能够让部分机制在新场景中复用,它的商业价值就体现在降低这笔成本上。
如果模型学到的机制能够拆开复用,局部变化就有机会局部调整。桌面摩擦变了,更新接触和滑动相关的部分;夹爪尺寸变了,重新校准本体接口;抓取和放置已经学会,面对新的物体组合时沿用已有经验。只有这套设想能够落地,机器人的边际交付成本才可能下降。
ICLR 2025的WM3C研究沿着相近方向,把语言中的动作和物体拆成可组合的动力学组件,测试模型对未见任务的适配。实验支持因果模块化改善迁移的可能性,不过任务数量有限,验证环境也以仿真为主。

(a)环境模型示意图(b)环境模型的因果图示 图源:《Modeling Unseen Environments with Language-guided Composable Causal Components in Reinforcement Learning》
Aether AI此前提出的CD-LAM则从动作表征入手。论文发现,隐式动作模型容易把背景、场景和镜头变化一并塞进“动作”表示——下游世界模型名义上接收了动作条件,预测时仍可能依赖画面连续性,甚至在收到静止指令后继续让机械臂移动。
CD-LAM通过提高机械臂和被操作物体的学习权重,拉近同类动作的表征,然后再把相同画面之间的变化校准为接近零动作。论文在2B和14B两种模型上报告,接入真实机器人动作后,动作跟随误差相对基线下降约30%,适配所需更新次数减少12倍以上。这项工作说明:控制信号可以通过表示去偏重新接回模型。

CD-LAM在DreamDojo上显著提升了动作跟随、视觉保真度和数据效率。图源:Causally Debiased Latent Action Model for Embodied Action Conditioned World Models
理论给出了因果模型可能更稳健的条件,经验研究的结果则取决于具体任务和数据。
ICLR 2024的Robust agents learn causal world models在特定理论设定中推导出:智能体若要应对足够广泛的分布变化,需要学到近似的数据生成因果模型;
放到世界模型行业,各家选择的入口并不相同:Meta的V-JEPA 2主要在潜空间学习预测和规划;英伟达Cosmos提供物理AI所需的生成模型和数据工具;Google DeepMind的Genie 3侧重实时可交互环境;World Labs的Atlas处理文本、图像、视频和3D共享的空间上下文。Aether AI选择把运动、几何等中间表征显式化,再尝试让这些表征承担控制条件。
这些路线可以组合——生成模型负责扩充训练环境,潜空间模型提高表征和规划效率,因果模块尝试处理变化中的机制复用。此外,系统效果还取决于一系列模型之外的条件:仿真环境能否重置、干预变量是否可控、验证器是否可靠,以及失败经验能否复用。
目前我们能看到的是,CWM给出了一种结构设计,TriWorldBench记录了视频生成侧的成绩。但是两者之间还缺一条证据链:显式的运动和几何中间过程,能否让模型换环境后少补数据、少跑真机、更快恢复?
判断“重训税”是否真的下降,需要把视线移到更严格的干预评测和真机闭环。
4.从Causal CoT到因果智能,还缺哪些证据?
按照Aether AI的长期设想,因果世界模型还要回答:哪些变量真正决定未来,改变某个变量会带来什么结果。第一版CWM模型给出的Causal CoT的起点已经很具体,但这还不足以说明模型已经找到了真实的因果变量。
第一类证据来自更严格的干预与组合评测。主动改变物体质量、摩擦、光照、相机位置或动作策略,可以观察模型能否分清外观变化与动力学变化。把见过的动作、物体和环境重新组合,再记录模型需要补多少数据、经过多少次更新才能恢复性能。这条恢复曲线比单次“零样本成功”更接近部署实际。
第二类证据来自真机闭环。世界模型进入真实机器人后,策略要根据预测选择动作,连续处理误差累积,并在失败时找到需要调整的环节。不同路线还应尽量使用相近的数据量、模型规模、交互次数和推理成本。模型版本、训练设置、随机方差与失败案例也需要公开,第三方才能分辨提升来自结构设计还是资源投入。
Aether AI表示,后续还会继续围绕因果世界模型,探索更优的因果表征学习和因果推理策略,让模型能够更好地识别物理世界中的关键因果变量、理解变量之间的因果依赖,为下一代因果智能(Causal Intelligence)建立基础。从物理世界出发,Aether AI希望进一步打通因果世界理解与行动生成,让模型从预测世界,走向理解因果、利用因果并作用于世界,最终实现:让AI理解什么真正影响结果,以及不同的行动与干预将如何改变未来。
(封面图来源:AETHER AI)
