编辑|张倩
机械臂眼看就要抓到咖啡袋了,旁边的人突然伸手,把袋子挪走了。

操作咖啡机时,人又拿灯光晃它,按钮周围的光照一下就变了。

到了微波炉前,旁边的人又故意往应该装蛋糕的盘子里放了一个饮料罐…… 而等到它准备关门,一只手又伸到了门边……

短短七分钟的一个视频,我们看到了各种意外干扰。但更令人意外的是,这些干扰,机器人居然一一化解了。

从视频画面中可以看出,咖啡袋被挪走的瞬间,机械臂没再扑向原来的位置,而是顺着袋子挪走的方向,重新调整了自己的轨迹,再抓。灯光晃过来的时候,它按按钮的动作没有半点变形;盘子里的饮料罐,它没有忽略,而是先夹出来放到一边,确认剩下的东西可以安全加热,才继续手里的动作;最惊险的还数关门那一幕,手刚探到门边,机械臂立刻缩了回去,安安静静等在一旁。人把手撤走,它才重新上前把门关上。
这些插曲恰好也是这段演示值得看的地方。机器人进入物理世界,总免不了和人待在同一个空间里,意外情况层出不穷。要把事情做完,机器人得随时留意:眼前的情况,还允许自己照着刚才的计划继续吗?
这正是 Aether AI 此次发布的 CRIS-0 所擅长的地方。它是一个因果驱动的机器人智能系统。机器人每次受到干扰,它都能及时发现并调整策略,关门那一幕尤其明显,反应速度 0.1s 级。
这是因为,它本质上就是为了更好地适应现实世界的变化而设计的。面对每次「意外」,它都要弄清楚到底是怎么回事 —— 什么变了,这些变化对接下来的行动有什么影响,我是不是要退一步…… 而这种理解变化、推演影响,并据此调整行动的能力,正是所谓的「因果智能」。
仔细想想,这种边观望边行动的模式其实已经和人类非常接近了。也正因如此,CRIS-0 不仅抗干扰能力更强,完成长程任务和个性化任务的能力也更强。
此外,凡是需要在动态世界中行动和决策的领域,理论上都能从这条路线受益,机器人只是最典型的场景,也是 Aether AI 的因果智能走进真实世界的第一个落脚点。
至于因果智能凭什么能接住这些难题,我们接着往下聊。
为什么仅仅「预测下一步」还不够?
在过去的几年里,凭借「从大量数据里找规律,然后预测下一步」,LLM 已经在数字世界里取得了巨大成功。但在 Aether AI 创始人、CEO 黄碧薇看来,这种成功有一定的特殊性。

语言是一种相当特殊的模态:它是离散的,人类几千年总结出来的规律,就写在文本表面,模型靠相关性拟合就能学得很好。物理世界却完全是另一回事 —— 规律没有写在表面,许多影响结果的条件,只有在交互中才会显现。更关键的是,机器人的每一个动作都在真实地改变世界,预测错了,没法像聊天那样撤回重来。
在这样的世界里,仅靠统计规律「预测下一步」会接连撞上几个问题,比如分不清哪些变量真正决定结果,哪些只是背景噪声,执行任务时极易被干扰;遇到训练里没出现过的干预,不知道怎么外推;任务失败后,不知道该退到哪一步;环境一变,不知道原来学到的哪些关系还成立。
因果智能补上的正是这层「因果」。它先把世界表示成任务相关的因果变量,再找出变量之间谁影响谁,最后把机器人的动作看成一种干预,去建模「如果我这样做,世界会怎么变」。这样模型就不只是预测下一帧,而是能推演不同干预的后果,也能在失败时追溯根因。
因此,因果智能有望接住一些棘手的问题:分布外泛化、长尾场景、跨本体迁移、长程任务中的错误恢复,以及更主动的数据收集。机器人是最典型的场景,因为机器人每次动作都是一次干预,相关性拟合的局限,会立刻显现出来。但任何需要在变化世界里做决策的领域,其实都有同样需求。它解决的根本问题不是「预测得更准」,而是「在变化环境中识别什么真正改变结果,并通过干预和反事实来行动」。这就是它不只适合机器人,也能扩展到其他领域的原因。
因果驱动的 CRIS-0,是怎么工作的?
CRIS-0 的做法,不是让一个大模型从头到尾包办所有事,而是把机器人的智能分成两个层次:高层负责理解任务、推理和规划「接下来该做什么」;底层负责理解具体的物理变化,预测「这个动作会让世界发生什么变化」。
这两个层次,对应 CRIS-0 的两大核心组件:因果驱动的机器人 Agent(Causality-guided Robot Agent)和因果世界模型(Causal World Model)。

Agent 围绕「因果状态转移」来组织任务。它能够从新环境里发现与任务相关的重要变量,把任务拆成阶段,给每个阶段定义验证标准,再准备对应的执行工具。
执行时,它不断更新状态、验证中间结果,决定是继续、重试,还是退回上一步。比如对齐桌布角,它看的不是整张画面,而是布有没有被抓住、角离目标还有多远、有没有打滑。只有真正影响任务的变量,才会进入它的决策。

这些能力通过统一工具接口被组织起来。规则函数、学习到的策略、SLAM 导航、世界模型、验证器,都被包装成规划器可调用的工具。自由空间移动可以调规则函数,接触丰富的抓取可以调策略模型,需要判断未来时调世界模型,需要确认结果时调验证器。任务变了,换的是工具组合和调用顺序,不是整套系统推倒重来。
执行过程则是一个「结构化状态转移循环」:评估状态、执行工具、验证结果,再根据反馈更新任务图。任务图里,节点是可验证的阶段,边是阶段之间的转移条件。成功就前进,失败就重试,或者回到更早的阶段恢复条件。
如果问题出在工具本身,CRIS-0 会根据错误反馈修正工具,并在成功执行后保留下来。这样局部错误不会一路累积,难任务也被拆成更适合对应工具的子问题。

因果世界模型负责预测动作的物理后果。它不直接预测下一帧画面,而是先看当前观察和候选动作会让哪些因果变量发生变化,再用这些变化刻画未来。这样,智能体不只知道「画面会变成什么样」,还能判断「这个动作是不是在把我推向想要的状态」。在此基础上,CRIS-0 又加了动作模块,让世界模型能直接生成机器人动作,从预测器变成策略模型。
这些设计落到真实机器人上效果如何,我们接着看实验。
因果智能加持的机器人,有哪些优势?
机制说得再完整,也要拉到真实世界里比一比。Aether AI 把 CRIS-0 和端到端模型放进了同一批任务:同样的机器人,同样的场景,同样有人在一旁捣乱。
实验发现,面对各种突如其来的干扰,CRIS-0 明显更鲁棒,反应速度也更快。因为从根本上来讲,它把哪个变量和任务相关、改变什么会影响结果这些事情都搞清楚了,而且始终跟踪任务所处的阶段,所以它可以在扰动之后迅速回到受影响的阶段。
不过干扰只是第一关,更长的任务才见真章。
另一段演示里,用户只给了两句相当模糊的指令:「帮我找蓝色小包」「太乱了,帮我整理一下」。机器人得自己把话拆开:先找到小包,再开始收拾。收拾也不是见什么扔什么 —— 拿起饮料瓶,它会先检查里面还有没有剩的,空瓶丢进垃圾桶,没喝完的放回一边;书本顺手搁上茶几,账单涉及隐私,收进抽屉这种更私密的位置。

这种长任务恰恰是端到端模型最容易栽的地方:误差在步骤之间悄悄累积,往往到最后一步才发现出了错,却已经说不清错在哪一步、为什么错。CRIS-0 的做法是每完成一个阶段就验证一次状态,不达标就在本阶段调整,这样局部失败被当场拦下,不会一路攒到最后才爆发。
模糊请求则是另一种考法。「给我拿瓶饮料」这种话,需要模型先理解用户意图,再完成精细的抓取控制。让单一模型同时扛下这两件事,很难两头都顾好。CRIS-0 把它们分给了不同层级:规划器负责选对目标 —— 比如结合晨跑后的情境和健身习惯,挑出功能性饮料;规则函数负责把夹爪送到位;策略模型只管最后那一步的精细操作。

几轮对比看下来,CRIS-0 这套分工的价值就具体了:任务执行到一半,条件变了、某一步没做好,系统都有机会及时发现,并在对应环节调整。真实环境很难始终配合预先排好的计划,机器人能否把事情做完,也就取决于途中这些判断和修正。这让 Aether AI 的因果智能路线有了一个可以观察的落点。
机器人,只是起点
这次演示之前,Aether AI 已经分别尝试过两件事:让 AI 自己摸清一个陌生环境,以及让它推演动作会带来什么变化。
前一条线索来自 RSIAgent。进入不熟悉的软件后,智能体主动尝试操作,检查哪些做法有效、什么条件下会失败,再把验证过的经验存进记忆,供后续任务使用。它探索的是一种无需更新模型参数,也能通过与环境交互积累经验的办法。
另一项工作 CausalWM,关注物理变化怎样发生。例如机械臂推动杯子,模型会先预测运动,再推演三维几何关系的变化,最后生成未来画面。前一步的结果会参与后一步预测,团队将这一过程称为「因果思维链」。
CRIS-0 延续了这两条研究思路,将任务层的规划、验证与恢复,同对物理变化的预测及动作控制结合起来。此前分别研究的能力,由此进入实际操作,接受执行结果的检验。
这些工作背后,Aether AI 规划了一条逐步深入模型内部的技术路线。
最靠近任务的一层,是因果驱动智能体:把关键条件用于规划、归因和恢复 —— 哪些步骤可以继续,失败可能出在哪里,验证过的经验下次怎么复用。再往里一层,是让模型学习动作如何改变环境:推演接触、运动和位置关系的变化,为实际控制提供依据。此次 CRIS-0 主要验证的,正是这两个层面。
此外,团队还希望继续向模型内部推进,包括模块化神经架构以实现把接触、摩擦等因素组织成可复用的模块,更底层的 Causation Transformer 希望让变量之间的因果影响直接参与模型计算。不过,这两层仍在推进和验证。
黄碧薇说的「能举一反三、适应真实环境的智能大脑」,就是这条路线想接近的目标,而机器人是最诚实、最直接的检验场。
其实,生物制药、新材料研发也有相似需求:改变成分或条件会怎样影响性能,干预某个生物过程能否带来预期变化。因果方法能帮研究者提出更有依据的假设、选择值得验证的条件,再用实验修正。这些领域不能照搬机器人能力,但「找到影响结果的条件,施加干预,再检验后果」这条思路可以延伸。
Aether AI 本身也有计划在这些方向展开探索,至于能走多远,我们拭目以待。