
当数字世界的 AI 开始讨论自进化,物理世界的 AI 有没有自进化,或许是下一个时代最重要的问题。
作者|Li Yuan
编辑|郑玄
最近,乐享科技因为一个颇大胆的 claim,引发了不少关注:它提出,其具身智能模型以太大模型能够在部署和执行过程中持续更新,并将这种能力概括为「自进化」,是全球首个能自进化的具身智能模型。
自进化是一个容易引起争议的说法。「进化」究竟是模型参数发生了变化,还是进行了任务的临时调整?在多大程度上这样的调整能够变成可迁移的新能力?一个模型能够适配不同场景和不同身体,又应该被理解为工程层面的泛化,还是更强意义上的持续成长?在机器人行业仍然需要解决稳定执行问题的阶段,「自进化」显然是一个需要被谨慎对待的判断。
近日,乐享科技又进行了一场户外直播。按照直播前公布的目标,搭载 Aether 以太大模型的机器人要在户外接受随机点单,完成包括食材和工具处理、烤制、翻面、上菜在内的烧烤任务,并应对临时打断、需求临时增加和场景变化。
在现场超 30 位专业媒体和线上超 550 万观众的见证下,实际呈现的过程并非每一步都顺利。
机器人完成了部分自主烧烤操作,也出现了停顿、失败和重新调整。乐享科技似乎并不回避这些不完美:它想展示的重点,不是机器人在一个固定流程里零失误地把烧烤做完,而是任务和环境发生变化之后,机器人能否继续寻找信息、调整动作,再把任务推进下去。两个机器人本体全程互相传递任务信息、自主思考决策并合理分工协作。

一场直播当然不能回答关于「自进化」的所有问题,但这种展示方式至少体现出一种相对开放的态度:机器人可以失败,真正需要观察的是失败之后会发生什么。
对机器人来说,「自进化」不能只是一个好听的词。它至少要回答三个问题:第一,机器人能不能发现现实和自己预测之间的偏差;第二,它能不能判断哪些经验值得留下、哪些应该忘掉;第三,它能不能把一次任务、一个场景和一具身体上的经验,迁移到新的任务、场景和身体上。
当数字世界的 AI 开始讨论自进化,物理世界的 AI 有没有自进化,或许是下一个时代最重要的问题。
为此,我们和乐享科技背后的团队聊了聊他们的模型思路。
01
不是更会模仿,
而是能不能理解真实世界
过去几年,具身智能最常见的思路,是把视觉、语言和动作连接起来:机器人看到环境,接收任务,再输出动作。这条路线的价值很直接,它让机器人可以借助大规模数据学习人的示范,也让复杂指令开始有机会落到具体行动上。
但在乐享科技团队看来,这种从输入到动作的映射仍然存在一个根本限制:它擅长回答「下一步应该做什么」,却未必真正理解「为什么要这样做」,以及这个动作会给真实世界带来什么后果。
团队将 VLA 的局限概括为「不懂因果」,将传统 world model 的问题概括为「可生成、不可执行」。按照这一判断,前者更接近从已有数据中学习动作规律,但这并不自然等于理解动作与结果之间的因果关系;后者可以预测世界可能如何变化,却不代表预测出的未来一定能够被机器人的关节、力矩和控制系统实现。

真实世界恰恰不是一组干净的输入输出。接触力、摩擦、滑动、遮挡、物体形变以及目标临时变化,都会让同一个动作产生不同后果。一个杯子的质量增加一倍,关节需要输出的力矩就应该随之变化;液体重心不断移动,机器人也不能只是机械复现某条既定轨迹。画面上「看起来合理」,与身体上「真的做得到」之间,还有很长一段距离。
这解释了乐享科技为什么没有把重点继续放在动作预测上。
按照团队在采访中的描述,以太大模型是一个由世界状态、内部状态和能量状态耦合而成的动力系统。感知、预测和行动仍然存在,但并不是三个依次调用的独立模块,也不是一个从输入直接吐出动作的黑盒。团队更愿意把它称为「energy-driven state transition」,即由能量驱动的状态转移。
这里的「能量」不是机器人电池还剩多少,相关负责人把它形容为一个 landscape,一张贯穿系统的评价地形:哪些状态值得靠近,哪些状态应该舍弃,当前还缺少什么信息,以及接下来应该把计算和注意力放在哪里,都在这张地形中被共同衡量。
这让感知本身也变成了任务的一部分。机器人不再只是被动接收摄像头传回来的画面,而是带着问题寻找答案:为了继续行动,我还需要看到什么?当前视角能否消除不确定性?是否应该先移动身体、改变观察位置,再决定下一步动作?团队将其称为具有「感知意图」的主动感知。
这套思路可以从乐享科技展示的「太极宗师」任务中得到更直观的理解。在这一任务里,机器人左手需要控制杯中液体不洒,右手同时维持另一个物体稳定。液体状态、外部扰动和关节状态都在持续变化,很难依靠一条固定动作轨迹完成。按照团队的解释,系统需要建立动作、物理状态与结果之间的因果关系,并根据后果不断调节控制。
这并不能单独证明机器人已经拥有完整的物理直觉,但它至少揭示了乐享科技想用以太大模型解决的问题:真正困难的不是生成下一个看起来正确的动作,而是让动作在一个不断变化、会反过来影响机器人的物理世界里成立。
从模仿动作走向理解行动后果,是这条路线的第一层变化。它也为「自进化」提供了前提:如果机器人无法识别现实与预测的差异,就无从知道自己错在哪里,更谈不上从错误中形成新能力。
02
自进化不是一句口号,
而是一套闭环机制
那么,乐享科技为什么认为 Aether 可以「自进化」?在采访中,我们把问题进一步落到了模型内部:机器人执行任务时,变化的究竟只是瞬时状态和记忆,还是策略乃至模型权重?
乐享科技给出的回答是,这些层级都会更新。按照团队的解释,他们所说的「自进化」,首先发生在执行过程中的预测误差修正,但并不止于一次性的状态调整。
机器人在行动前形成预测,执行后观察结果,再比较真实结果与原有预测之间的偏差。如果世界已经不再是刚才以为的样子,系统就需要更新内部状态,判断原计划是否失效,再进行局部或全局的重新规划。这个过程不是任务失败后才启动的补救措施,而是伴随每一次行动持续发生。
面对临时改变的目标,系统会重新判断原有计划是否仍然适用,并生成新的动作:「我现在看到的世界,还是我刚才认为的世界吗?」从预测、执行、反馈、更新到再次行动,系统始终处在循环之中。
在 demo 中,机器人需要处理一块有污渍的玻璃。它发现污渍并不在自己面对的这一侧,而在玻璃外侧,于是改变原来的处理方式,把手伸向窗外继续擦拭。正是体现这一点。
这与传统意义上的 action prediction 有一个明显区别。后者更关心在当前输入下输出什么动作;按照乐享科技的说法,Aether 则会同时维护世界状态、任务状态和系统自身状态。一次行动之后,变化的不只是机械臂的位置,也可能包括短期经验、技能参数,以及系统对某种因果规律的判断。

长时序任务由此成为一个重要观察点。团队提到,乐享科技已经展示过一镜到底的连续任务,机器人需要理解步骤之间的先后关系,记住已经完成到哪里,并能在中途改变目标或中断后继续执行。单个动作是否准确当然重要,但更难的是,在持续变化的过程中保持对「当前世界是什么样」「任务进行到哪里」「下一步为什么这样做」的统一理解。
只是,能够根据反馈调整,还不等于能够持续学习。在线学习最大的风险,是把偶然扰动当成规律,把错误经验写进模型,甚至在学会新东西时破坏原有能力。
按照乐享科技的介绍,以太大模型不会让所有新经验直接进入长期知识。系统会先评估一次经验是否可靠、是否新颖、能否归因、能否泛化,再决定它值不值得改变已有知识。换句话说,学习能力的一半,是知道什么应该学;另一半,是知道什么不该学。
与之配套的是分层记忆。越具体、越依赖单一场景的状态,生命周期越短,任务结束后就可以被清除;越抽象、经过反复验证的规律,保留时间越长,可能进入世界模型和因果模型。

模型是否真的会「调参」,是区分临场适应与自进化的关键。对此,团队明确表示,经过筛选和验证的经验也可能进一步影响模型权重,并被长期保留;如果只是某个场景下的临时状态,则不会永久写入模型。也正因为更新可能从记忆和策略继续进入参数层,乐享科技才把这套机制称为「自进化」。不过,这里仍然需要保留一个边界:目前我们得到的是团队对内部机制的解释,权重如何变化、变化幅度多大,以及新能力能否稳定保留,还需要更具体的测试结果来呈现。
数据的角色也因此发生变化。真人视频被用于理解人的行为逻辑、推测意图和构建认知,类似一种预训练;示教视频负责把认知落到可执行动作上,被团队形容为「给机器人上幼儿园」;真实运行数据使用得最少,却承担最重要的 reality calibration,也就是让机器人在真实环境里接受检验。
团队还有一个更形象的说法:机器人可以给自己做「错题本」。真正有价值的不是记住某一次失败,而是从失败中分离出可以复用的规律,在下一次面对相似但并不完全相同的任务时调用它。
这也解释了为什么泛化性是判断自进化是否成立的关键。如果所谓学习只能留在原来的任务和原来的机器人上,它更像一次局部调参;只有当经验能够穿过场景和本体差异,才可能真正成为更一般的能力。

据相关负责人介绍,以太大模型已经在约五家不同机器人本体上积累经验,涉及双臂、双足和轮式形态。不同本体在关节数量、自由度、末端执行器、质量分布、控制方式以及传感器布局上都有差异。迁移到新机器人时,团队通常希望获得 URDF、关节名称和传感器配置,以完成运动学对齐、传感器标定、动力学参数辨识和进一步微调。
以太大模型之所以能真正实现「一脑多形」,关键在于:接入一个全新本体后,它能够通过自主探索认知该本体的性能差异、关节限位等约束,并据此生成适配不同本体的动作与轨迹来完成任务。由此,模型完成了对本体的自我认知与适配,进而实现软硬件解耦。
控制系统同样体现了这种分工。团队所称的 200Hz 以上频率,覆盖的是状态读取、控制器计算和关节指令更新;高层感知和推理并不以同一个固定频率运行,而是根据任务复杂度与当前不确定性调整周期。当高层推理需要更长时间时,主动感知反而可能变得更频繁,以获得更多信息。
因此,乐享科技所说的自进化,并不是机器人突然拥有了自我意识,也不是一个简单的端到端黑盒,而是一组更综合的工程机制:主动获取信息,根据预测误差调整行动,筛选值得学习的经验,把不同层级的经验存入不同记忆,再尝试将较稳定的规律迁移到新任务和新身体上。
03
如果机器人真的能自进化,
那就是 next level
过去的机器人更像被训练好的执行机器。它可以把规定动作做得越来越精准,但任务之外的经验很难沉淀;它可以被部署到现场,部署后的反馈却未必会变成长期能力;它也可以更换场景和身体,但每一次迁移常常近似重新开始。
乐享科技借以太大模型所提出的观点,不只是让机器人完成更多工作,而是让部署本身成为学习过程。机器人进入真实世界之后,不再只是消耗训练阶段获得的能力,也可能在一次次行动中校准对世界的理解,把可验证的经验逐渐变成新的能力。
最近围绕 GPT-6 的讨论,也让许多人重新思考下一代模型的跃迁会来自哪里。人们关心的已不只是参数是否更大、推理是否更强,还包括模型能否在更长周期中积累经验、形成记忆,并在持续交互中改变自己的能力边界。落到机器人身上,这个问题会变得更具体,也更严格,因为每一个判断最终都要接受物理世界的检验。
如果具身智能只是从指令走向动作,它仍然是一种更复杂的自动化。但如果机器人能够在行动中发现偏差,在反馈中筛选经验,在记忆中沉淀规律,并把这些规律带到新的任务和身体上,那么它就不只是「更会干活」,而是开始具备某种生长性。
当然,关于「自进化」,乐享科技需要回答的还有很多:泛化能够跨越多大的任务差异,学习可以持续多久,模型变化如何被量化,新能力能否在不同机器人上稳定复现,以及长期运行后如何证明旧能力没有退化。
但目前所展示出的能力已经把问题向前推了一步。衡量机器人的方式,或许将不再只有「它现在会做什么」,还要加上一句:「它做完之后学会了什么?」
一旦机器人真的能够把现实世界里的经历变成可积累、可验证、可迁移的能力,它改变的就不只是某个 demo、某家公司或某条技术路线。那意味着机器人不再只是被制造、被训练、被部署的机器,而可能成为一种能够在世界中持续获得经验的行动系统。
那确实是具身智能真正的 next level。
*头图来源:乐享科技
本文为极客公园原创文章,转载请联系极客君微信 geekparkGO
极客一问
你认为下一代模型的跃迁会来自哪里?