WRC交卷⎜机器人长程任务总断片?墨奇用Agentic-Native重构具身大脑

栏目:互联网 | 来源:机器之心Pro | 2026-08-21 11:32

编辑|杜伟

2026 年的世界机器人大会,最难的演示可能一点都不炫。

这几天,北京亦庄一下子挤进 300 多家机器人企业。

翻跟头、跳舞、打拳 ……,这些都算不上新鲜事了。相反,让一台机器人犯难的,可能是人类每天随手就能完成的一些小事,比如收拾房间。

在成立仅半年多的通用具身智能机器人公司墨奇智能(MORPHI)的展台上,其首次公开亮相的轮式机器人 MORPHI KINO,面对的就是这样一场长约 15 分钟的家务实战:

它要穿过多个区域,将茶几上的物品收纳到指定的盘子里:





移动到冰箱前,发现缺货后打开冰箱门,将一瓶矿泉水放进去,再关上冰箱门:







随后进入洗衣区域,将湿衣物取出,放入烘干机处理,再将已经烘好的衣物折叠好:







单独拆开来看,抓取、打开冰箱、放矿泉水、开关洗烘设备、叠衣服,每一项都是机器人行业反复展示过的能力。真正难的地方是,这些动作现在被串进了同一个长程任务中

这就要求机器人十几分钟内始终记得自己的任务目标,清楚哪些事情完成了、哪些还没有。另外,它还要应对位置变化、执行偏差和环境干扰,在出现意外之后继续干活。

这也让「任务连续性」成为今年世界机器人大会上一个值得关注的技术信号。

一边是继续卷抓取、折叠、开门等单一动作,另一边是把机器人放进一个足够长、足够复杂的任务中,看它是否有能力一路执行到底。墨奇能选择了后者

机器人碰到长任务,为什么容易接不上?

当前较为常见的一类具身 Agent 采用「一个想,一个干」的分层双系统架构。

高层认知模型通常由语言模型或视觉语言模型承担,负责理解需求、拆分任务、调度技能、判断并处理异常情况,这一层被称为 System 2;底层具身策略模型结合视觉和机器人本体状态,把高层给出的任务指令变成连续的动作,即 System 1。

这套分工解决了很多问题,让机器人有能力处理复杂的多步骤任务。但一旦拉长执行时间,短板开始暴露。

以上文展示的「收拾房间」为例,高层模型可以很快规划出一条完整的流程:清垃圾、整理桌面、检查冰箱、补货、处理衣物 …… 但负责执行动作的底层模型知道自己这一刻该做什么(比如走到桌边抓起水瓶),却未必清楚为什么要做这些动作、整个房间收拾到哪一步了,后边还有哪些事等着做。

此外,一旦环境发生变化或者某一步执行出现偏差,底层模型也无法准确判断任务如何继续,这时需要高层模型重新确认状态、调整规划并把新的子任务交代下来。任务周期越长,这种来回调度就越容易打断整个执行过程。

对于一个要连续干十几分钟甚至更久的机器人,如果每遇到一点变化都要等「大脑」重新规划,任务很难连贯起来。

墨奇智能的解法,是让负责执行的具身策略模型更多地承担「自己把任务持续做下去」的能力。围绕这一思路,该公司提出了Agentic-Native 技术路线,并推出MoRA 具身模型架构(以下简称 MoRA)

让执行模型,自己把任务接下去

Agentic-Native 的关键在于:重新调整了具身 Agent 架构中 System 1 和 System 2 之间的能力分工

过去主要由 System 2 负责的目标维护、任务记忆和进度追踪,被进一步下沉到直接控制机器人行动的 System 1 中,使得它们在持续输出动作的同时也能一直记住目标、保留上下文、判断当前任务进度。同时在超出能力范畴时,主动请求高层模型介入。

MoRA,承载的正是这套 Agentic-Native 思路

它的全称为「MORPHI Reasoning & Autonomy」,名字本身就点出了它的两个核心方向:Reasoning负责对环境、任务和行为的推理、规划和预测,Autonomy负责让机器人基于感知和推理结果做出决策并执行。

把两者放在一起看,MoRA 要让机器人在行动过程中理解任务、判断当前状态,并据此自主决定接下来做什么,直至目标完成。要实现这样的长程执行,模型至少要具备以下三项核心能力。

始终盯着最终目标

第一个下沉的是对任务目标的持续维护。传统动作执行更容易围绕局部子任务展开,比如上文展示的拿起矿泉水、移动到冰箱前以及把矿泉水放进去。这些指令单独看都很明确,但它们只是整个冰箱补货任务中的局部动作。

在 MoRA 的设计中,System 1 直接接收由文本、图像共同定义的结构化任务目标,并在连续执行过程中以这个 Goal 作为条件。这就是Goal-Conditioned Execution

由此带来的变化很直接,机器人不会因为「拿起矿泉水」这个当前动作完成,就将整项任务判定为结束,它始终记得最终的目标。

干活全程不断片

目标明确之后,第二个问题紧接着出现:怎么避免机器人「干着干着就忘了」?这对应了下沉的第二项能力 ——保留执行记忆

从时间尺度来看,长程任务中的「记忆」并不只有一种。尤其当任务持续数分钟甚至十几分钟时,机器人要一一清楚总任务是什么、当前做到哪一步了、哪些工作还没有完成。

MoRA 在 System 1 内部引入长、中、短三种不同粒度的执行记忆(Multi-Granularity Memory),其中长期记忆保留整项任务的目标与进度、中期记忆维护步骤级执行状态、短期记忆负责控制层面的连续性。

更关键的是,这些任务上下文被纳入模型表征本身,而非仅交给外部状态机维护。这就像人收拾房间一样,不会每做完一步就重新查看任务清单,长程工作的机器人也需要类似的连续记忆。

对任务进度了如指掌

目标告诉机器人最终要做什么,记忆保存一路执行下来的上下文。最后还缺一个关键环节:它得知道自己现在做到哪了,距离目标还差什么。

第三项下沉的能力是任务进度判断,它对应了 MoRA 的Progress-Aware Closed Loop

传统动作模型最核心的职责是输出动作,但在 MoRA 的设计中,System 1 有能力同时维护任务状态和当前进度。MoRA 内部形成了一个持续运行的「动作 →状态→进度→调整」闭环,中间出现偏差时及时调整,并根据任务状态判断当前目标是否完成。

三项能力结合起来,抬高了传统 System 1 的能力上限,让基于 Agentic-Native 的 MoRA 能够更好地支撑长程任务。

长程任务,重估数据价值

MoRA 在架构层面重新回答了「能力怎么组织」的问题,接下来还要回答这些能力「靠什么学出来」

对于长程任务,机器人面对的环境变化更多,任务跨度也更长,训练数据是否来自真实场景,以及是否包含完整的执行过程,都会直接影响模型最终能学到的能力。

当前行业很喜欢「百万小时」具身数据这样的叙事,但小时数够大并不等于质量高。一段只记录「标准成功动作的数据」与一段包含「环境变化、执行偏差、纠错乃至完成过程的任务轨迹」,模型从中学到的信息并不一样。

长程任务需要学习任务执行过程中的连续因果关系和状态变化,为此墨奇智能构建了一套「Human-to-Robot Embodiment Transfer」的数据与训练方法。

拆分来看,它以人类第一视角真实作业数据作为重要来源,再通过统一具身动作空间对齐人类行为和机器人动作,把其中相对独立于具体本体的任务知识迁移到机器人。

相比高度标准化的采集环境,真实作业数据包含更多实际场景中的物体状态、操作过程和环境变化,也更接近未来机器人要面对的任务分布。

为了获取真实世界数据,墨奇智能自研了MORPHI Sense Kit 数据采集系统,将采集设备带进酒店、商务公寓等真实商业场所,由一线作业人员直接产生作业数据。

并且采集回来的数据经过质检、场景重建和挖掘标注,再进入模型训练与评测;机器人在真机运行中产生的新数据又持续回流,进入下一轮训练和优化,由此形成了一套持续迭代的数据飞轮。

目前,墨奇智能已经积累约3 万小时真实场景数据,并计划在今年年底提升至15 万 —20 万小时

更强大脑之外,

还得有一副能干活的身体

再强的具身模型,也要通过机器人本体作用于真实世界。WRC 现场执行任务的 MORPHI KINO,正是墨奇智能为 MoRA 配上的本体

作为一款面向家庭服务场景的轮式机器人,它没有强调某一项参数,更看重移动、躯干、双臂、视觉与触觉能力之间的协同

这种协同在家庭服务场景中尤为重要。收拾一个房间,机器人需要同时调动移动、操作、感知等多种能力:在茶几、冰箱、洗衣机之间穿行,根据不同操作高度调整姿态,识别物体位置和接触状态,完成开门、抓取、搬运、放置等动作。

MORPHI KINO 采用四舵轮全向底盘,可以原地转向,底盘尺寸也能通过标准客房门和电梯。双臂各有 7 个自由度,单臂额定负载 5kg。鱼眼相机、深度相机、激光雷达和指尖触觉传感器共同负责环境与接触状态感知。

另外,长程任务对机器人本体还有一个很实际的要求:不能干到一半就没电了。MORPHI KINO 配备了两块 540Wh 电池,支持热插拔,实际可用续航不低于 4 小时。同时支持 WiFi 6 和 5G 双链路连接,方便状态回传和 OTA 更新。

在现场,我们还看到了 MORPHI KINO 的更多 Demo,比如观众选中盲盒之后,它会识别并抓取对应盲盒,装袋后递给观众:



放置物品后,它同样识别、抓取,并放入指定收纳区:



回过头看,墨奇智能这次围绕 Agentic-Native 和 MoRA 做的探索,触碰到了具身模型的一个基础问题:智能应该放在哪一层。

当负责实际执行的 System 1 更能把控任务目标、记忆和进度,机器人可以在行动过程中持续推进任务;System 2 则主要负责任务意图理解、全局规划和异常情况处理。

执行时间越长,越能凸显这种分工的价值。很多局部变化直接在执行层处理,任务也更容易推进下去。

另外,当机器人从「完成一个动作」扩展到「承担一项连续的工作」,具身智能的 Scaling 除了看模型大小、数据规模与场景覆盖,可能还需要多看一个维度:任务时长。对一个准备干「长」活的机器人来说,能够把能力维持多久,未来会越来越重要。

了解更多

猜你想看

← 返回首页