为什么说机器人用7分钟55个步骤做一杯冰淇淋,是有意义的?|甲子光年

栏目:互联网 | 来源:甲子光年 | 2026-08-31 23:30

机器人真正的价值,是接过一份原本就存在的工作,帮助人类把它做完。

作者|寇雨然

编辑|王博

做一杯冰淇淋需要几步?

在一般人看来,可能不过三五步:拿杯子、打冰淇淋、放料、搅拌、递给顾客。但走进上海吴江路的DQ门店后,Sharpa的机器人用实际操作告诉我们,制作一杯奥利奥暴风雪冰淇淋需要55个步骤。

机器人需要从叠放的纸杯中分离出一只,套上金属杯圈,连续舀取配料,在高速搅拌和强扰动下控制握力,最后把冰淇淋倒转过来,完成DQ标志性的“倒杯不洒”。

Sharpa完成DQ标志性的“倒杯不洒”,图片来源:Sharpa

其中,单是把冰淇淋打进纸杯,机器人就要移动到机器前,识别出料口和开关位置,把杯子对准出料口,拨动开关,根据杯中冰淇淋的状态判断出量,再及时关闭开关。

任何一步出现偏差,都可能影响最终结果。

根据我们现场计时,这一系列的操作过程耗时大约7分钟。而一位熟练的DQ店员完成同样的工作只需两分钟。

那么,一台速度尚不及人的机器人,用7分钟、55个步骤做出一杯冰淇淋,意义究竟在哪里?

Sharpa机器人在DQ门店制作冰淇淋(2倍速),视频来源:Sharpa

1.五十五步,难的不只是步骤多

单独抓取一只纸杯、拨动一次开关,或者完成一次倒杯,对今天的机器人来说都不算罕见。

不过这次,AI机器人公司Sharpa的机器人把一系列动作连续串联起来,最终交付一件可以被顾客食用的商品。

制作一杯冰淇淋属于典型的长程任务(Long-horizon Task)。

在机器人领域,长程任务一般指机器人需要在较长时间跨度内连续完成多个相互依赖的子任务,且前一步的结果会改变后续步骤的执行条件。它的难点不只是流程长,还在于机器人必须持续记忆任务进度、感知环境变化、抑制误差累积,并在某一步失败后进行判断、纠错或重新规划。

在今年的世界人工智能大会(WAIC)和世界机器人大会(WRC),「甲子光年」发现,长程任务的展示越来越多,场景也越来越多元,药房、零售货架、工业产线和客厅、洗衣房等各类场景都被搬进展馆。机器人展示的任务更长、更复杂了,而机器人的动作连续性和针对不同环境的泛化性更强了。

那么Sharpa机器人做冰淇淋有什么不同?

如果只看速度,这台机器人还远称不上合格的“员工”。它价格更高、动作更慢,目前也只能制作一个口味。按照通常的商业标准,这不像一个已经跑通的机器人应用。

但Sharpa联合创始人李一帆认为,这次演示真正需要回答的问题,暂时还不是机器人能否比人更快。

他曾见过一台在咖啡店工作的机器人。咖啡已经由全自动咖啡机做好,机器人只需要按下按钮,再把杯子递给顾客。机器人看起来进入了咖啡店,却没有接管咖啡师原本承担的工作。

“为了让机器人落地,创造一个就业机会,我觉得这个没有意义。”李一帆说。

相比之下,Sharpa选择了一条更麻烦的路径。

它没有给机器人重新设计一套冰淇淋设备,也没有把复杂制作交给专机,再让机器人完成最后的递杯。Sharpa的North机器人使用的是DQ店员原本使用的冰淇淋机、搅拌机、纸杯、勺子和金属杯圈,沿用门店既有的操作流程,从取杯、接冰淇淋、添加配料,一直做到搅拌、倒杯和交付。

Sharpa机器人制作冰淇淋,图片来源:Sharpa

Sharpa方面介绍,这是世界范围内机器人第一次在真实餐饮门店中,沿用全球统一标准的制作设备、原料、工具和操作规范,接手连锁经营的日常工作,并完整服务真实顾客、处理真实订单。

真实门店的环境、物料和标准对机器人来说并非易事。

机器人抓取纸杯后,杯子的位置和姿态不可能每次完全一致。前面偏了一厘米,后面套杯圈、接冰淇淋和搅拌的初始条件都会随之改变。假设每一步的成功率都是99%,在不考虑纠错的简单计算下,连续完成55步的成功率只有约58%。

机器人还要处理大量难以预先固定的物理变化。纸杯会变形,冰淇淋的黏度会随设备温度变化,高速搅拌会持续干扰机器人的握力,杯圈和勺子也可能遮挡视觉。机器人既要完成动作,还要判断动作是否成功,在出现偏差时进行重试或恢复。

搅拌冰淇淋,图片来源:Sharpa

我们在现场就看到,有一次机器人从杯堆中抽出了两个纸杯。系统识别到当前状态不符合预期后,没有继续执行后面的流程,而是尝试重新取杯。

这类纠错能力,构成了Sharpa与不少餐饮机器人演示的差别。55步的意义也不只在于步骤数量,而在于机器人需要使用人的工具,在真实环境中连续推进任务,并对最终交付的商品负责。

那么如此复杂的超长程任务,究竟是如何实现的呢?

2.一台机器人,为何要分三层思考?

「甲子光年」了解到,制作冰淇淋涉及Sharpa的三项技术:全模态世界模型与分层记忆负责理解任务状态、预测动作结果并规划下一步;自纠错机制将长任务拆成可验证、可恢复的子任务;⾃研分层端到端模型CraftNet则在真实接触发生时修正动作和力度。

从工程职责看,它们分别回答三个问题:下一步做什么,上一步是否成功,当前动作如何完成。

以添加配料为例,一杯暴风雪需要连续舀取三勺奥利奥。由于每次舀取前后的画面高度相似,机器人需要通过记忆判断已经完成几次,并在达到规定数量后进入搅拌环节。

高层模型规划出动作,也不意味着动作一定成功:纸杯可能粘在一起,勺子可能没有抓稳。系统需要在每个子任务结束后检查结果,出现异常时进行重试、恢复或者重新规划。

动作真正落到机器人手上,则由CraftNet进一步处理。System 1(运动大脑) 将操作意图转化为相对粗粒度的动作,System 0(交互大脑)再结合触觉、力觉和本体反馈,把粗动作修正为精细控制。两者采用分频设计,System 1大约以10Hz生成动作,System 0则以100Hz处理指尖接触瞬间的滑动、受力和物体形变。

CraftNet,图片来源:Sharpa

Sharpa研究科学家张凯峰将System 0称为一套通用的“运动基元”。它类似机器人的下意识反应:在运动场景中帮助机器人受推后保持平衡;在灵巧操作中,则负责机器人即将触碰和刚刚触碰物体时的微操,让同一套接触能力可以复用于抓杯、拿勺等不同任务。

“我们的System 0也非常聚焦,它聚焦在你‘快要摸到、以及指尖触碰到物体的那一瞬间’的下意识反应。”张凯峰告诉「甲子光年」。

Sharpa把制作冰淇淋的55个步骤称为“原子动作”,他们并没有针对每一个“原子动作”都训练一个模型,而是采取分层的策略:高层负责理解和规划,中间层生成动作,底层小模型处理接触,自纠错机制再把它们连接成一条能够持续运行的任务链。

类似的分层也在成为行业的共同选择。

Google的SayCan让语言模型选择技能,再由技能策略执行;NVIDIA的GR00T N1由System 2理解和规划,System 1输出连续动作;Physical Intelligence的π0.5先生成高层子任务,再由动作专家给出低层动作。Figure的Helix 02虽然被称为统一神经系统,内部同样包含推理、动作生成和高频控制三个层级。

各家公司采用的名称和模型有所不同,工程逻辑正在趋同:高层规划“做什么”,任务机制检查“有没有做成”,底层模型解决“具体怎么做”。

端到端可以是一种训练方式,分层则是当前的部署现实。

3.世界模型负责想远,原子动作负责做稳

看到机器人采用分层架构,很容易得出一个结论:世界模型还不够成熟,具身智能公司才退回到原子动作和小模型。

但世界模型与原子动作处在不同层级,承担的任务也不同。

世界模型擅长预测动作之后会发生什么,帮助机器人理解当前状态、比较不同方案,并判断任务是否正在向目标推进。它还可以在训练阶段扮演仿真器,生成合成数据,减少机器人在真实世界中试错的成本。

英伟达今年发布的Cosmos Policy提供了一个例子。这套模型可以直接生成机器人动作,也可以在测试阶段启动基于世界模型的规划:先生成多条候选动作,预测执行后的未来状态,再根据价值函数选出更可能成功的方案。

Cosmos Policy论文作者在真机执行阶段采用两种模式,一种是用世界模型帮助策略进行规划,选出最佳动作执行;另外一种直接执行,世界模型的预测结果并未被使用。

实验结果显示,对比直接执行,虽然世界模型的预测规划将动作的得分提升了12.5分,但每次选择动作要用8张H100GPU运行4.9秒。论文作者指出,这种速度不适合对实时性要求高的机器人运动任务。

基于模型的规划结果,图片来源:Cosmos Policy论文

如果按机器人动作50Hz的频率计算,每次策略输出的动作块(action chunk)长度为50,这相当于机器人每动1秒,就需要停下来思考4.9秒。这4.9秒的时间,可能机器人手中的杯子早已滑落。更重要的是,机器人的端侧算力还远达不到8张H100 GPU的量级。

这揭示了世界模型在现阶段的价值和边界:它可以帮助机器人看得更远、减少决策错误,却不需要控制每一次手指运动。

真正执行任务时,机器人面对的是另一个问题。

纸杯开始滑动后,系统没有时间生成几种未来画面再逐一比较。底层模型必须马上增加握力。机器人发现自己取出了两个纸杯,也无需从头规划整杯冰淇淋,只需要调用取杯技能进行局部恢复。

“原子动作”的价值由此显现。它把一个庞大的长程任务缩小成可以单独训练、评测和修正的问题。某个环节失败后,团队可以定位究竟是取杯、舀料还是搅拌出了问题,也可以围绕这个动作补充数据,而不必重新训练整套流程。

技能复用也成为可能。Sharpa已经训练的开柜、取物、拨动开关、舀取和倾倒能力,未来可以重新组合到汉堡、披萨或其他西式快餐流程中。进入新场景后,团队主要补充新物体、新设备和新流程带来的差异数据。

不过,原子动作也不是拆得越细越好。

动作切得太粗,单个模型要处理的变化过多,可靠性难以保证;切得太细,技能数量会迅速膨胀,动作之间的衔接和调度也会变得复杂。如何划定技能边界,实际上是具身智能工程化中的重要能力。

因此,当前的分层架构既包含长期规律,也包含阶段性妥协。

高层推理与底层控制处于不同时间尺度,商业系统又需要故障定位、安全边界和局部恢复,这些因素决定了分层很可能长期存在。今天由工程师人工定义的原子动作、固定工作流和逐场景训练,则可能随着模型能力增强而逐渐减少。未来的机器人或许能够自行发现技能边界,再根据任务动态组合。

换句话说,分层并非权宜之计,人工切分的原子动作更接近一个阶段性方案。

回到我们最初提出的问题:机器人用7分钟、55个步骤做一杯冰淇淋,意义究竟在哪里?

「甲子光年」认为,Sharpa把机器人落地的检验标准,从“能不能完成一个动作”,推进到“能不能在人的环境里完整承担一项工作”,也让世界模型、原子技能、小模型和错误恢复第一次在一条真实商品生产流程中接受共同检验。

当然,一杯冰淇淋还不足以证明Sharpa机器人商业化已经跑通。7分钟的制作时间、几十万元的设备成本,以及长期运行中的可靠性,仍需要继续验证。

李一帆把真实场景的最低标准称为“斩杀线”:整套系统必须跑通,客户愿意持续使用,还要看到上量和降本的可能。

“Demo没有斩杀线,因为demo就是跳个舞,好就是好,不好就是不好,”李一帆说,“场景斩杀线的意思,就像是你要每天晚上开一场演唱会,如果你跳得不太好,没人来,你这个连这个场地都租不起,你就演不下去了。”

为了让机器人“上岗”而专门创造的岗位,迟早会被市场淘汰。机器人真正的价值,是接过一份原本就存在的工作,帮助人类把它做完。

(封面图来源:「甲子光年」拍摄)

了解更多

猜你想看

← 返回首页