田晏林 发自 凹非寺
量子位 | 公众号 QbitAI
好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?!
而且,GPT-6-Astra、Physical Intelligence的π0.5、GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。
出手的是一家中国机器人公司——清华唯一持股的嫡系具身公司,星动纪元。
近日,星动纪元自研的世界动作模型VPP2,一举登顶RoboDojo仿真榜单。
综合平均成功率32.26%,综合平均得分39.26分,两个指标双双第一。

关键是,这场比赛还真不好打。
RoboDojo号称具身智能界的「珠穆朗玛峰」,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。
它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?
总之,想靠刷熟练度蒙混过关,没那么容易。
结果呢?
星动纪元VPP2不仅拿下综合第一,在泛化能力、精细操作、记忆能力三个维度上,也拔得头筹。

据说,这次VPP2没有额外加数据,也没用Agent RSI等增强手段,仅靠「标准数据集」,就把一众高手给卷了下去。
这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。
不是,哥们儿,这么夯的模型到底是怎么练出来的啊???
我们往技术路线里扒了扒,你别说,VPP2这次的突破,还真有点东西。
它瞄准了世界动作模型的一道老大难问题:预测错了,动作就跟着错。
VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。
从预测到行动,两种泛化能力一起提升。
从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。
世界动作模型WAM,卷出一个新冠军
具身智能行业有个挺尴尬的现象。
机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?
还真不好回答。
比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。
更别提那些需要连续执行多个步骤的任务了。

这也是为什么,RoboDojo这套评测值得关注。
它的目标是为具身智能建立统一、可复现的评测标准,仿真测试包含42项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。
说白了,就是把机器人拉出舒适区。
传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。
RoboDojo专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。
而VPP2这次交出的成绩单,相当亮眼。
平均成功率32.26%、平均得分39.26分,两个指标均位居榜首。
作为对比,在RoboDojo仿真基准的后训练评测中,GPT-6-Astra的平均成功率为22.48%,平均得分28.97分。
而VPP2分别领先9.78个百分点和10.29分。

这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。
两项指标均综合了五大能力维度的测试结果。
换句话说,VPP2不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。
而且,这种领先并不局限于综合成绩。
拆开五项能力维度来看,VPP2在泛化、精准操作、记忆三个维度上,同样拿下第一。
这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。
综合成绩领先,关键能力也能打。

不过,RoboDojo再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。
VPP2在仿真里展现出的泛化能力,到了真机上还能成立吗?
星动纪元也做了实验。
这次,团队直接把VPP2部署到真实ALOHA双臂机器人上,测试了抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务。
也就是说,无需针对这些测试任务进行额外微调,机器人就得直接上手。
结果,VPP2再次交出领先成绩:平均成功率58.5%,高于π0.5的40%。

在10类任务里,VPP2拿下了9类最佳成绩。
这下有意思了。
榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。
两份成绩单摆在一起,VPP2的技术优势就更值得深挖了。
要知道,VPP2走的是世界动作模型(WAM)路线。
这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。
但这条路线长期存在一个问题:视频预测得漂亮,不代表机器人真的会干活。
VPP2这次,偏偏就冲着这个问题去了。
从预测泛化到行动泛化,VPP2怎么做到的?
想理解VPP2的突破,先来看一个简单任务:让机器人把桌上的杯子放进盒子里。
对人类来说,伸手抓住、抬起来、放进去,几乎不用思考。
但机器人得判断杯子的位置、机械臂的运动轨迹、夹爪何时闭合,还要预测整个操作过程中,物理世界会发生什么变化。任何一步出了偏差,都可能翻车。
现有的世界动作模型(WAM),恰恰容易在这里出问题。
一方面,普通视频模型擅长生成画面,但画面看着合理,和符合真实物理规律是两回事。
比如要求抓左边的杯子,模型却预测抓起右边那个。视频照样能生成,机器人执行时却会直接跑偏。
另一方面,直接把动作学习加入视频模型,还可能损伤原本的泛化能力。
结果动作学会了,机器人换个环境却不会做了。
VPP2提出了一个很直接的判断:视频预测的质量,决定了动作的上限。

基于这一思路,星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。
星动纪元为此设计了一套三阶段训练策略:
- 第一阶段,事件级视频继续预训练,让模型学会预测完整操作过程。
- 第二阶段,固定时长视频后训练与蒸馏,让预测能力跟得上机器人实时执行的速度。
- 第三阶段,动作专家训练,将视频预测转化为具体动作,同时尽量保住原有的泛化能力。

三个阶段层层递进,最终指向两个核心突破:预测能泛化,行动也能泛化。
第一个突破:让视频预测具备泛化能力
VPP2首先要解决的,是机器人能否准确预测陌生任务中的物理变化。
星动纪元以阿里开源的Wan2.1-I2V-14B为基础,整合机器人操作、人类活动、通用视频等多种数据,覆盖不同机器人本体和操作方式。
不过,真正有意思的是它对数据的处理。
团队没有简单地把视频一股脑喂给模型,而是先将操作过程切分成语义完整的片段,再配上详细描述。
比如,不能只告诉模型「把杯子放进盒子」,还要明确是哪只机械臂、哪个杯子、哪个盒子,以及整个操作过程。
因为同一句模糊指令,可能对应无数种动作轨迹。
模型如果连操作对象都没搞清楚,自然很难准确预测未来。
VPP2索性把任务描述得更细,让语言指令和物理操作形成更稳定的对应关系。

更关键的一步,是事件级视频预测训练。
传统短时预测关注接下来几帧会发生什么,而VPP2直接让模型学习一次完整操作从开始到结束的变化。
从机械臂靠近杯子,到抓住杯子,再到放进盒子,模型要理解的是一整件事如何发生。
这样一来,面对新的物体、位置甚至操作任务,它才更有机会预测合理的物理变化。
在机器人操作视频的指令遵循测试中,14B参数的VPP2达到90%的成功率,而64B参数的Cosmos3模型为78%。

14B打赢64B。
这也说明,在物理操作预测中,参数规模并非唯一的胜负手,能否真正理解操作过程同样重要。
不过,预测得再准,机器人动不起来,也白搭。
第二个突破:让预测泛化变成行动泛化
这里有两道坎,一是速度,二是如何在学会动作的同时,保住视频模型原有的泛化能力。
第一道坎很好理解。如果让机器人干活,每个动作发生前都要花几秒生成视频,那么再强的预测能力也很难派上用场。
星动纪元选择先给预测模型提速。
团队将事件级预测模型进一步调整为固定8秒的视频片段预测,再通过一致性蒸馏,将多步计算压缩为单步生成。
最终,预测未来8秒的视觉变化,计算耗时约0.12秒。
第二道坎,稍微棘手一些。
前面好不容易让视频模型学会了预测陌生任务,结果加入动作训练后,模型反而只会执行熟悉的操作。
动作能力长出来了,泛化能力却丢了?VPP2要做的,就是同时跨过这两道坎。

VPP2引入一个0.9B参数的扩散Transformer(Action DiT),采用MoT架构,学习如何根据预测的未来状态生成机器人动作。
但星动纪元没有直接将视频预测模型(Video DiT)和动作专家一起从头训练。
在动作训练初期,视频模型的基础参数被冻结,仅通过LoRA进行适配,尽量避免动作训练破坏已有的预测泛化能力。
相当于先让机器人理解物理世界怎么变化,再训练它如何把这种「理解」转化为「动作」。
两种能力分阶段生长,又相互配合。
最终,视频预测约耗时0.12秒,动作专家约耗时0.1秒,整体动作片段生成延迟约为0.22秒。

当然,架构再漂亮,也得看最终效果。
前面提到的ALOHA真实机器人零样本测试,已经展现出VPP2将预测能力转化为陌生任务操作的潜力。
另外两套泛化测试,则进一步验证了这条路线。
LIBERO-Pro考察物体位置、任务要求变化后的操作能力,VPP2取得45.0%的总体成功率,其他基线模型最高为11.0%。
LIBERO-OOD则考察组合泛化,将熟悉的物体、布局和任务目标重新组合,形成此前没见过的新任务。
VPP2的总体成功率达到63.9%。

把这些结果放在一起看,VPP2的技术思路就清楚了。
先通过多源数据、详细任务描述和事件级预测训练,让模型更准确地预测物理变化。
再通过蒸馏加速、分阶段动作学习,将这种预测能力转化为实际操作,同时尽量保留原有的泛化能力。
具身智能的性能上限,显然还没到只能靠规模硬堆的地步。
VPP2再次说明,优化数据管线、调整训练范式,这些看似朴素的工程方法,仍然有机会带来可观的模型性能提升。
从GPT到WAM,物理AI正在形成新范式
预测能泛化,行动也能泛化,是VPP2作为世界动作模型WAM,最值得关注的核心突破。
但真实任务往往更加复杂。机器人不仅要知道怎么做,还得判断先做什么、后做什么。
这就需要更高层的认知与规划能力参与进来。
星动纪元这里贡献了一个思路:GPT负责想,VPP2负责做。
前者负责理解、推理和规划,把复杂任务拆解成明确步骤;后者负责预测物理世界如何变化,再将规划转化为具体动作。
这一思路,在VPP2论文中已经有了初步的实验支撑。
团队实际采用的是VLM高层规划器,由其负责语义理解、记忆和任务拆解,再将明确的子任务交给VPP2执行。
结果相当直观。在RoboDojo选定的长程任务测试中,引入VLM子任务规划后,平均成功率从27.6%提升至57.6%。
这意味着,机器人要完成复杂任务,光有强大的动作能力还不够。高层规划与底层执行能否配合,同样影响任务完成效果。
顺着这条思路往后看,GPT+VPP2有望形成一种新的物理AI技术范式:通用认知+通用物理执行。
GPT等通用模型负责理解意图、推理和规划,VPP2这样的WAM负责预测物理变化、生成动作,再通过执行反馈持续调整。
从认知、规划、预测,到执行、反馈,一套完整的物理AI闭环逐渐清晰。
而这,也让WAM的价值有了更大的想象空间。
模型能力要通过本体与物理世界交互,真实使用又会暴露失败、产生反馈,推动模型和硬件继续改进。
星动纪元同时做大脑、本体和灵巧手,「深全栈」的战略可以在这一逻辑中得到解释:公司试图掌握的不仅是训练环节,也包括能力落地与反馈回流的环节。
u1s1,技术路线再漂亮,最终还是得去真实世界里干活。
星动纪元在这方面,已与中国邮政、顺丰等企业开展合作,在全国5个省市、10余个物流中心常态化运营。

物流场景中的货物尺寸、摆放位置、作业流程都可能发生变化。同样一套操作,换个仓库,机器人可能就得重新适应。
这也对机器人的泛化能力提出了更高要求。
模型能否把学过的本事迁移到陌生任务中,直接关系到未来跨场景部署的效率和成本。
当然,已有物流业务的商业化进展,并不意味着VPP2已经实现规模化部署。模型能否在更多真实场景中长期稳定运行,还需要进一步验证。
但VPP2这次的成绩,已经释放出一个值得关注的信号。
世界动作模型的竞争,正在从预测未来,进一步走向把预测转化为通用行动。
回头再看RoboDojo登顶,值得关注的也就不只是一个第一名了。
从仿真到真机,从预测泛化到行动泛化,VPP2的一系列实验结果表明:视频预测与动作学习的分阶段训练,确实能够提升机器人在陌生任务中的操作能力。
而随着GPT等通用认知模型与WAM进一步结合,物理AI也有望形成更完整的能力体系。
说到底,具身智能下一轮比拼的,就是机器人能否把学到的本事,带进更多陌生场景。
预测得准,还要做得到。这才是世界动作模型真正走向物理世界的关键。
PS:VPP2现已开源,感兴趣的朋友可以上手试试,复现一下论文结果。
要是真跑出什么惊喜,记得回来跟我们唠唠~
1.开源代码
:https://github.com/roboterax/video-prediction-policy-2
2.项目主页:
https://robert-gyj.github.io/video-prediction-policy-2