李飞飞SimFoundry很酷,但Real2Sim有更多办法

栏目:互联网 | 来源:机器之心Pro | 2026-07-31 13:22

机器之心发布

2026 世界人工智能大会(WAIC)已落下帷幕,本届大会中,具身智能的产业化落地进程成为行业焦点。大量实景机器人落地演示集中亮相,行业技术迭代与场景落地速度持续加快。当前,具身大模型、机器人控制算法仍保持高速演进,与此同时,多元的 Real2Sim 仿真技术路线,也在产业落地过程中逐步展现出不同的适配特性与技术边界。

7 月初,李飞飞团队联合 GEAR、佐治亚理工大学等机构发布全新 Real2Sim 系统 SimFoundry—— 基于单段普通 RGB 视频,自动构建可交互的物理仿真场景,快速生成大量场景 “数字变体”,为机器人快速扩量训练提供了全新技术路径,也让 Real2Sim 技术路线的产业价值得到进一步验证。

用二维视频 “猜” 世界固然是还原物理世界的一种方式,但如视给出了不同思路 —— 不从视频去推演世界,直接从真实空间去构建世界。坐拥全球最大的 6000 万 + 真实三维空间数据,如视已搭建完成一座可直接开采、可复用、高保真的 SimReady “数据矿”。

数据源头革新:真实三维数据重构仿真底层能力

相较于行业主流的二维图像生成、算法推演仿真方案,如视从数据采集源头完成技术迭代,摒弃空间脑补与参数估算,以原生三维结构化数据形成差异化技术优势,核心能力体现在三个维度:

毫米级精度:如视通过自研的激光雷达采集设备,对真实空间进行 1:1 复刻。无论是桌面的高度还是门框的宽度,数据与现实世界保持严格的 1:1 映射,杜绝了视觉重建中的尺度模糊。

零累积误差:在大场景、长距离、多空间的批量采集与重建过程中,如视三维数据保持了高度几何一致性,解决了传统视觉建图的轨迹漂移顽疾。无需算法反复推算、补偿、猜测空间参数,规避累积误差带来的场景扭曲、结构错位问题,保障大场景仿真的稳定性与准确性。

全要素多维信息:如视的每套三维数据,都不是简单的图像堆叠,而是完整的纯三维结构化数据,包含深度、法线、材质属性及精确的物体位姿,所有数据维度精准对齐,为机器人感知、识别、交互、训练提供全套、真实、可落地的场景参数。

从真实空间到仿真训练数据的落地

真实三维数据的精度与完整性,构成了仿真能力的底层壁垒。依托超 6000 万覆盖居家、商业、工业、仓储、户外场景的三维空间数据资源,如视搭建了标准化 Real2Sim 全链路技术体系。通过采集、重建、语义理解、场景扩量的闭环流程,实现物理空间向 AI 可训练仿真场景的高效、标准化转化。

1. 真实空间采集,多模态补齐二维数据维度缺失

摒弃行业惯用的单一 RGB 视频、平面照片等轻量化采集模式,如视通过自研专业设备,同步采集 RGB 全景、深度、激光点云、精准位姿、Mesh 网格等多模态数据。全方位收录物理空间的结构、尺度、位置、细节信息,补齐二维采集缺失的空间维度参数,为高精度三维重建和真实仿真筑牢原始数据基底。

2. 行业领先毫米级三维重建,标准化数字孪生场景

基于多模态原始数据,依托算法进行三维重建,规整场景结构、优化纹理细节、校准空间拓扑与相机位姿,标准化输出完整、规整的数字孪生场景。整套流程是对原始真实空间的规整优化,而非算法推演生成,为后续语义理解、场景编辑扩量提供标准化三维载体。

实景

合成

实景

合成

3. 三维结构化语义理解,实现场景可供性认知

在精准重建基础上,完成场景物体分割、语义标注与实例识别,实现物体可供性(Affordance)判定,精准识别物体承重、可拉动、可行走等交互属性。相较于二维图像语义推测,如视基于真实三维采集数据做结构化标注,避免了认知偏差与幻觉问题,定位更精准、语义更可靠、精度更高,让空间数据成为机器人可读懂的 “场景说明书”。

视频链接:https://mp.weixin.qq.com/s/2HU19DugAbA1Cz2Rw9fpdw

4. 真实基底场景无限扩展,满足泛化训练需求

基于真实场景的语义与物理属性,支持自由替换物体、调整空间布局、修改物理参数,可叠加真实材质、碰撞、光照等仿真要素,从单一真实场景衍生出海量变体场景,可交互、可训练、可评测。所有扩展场景均基于真实物理规则,无算法脑补偏差,以低成本、高效率完成大规模仿真场景的规模化生成,充分满足具身模型的泛化训练需求。

视频链接:https://mp.weixin.qq.com/s/2HU19DugAbA1Cz2Rw9fpdw

从技术迭代进程来看,以 SimFoundry 为代表的视频驱动 Real2Sim 方案,凭借轻量化、低成本、快速生成场景的优势,为具身智能快速迭代、原型验证提供了高效技术路径,极大推动了 Real2Sim 赛道的技术普及。

这也让 Real2Sim 赛道的竞争逻辑愈发清晰:轻量化视频仿真适合快速试错与基础模型迭代,而基于真实三维空间的原生仿真,是支撑具身智能从实验室演示走向工业级落地、实景泛化的核心刚需。赛道下半场的核心壁垒,不再是单一的算法推演能力,而是真实场景数据的体量、精度与结构化加工能力。

了解更多

猜你想看

← 返回首页