李飞飞,发了个能“暂停时间”的世界模型

栏目:互联网 | 来源:智东西 | 2026-09-02 11:05
智东西编译   王涵编辑   心缘

智东西9月2日消息,今天凌晨,“AI教母”李飞飞的世界模型创企World labs发布新一代世界模型Atlas

该模型采用多模态自回归扩散Transformer架构,将所有输入融合到一个共享的空间上下文之中。

Atlas可以借助这一上下文来预测后续内容,在三维空间中与已见信息保持连贯一致,并能推想视野之外的景象。同时,Atlas遵循Scaling Law,其性能会随训练计算量的增加而稳步提升。

Atlas可执行世界生成、重建和模拟等任务,具体能力如下:

1、摄像机控制生成:

Atlas可以根据一张或多张图像生成图像和视频,支持像素级精准的摄像机控制,可输出长达一分钟、分辨率高达1440p的视频内容。


2、空间重建:

Atlas可以依据一至数十张输入图像,即可重建真实世界的三维场景。它既能生成新视角下的图像帧,也能输出显式的3D数据,其表现甚至超越了专攻三维重建的顶尖模型。


3、时空模拟:

Atlas可基于输入视频对空间与时间进行联合建模,可对视频进行重新构图,同时为机器人领域开启“真实到模拟”的工作流程。

4、图像生成:

Atlas可根据文本描述生成图像及360°全景图,不仅能遵循复杂指令,精准呈现文字,还能驾驭丰富多样的视觉风格。

在技术报告中,World labs团队补充称,Atlas将作为核心技术,驱动World Labs旗下Marble及未来更多产品的迭代升级。

一、可以想象摄像机后方场景,还能生成360°全景图

在摄像机控制方面,Atlas能够根据一张或多张参考图像,在用户指定的任意摄像机位置和角度生成全新的视角。生成的画面与输入图像的内容和几何结构严格匹配,并且可以平滑地向外推演,补全输入中未能呈现的场景部分。

例如,Atlas可驾驭多种场景类型、视觉风格和摄像机运动轨迹。

Atlas还可以将摄像机几何参数作为原生输入类型,用户能够精准地构图每一帧画面,掌控每一个运动细节。

例如,Atlas仅凭一张输入图像即可生成完整的场景。它利用输入图像的内容,结合自身世界知识,想象出场景在新视角下应有的样貌。


与大型语言模型类似,Atlas会先将输入编码为上下文,再基于该上下文生成输出。但其的独特之处在于,用户输入的每张图像都会被锚定在空间中的某个三维位置,由此构成一个空间上下文。

例如,用户可以将两张毫无关联的参考图像放入上下文中,在三维空间里分别指定它们的位置,Atlas便能生成一个在二者之间平滑过渡的世界。


Atlas还可以将摄像机运动控制与空间上下文管理相结合,成精准可控的长视频。每个场景、每个镜头角度都由用户设计。

例如,用户可以仅凭少量参考图像,生成分辨率为1440p、时长一分钟的视频。用户可以手动设计一条穿越场景的摄像机路径,Atlas将据此生成一个连贯一致的世界。


Atlas的主要定位是世界建模,但它同样能够根据文本提示生成图像,支持复杂指令、文字渲染以及多种视觉风格。

此外,Atlas也可以根据文本或图像输入生成360°全景图,覆盖多种场景类型和风格。

二、2张图就能重建三维空间,能根据地面图片生成鸟瞰图

在空间重建方面,World Labs团队认为,Atlas在“基于稀疏输入图像的新视角合成”,这一三维计算机视觉领域数十年来未破的基础性难题的解决上,有了初步的进展。

在实际体验中,用户可以自由选择输入视角图像的数量。如果输入图像中某些区域不可见,Atlas会借助其世界知识,以合理的方式补全缺失内容。

当然,用户也可以选择关闭“想象”模式,进行精确重建。Atlas的空间上下文最多可容纳上百张输入图像,支持用户对真实环境进行高保真复现。

例如,Atlas可以仅凭一张地面拍摄的照片,就生成该场景的鸟瞰图。输入照片中可见的花园在模型输出中得到了精准还原,场景其余部分则是模型想象出来的。

在添加第二张房屋图像后,模型输出同时呈现了花园和房屋,但左侧的房屋仍是想象的产物。在加入第三张主楼的输入图像后,Atlas便生成了整个场景。

再比如,World Labs团队逐步构建了斯坦福大学主方庭的场景——从绿草如茵的正门入口开始,直至纪念教堂外墙上五彩斑斓的马赛克装饰。

整个过程Atlas只接收了25张从地面拍摄的图像,它就能直接生成从校园上空远距离俯瞰的飞行路径画面。

面对同一场景,Atlas能够生成多条不同的运动轨迹。无论用户如何调整摄像机路径,场景始终保持连贯一致。

例如,基于少量输入图像,Atlas可以生成多条穿越同一场景的摄像机路径。不同路径可分别突出场景的不同部分,用户也可以调整画面的速度、长度或复杂度

前述示例中,Atlas输出的是二维图像与视频。但在机器人、游戏、设计、视觉特效等领域,工作流往往需要显式的三维输出。

Atlas原生支持二维图像帧与三维深度图的双重处理,能够将生成的世界以点云或3D高斯泼溅的形式输出。

从一张图像出发,Atlas可以生成新视角并估算三维几何,进而转换为3D高斯泼溅。若用户输入的是真实空间的视频,模型则会预测每一帧的深度,并将其整合为三维重建。


Atlas还会填补点云中的剩余空缺,将其转化为完整的高斯泼溅场景,并在设备端以高分辨率、高帧率进行渲染。

三、三个机位模拟“子弹时间”,还能模拟机器人导航

Atlas本身就是一个世界模拟器,它既理解世界的空间结构,也懂得世界随时间如何演变。将空间能力与时间能力融合在一起,Atlas便可以应用于视觉特效、机器人等领域。

有了Atlas,几台普通摄像机就能摇身一变,组成一套“子弹时间”式多视角拍摄系统。只需三台摄像机同步录制的画面,Atlas就能让时间定格,并任意调整镜头角度


同时,在机器人仿真领域,Atlas为导航与操作类任务的“真实到模拟”规模化扩展提供了新的选择。

当模拟机器人在该空间中移动时,Atlas会同步生成其传感器沿途理应观测到的RGB图像与深度数据

例如,World Labs团队用手机拍摄了两个大型环境,各取24帧画面用于重建。团队模拟了不同类型机器人在场景中沿不同路径行进,并由Atlas从机器人身上搭载的摄像机视角生成实时画面。


在操作类任务上,只需几段随意录制的视频,Atlas就能帮助构建一个可捕捉物体运动与交互的仿真环境。

任务模拟完成后,用户可以改变各种变量,如替换物体、调整位置、改变机器人动作、更换光照或背景等,为机器人规模化训练提供多样化的数据与测试环境。

四、融合LLM与扩散模型优势,摄像机指令遵循度、重建精度均超专用模型

Atlas采用全新统一架构,以空间控制为核心,融合多模态处理、自回归生成、扩散模型与Transformer骨干网络。

该架构原生支持文本、图像、相机位姿及3D深度图,视频以图像序列形式输入。Atlas通过逐一生成序列元素(每个元素依赖前序信息)实现输出,并采用逐步去噪方式生成高质量图像与视频等高维连续数据。Transformer结构则保证了模型与现代硬件的适配。


这一设计融合了大语言模型与视频模型的双重优势:一方面可应用KV cache、分离式服务等大模型加速与部署技术;另一方面也能采纳扩散蒸馏、无分类器引导、偏移噪声调度及VAE改进等图像视频生成领域的前沿算法。

摄像机控制对比中,Atlas原生支持相机参数编码路径,其他模型则需通过文本描述(如平移、推轨等电影术语)来指示。测试结果显示,Atlas对摄像机指令的遵循度更高,且在复杂轨迹下优势更明显。

此外,在稀疏输入三维重建任务中,模型会接收一组图像及其相机位姿,并预测每个输入像素对应的三维点,Atlas的表现仍优于最佳的专用开源重建模型

结语:统一架构兼顾多任务,Atlas给出世界模型的工程化答案

Atlas的发布,标志着World Labs在空间智能领域迈出了实质性的一步。

与过往侧重单一模态或特定任务的模型不同,Atlas从设计之初便以空间为核心,将多模态理解、三维重建、时空模拟与生成能力融于一体,构建了一个可扩展的世界模型底座。

从技术路径来看,这种统一架构不仅降低了多任务部署的复杂度,也为后续与机器人、VFX、游戏等行业的结合预留了接口。

了解更多

猜你想看

← 返回首页