智东西(公众号:zhidxcom)




编译 |  王涵




编辑 |  心缘



智东西9月2日消息,今天凌晨,“AI教母”李飞飞的世界模型创企World labs发布


新一代


世界模型Atlas





李飞飞,发了个能“暂停时间”的世界模型



该模型采用


多模态自回归扩散Transformer架构


,将所有输入融合到一个共享的空间上下文之中。



Atlas可以借助这一上下文来预测后续内容,在三维空间中与已见信息保持连贯一致,并能推想视野之外的景象。同时,Atlas遵循Scaling Law,其性能会随训练计算量的增加而稳步提升。



Atlas可执行


世界生成、重建和模拟


等任务,具体能力如下:





1、摄像机控制生成:




Atlas可以根据一张或多张图像生成图像和视频,支持像素级精准的摄像机控制,可输出长达一分钟、分辨率高达1440p的视频内容。



李飞飞,发了个能“暂停时间”的世界模型





2、空间重建:




Atlas可以依据一至数十张输入图像,即可重建真实世界的三维场景。它既能生成新视角下的图像帧,也能输出显式的3D数据,其表现甚至超越了专攻三维重建的顶尖模型。



李飞飞,发了个能“暂停时间”的世界模型





3、时空模拟:




Atlas可基于输入视频对空间与时间进行联合建模,可对视频进行重新构图,同时为机器人领域开启“真实到模拟”的工作流程。



李飞飞,发了个能“暂停时间”的世界模型





4、图像生成:




Atlas可根据文本描述生成图像及360°全景图,不仅能遵循复杂指令,精准呈现文字,还能驾驭丰富多样的视觉风格。



李飞飞,发了个能“暂停时间”的世界模型



在技术报告中,World labs团队补充称,Atlas将作为核心技术,驱动World Labs旗下Marble及未来更多产品的迭代升级。



一、可以想象摄像机后方场景,还能生成360°全景图



在摄像机控制方面,Atlas能够根据一张或多张参考图像,在用户指定的


任意摄像机位置和角度


生成全新的视角。生成的画面与输入图像的内容和几何结构严格匹配,并且可以


平滑地向外推演


,补全输入中未能呈现的场景部分。



例如,Atlas可驾驭多种场景类型、视觉风格和摄像机运动轨迹。



李飞飞,发了个能“暂停时间”的世界模型



Atlas还可以将


摄像机几何参数


作为原生输入类型,用户能够精准地构图每一帧画面,掌控每一个运动细节。



例如,Atlas仅凭一张输入图像即可生成完整的场景。它利用输入图像的内容,结合自身世界知识,想象出场景在新视角下应有的样貌。



李飞飞,发了个能“暂停时间”的世界模型



与大型语言模型类似,Atlas会先将输入编码为上下文,再基于该上下文生成输出。但其的独特之处在于,用户输入的每张图像都会


被锚定在空间中的某个三维位置


,由此构成一个空间上下文。



例如,用户可以将两张毫无关联的参考图像放入上下文中,在三维空间里分别指定它们的位置,Atlas便能生成一个在二者之间平滑过渡的世界。



李飞飞,发了个能“暂停时间”的世界模型



Atlas还可以


将摄像机运动控制与空间上下文管理相结合


,成精准可控的长视频。每个场景、每个镜头角度都由用户设计。



例如,用户可以仅凭少量参考图像,生成


分辨率为1440p、时长一分钟


的视频。用户可以手动设计一条穿越场景的摄像机路径,Atlas将据此生成一个连贯一致的世界。



李飞飞,发了个能“暂停时间”的世界模型



Atlas的主要定位是世界建模,但它同样能够


根据文本提示生成图像


,支持复杂指令、文字渲染以及多种视觉风格。



此外,Atlas也可以根据文本或图像输入生成


360°全景图


,覆盖多种场景类型和风格。



李飞飞,发了个能“暂停时间”的世界模型



二、2张图就能重建三维空间,能根据地面图片生成鸟瞰图



在空间重建方面,World Labs团队认为,Atlas在


“基于稀疏输入图像的新视角合成”


,这一三维计算机视觉领域数十年来未破的基础性难题的解决上,有了初步的进展。



在实际体验中,用户可以


自由选择输入视角图像的数量


。如果输入图像中某些区域不可见,Atlas会借助其世界知识,以合理的方式补全缺失内容。



当然,用户也可以选择关闭“想象”模式,进行精确重建。Atlas的空间上下文最多可容纳


上百张输入图像


,支持用户对真实环境进行高保真复现。



例如,Atlas可以


仅凭一张地面拍摄的照片,就生成该场景的鸟瞰图


。输入照片中可见的花园在模型输出中得到了精准还原,场景其余部分则是模型想象出来的。



在添加第二张房屋图像后,模型输出同时呈现了花园和房屋,但左侧的房屋仍是想象的产物。在加入第三张主楼的输入图像后,Atlas便生成了整个场景。



李飞飞,发了个能“暂停时间”的世界模型



再比如,World Labs团队逐步构建了斯坦福大学主方庭的场景——从绿草如茵的正门入口开始,直至纪念教堂外墙上五彩斑斓的马赛克装饰。



整个过程Atlas只接收了


25张从地面拍摄的图像


,它就能直接生成从校园上空远距离俯瞰的飞行路径画面。



李飞飞,发了个能“暂停时间”的世界模型



面对同一场景,Atlas能够生成


多条不同的运动轨迹


。无论用户如何调整摄像机路径,场景始终保持连贯一致。



例如,基于少量输入图像,Atlas可以生成多条穿越同一场景的摄像机路径。不同路径可分别突出场景的不同部分,用户也可以调整


画面的速度、长度或复杂度





李飞飞,发了个能“暂停时间”的世界模型



前述示例中,Atlas输出的是二维图像与视频。但在机器人、游戏、设计、视觉特效等领域,工作流往往需要显式的三维输出。



Atlas


原生支持二维图像帧与三维深度图的双重处理


,能够将生成的世界以


点云或3D高斯泼溅


的形式输出。



从一张图像出发,Atlas可以生成新视角并估算三维几何,进而转换为3D高斯泼溅。若用户输入的是真实空间的视频,模型则会预测每一帧的深度,并将其整合为三维重建。



李飞飞,发了个能“暂停时间”的世界模型



Atlas还会填补点云中的剩余空缺,将其转化为完整的高斯泼溅场景,并在设备端以高分辨率、高帧率进行渲染。



李飞飞,发了个能“暂停时间”的世界模型



三、三个机位模拟“子弹时间”,还能模拟机器人导航



Atlas本身就是一个世界模拟器,它既理解世界的空间结构,也懂得世界随时间如何演变。将空间能力与时间能力融合在一起,Atlas便可以应用于视觉特效、机器人等领域。



有了Atlas,几台普通摄像机就能摇身一变,组成一套


“子弹时间”式多视角拍摄系统


。只需三台摄像机同步录制的画面,Atlas就能让时间定格,并


任意调整镜头角度





李飞飞,发了个能“暂停时间”的世界模型



同时,在机器人仿真领域,Atlas为


导航与操作类任务的“真实到模拟”规模化扩展


提供了新的选择。



当模拟机器人在该空间中移动时,Atlas会同步生成


其传感器沿途理应观测到的RGB图像与深度数据





例如,World Labs团队用手机拍摄了两个大型环境,各取24帧画面用于重建。团队模拟了不同类型机器人在场景中沿不同路径行进,并由Atlas从机器人身上搭载的摄像机视角生成实时画面。



李飞飞,发了个能“暂停时间”的世界模型



在操作类任务上,只需几段随意录制的视频,Atlas就能帮助构建一个可捕捉物体运动与交互的仿真环境。



任务模拟完成后,用户可以改变各种变量,如替换物体、调整位置、改变机器人动作、更换光照或背景等,为机器人规模化训练提供多样化的数据与测试环境。



四、融合LLM与扩散模型优势,摄像机指令遵循度、重建精度均超专用模型



Atlas采用全新统一架构,以空间控制为核心,融合多模态处理、自回归生成、扩散模型与Transformer骨干网络。



该架构


原生支持文本、图像、相机位姿及3D深度图


,视频以图像序列形式输入。Atlas通过逐一生成序列元素(每个元素依赖前序信息)实现输出,并采用


逐步去噪


方式生成高质量图像与视频等高维连续数据。Transformer结构则保证了模型与现代硬件的适配。



李飞飞,发了个能“暂停时间”的世界模型



这一设计


融合了大语言模型与视频模型的双重优势


:一方面可应用KV cache、分离式服务等大模型加速与部署技术;另一方面也能采纳扩散蒸馏、无分类器引导、偏移噪声调度及VAE改进等图像视频生成领域的前沿算法。



摄像机控制对比中,Atlas原生支持相机参数编码路径,其他模型则需通过文本描述(如平移、推轨等电影术语)来指示。测试结果显示,


Atlas对摄像机指令的遵循度更高


,且在复杂轨迹下优势更明显。



李飞飞,发了个能“暂停时间”的世界模型



此外,在稀疏输入三维重建任务中,模型会接收一组图像及其相机位姿,并预测每个输入像素对应的三维点,Atlas的表现仍


优于最佳的专用开源重建模型





李飞飞,发了个能“暂停时间”的世界模型



结语:统一架构兼顾多任务,Atlas给出世界模型的工程化答案



Atlas的发布,标志着World Labs在空间智能领域迈出了实质性的一步。



与过往侧重单一模态或特定任务的模型不同,Atlas从设计之初便以空间为核心,将多模态理解、三维重建、时空模拟与生成能力融于一体,构建了一个可扩展的世界模型底座。




从技术路径来看,这种统一架构不仅降低了多任务部署的复杂度,也为后续与机器人、VFX、游戏等行业的结合预留了接口。