Token导航 LogoToken导航TokenDH.com

当空间成为上下文:Atlas如何改变AI与机器人的模型竞争

更新时间 2026-09-03来源 有界UnKnown正文 4037字阅读约 13分钟12 张图片
图片
图片
©有界UnKnown原创
作者丨山茶
编辑|钱江

9月1日,李飞飞创办的World Labs发布了下一代世界模型Atlas。

在大多数媒体的报道中,Atlas被定义为一个颠覆之作,比如称其为全球首个多模态世界模型,认为它让世界模型进入新时代、打开了通往“空间智能”大门等等。

当然,在语言严重通货膨胀的AI行业里,这样的颠覆其实每天都在发生,世界模型更是一个已经被严重泛化的概念,现在是个企业,都在标榜自己是世界模型。

比如,做LLM的公司声称自己是世界模型,因为它可以让智能体在内部预测“采取一个动作后,世界会变成什么样”;

视频生成公司也在标榜自己做的是世界模型,因为它能连续生成看起来合理的画面;

机器人领域更是世界模型的“重灾区”,因为具身智能模型需要描述空间、物体、运动、物理规律以及动作后果......

但恰恰是在这样的情况下,李飞飞的Atlas仍然被定义为颠覆之作,那么这个Atlas和原来哪些已经烂大街的世界模型又有什么不同?它又会给现在的AI行业,带来一些什么样的改变?

图片

把空间放进上下文:

Atlas究竟是什么?

按照官方定义,Atlas是一款面向“空间智能”的全模态世界模型。

它能在统一架构中处理文本、图像、视频和3D信息,完成世界生成、现实空间重建和时空模拟等任务。

简单来说,就是它既可以像大语言模型一样,根据已有上下文逐步生成后续内容;又可以像图像和视频扩散模型一样,通过去噪生成高质量视觉结果。

从技术架构来看,Atlas是一种从头预训练的“多模态自回归扩散Transformer”。它融合了LLM的自回归Transformer范式与图像、视频模型的扩散机制,并将相机位姿和深度等三维信息纳入共享空间上下文。

因此,与主要根据提示词生成单张图片或一段视频的模型不同,Atlas会把图片、相机位置、观察角度和深度信息放入同一个“空间上下文”。

在此基础上,模型不仅要理解画面中有什么,还要判断这些内容在三维空间中的位置,并根据已有信息,生成相机移动到其他位置后应该看到的画面。

这一点从Atlas的演示视频中能够很直观地看到,传统多模态模型生成的画面,要么是一张静态图,要么是一个确定轨迹的视频。而Atlas生成的却是一个空间,就像中介看房时给你的3D视频一样,你可以自由切换视角,调整位置,查看整个空间的不同地方。

因此,如果说LLM通过逐个生成Token延续语言上下文,Atlas则是在由图像、相机位姿和深度共同构成的空间上下文中,逐步生成新的图像与三维信息,并尽量维持不同视角之间的一致性。

整体来看,World Labs将Atlas的能力概括为四类:

第一类是相机控制生成。

用户可以输入一张或多张参考图片,直接指定相机的位置、角度和运动路径,生成新视角下的图像或视频。相比通过提示词描述“镜头向左移动”“围绕人物旋转”,Atlas将相机几何参数作为原生输入,可以更精确地控制构图和镜头运动。

根据官方展示,Atlas支持输入1至6张参考图片,结合人工设计的相机路径,生成最长1分钟、分辨率最高1440p的视频。即使相机移动到原图没有拍摄的位置,模型也可以结合输入内容和自身的世界知识,补全物体背面及周围环境。

图片

第二类是空间重建。

Atlas可以根据一张到数十张图片重建真实场景,也可以接收超过100张图片,以获得更加完整的空间信息。输入图片越少,模型需要自行补全的区域越多;输入视角越丰富,重建结果越接近真实环境。

Atlas输出的不只是一组新视角下的二维画面。它可以同时预测深度和三维几何,将场景输出为点云或3D Gaussian Splat(高斯泼溅),从而形成可以实时渲染和继续使用的三维空间。

World Labs称,在部分场景中,Atlas只需两三张图片就能完成较为可信的重建,并在官方测试中超过了一些专门用于3D重建的模型。

图片
但这里有一个注意点,Atlas虽然可以补全不可见区域,但这些内容是基于模型知识生成的合理想象,并不一定符合原始场景。

第三类是时空模拟。

Atlas可以根据多机位拍摄的视频重新构建观察视角。例如,使用3至5台普通手机或运动相机完成拍摄后,模型可以让画面在某一时刻“冻结”,再从原本没有摄像机的位置重新观察,生成类似“子弹时间”的视觉效果。

图片

这一能力也被用于机器人仿真。

World Labs展示了使用手机视频中的24帧画面重建大型环境,再让不同类型的机器人在虚拟场景中沿不同路径移动。Atlas可以同步生成机器人机身摄像头理论上应该看到的RGB画面和深度数据,为机器人导航、操作训练和测试提供环境。

在操作任务中,Atlas还可以辅助构建包含刚性物体、可动部件和柔性物体的仿真场景。任务被转化为仿真环境后,开发者可以改变物体种类与位置、机器人运动、光照和背景,从一个真实场景中衍生出更多训练条件。

第四类是图像生成。

尽管这不是Atlas的主要定位,它仍然可以根据文本生成图片和360度全景图,支持复杂提示词、文字渲染以及多种视觉风格。

World Labs表示,Atlas的能力会随着训练数据、模型规模和计算量增加而提升。现阶段,Atlas仍处于早期访问阶段,只向部分合作伙伴开放,未来将成为World Labs旗下3D世界生成产品Marble及其他产品的底层模型。

图片

Atlas改变了什么?

目前,ChatGPT带动的这一轮AI浪潮,主要建立在大语言模型之上。

模型通过学习海量文本,掌握语言、知识和推理之间的统计关系,再根据上下文预测下一个Token。

但现实世界并不是由文字组成的。

一个真正能够进入现实环境的AI,不仅要知道“杯子”“桌子”和“重力”分别是什么意思,还要理解杯子放在桌子的什么位置,从不同角度观察时是什么样子,被推一下之后会向哪里移动,以及一个动作会对周围环境造成什么影响。

视频生成模型已经向这个方向迈出了一步,让AI从静态图像走向动态画面,但核心仍是视觉合理性:画面看起来真实即可,背后是否存在稳定的三维结构、物体切换视角后能否保持一致,并非其首要目标。

Atlas进一步把空间关系纳入模型:图像被锚定到三维空间,相机位姿可以直接控制,输出还包括深度、点云和3D Gaussian Splat等三维信息。这标志着基础模型正从处理多种模态,走向用多种模态共同建模同一个世界——不仅生成画面,也尝试维持、操作和模拟画面背后的空间。

所以,在Atlas之后,未来更完整的AI,可能不再是某一个孤立模型,而是不同模型的能力与长期记忆的组合。

比如语言模型负责理解任务和抽象推理,世界模型负责建立并模拟空间,行动模型负责规划执行,视频生成则提供视觉呈现。

相应地,基础模型的竞争也将从参数规模、推理能力和生成画质,扩展到三维一致性、状态持续性、行动后果预测,以及生成的世界能否被机器人和三维软件实际使用。

如果说Atlas对AI行业的影响,是将基础模型的竞争对象从语言和像素扩展到空间,那么它对机器人行业更直接的意义,就是提供了一种规模化生产训练经验的方法。

机器人训练一直面临严重的数据瓶颈。

LLM可以利用海量互联网文本,但机器人行动数据却依赖真机采集,需要反复布置场景、复位物体并承担设备损耗;环境或本体变化后,往往还要重新采集。

图片

这其中,传统仿真虽能降低成本,但仍然要依赖人工搭建高质量三维环境,并面临仿真与现实之间的差距。

现在,Atlas给出了一种新的解法。其展示的Real-to-Sim路线,是先用少量照片或手机视频重建真实环境,再将其转化为机器人能够反复进入的模拟空间。

这种变化对两类公司的意义并不相同:对基础模型公司,它扩展了模型竞争的能力边界;对机器人公司,它提供了一种规模化生产训练环境和测试数据的新工具。

因为Atlas为Real-to-Sim提供了环境重建和传感器观测生成能力。在此基础上,机器人团队可以在仿真中训练和评估策略,再回到真机验证,并用真实结果继续修正仿真,形成World Labs所强调的Real-to-Sim-to-Real闭环。

所以就现阶段而言,Atlas就像是机器人的“训练场”,它的价值更多体现在上游,如果通用世界模型逐步成为标准化工具,机器人公司有望以更低成本扩展训练场景,数据竞争也将从采集规模转向经验质量和迁移能力。

图片

从谈论世界,到进入世界

ChatGPT之后,行业一度形成一种强烈预期:只要继续扩大语言模型的参数、数据和计算量,通用智能就可能自然出现。

但随着世界模型的发展,另一种观点也在被不断强化,即语言可以帮助AI描述和推理世界,真正的通用智能还需要理解空间、维持状态、预测变化,并在行动之前模拟不同选择可能产生的结果。

从这个角度看,Atlas带来的是基础模型竞争维度的扩张:大模型公司不仅要继续提升语言与推理能力,还要补上空间和物理世界建模能力;机器人公司则可能借助通用世界模型,以更低的成本获得训练环境和行动经验。

图片

当然,这也是李飞飞一直坚持的观点。

与杨立昆(Yann LeCun)对大语言模型表现出的强烈质疑不同,在李飞飞看来,语言是人类知识与抽象思维的重要载体,LLM已经展现出强大的“语言智能”。

因此,李飞飞提出的并不是用世界模型取代语言模型,而是补上当前AI缺失的一块能力:语言智能让AI能够描述世界,空间智能则让AI能够理解、创造并参与世界。

不过,从“创造世界”到“理解世界”,Atlas仍然要跨过一道关键门槛。

创意行业需要世界模型拥有足够丰富的想象力,影视和游戏可以接受模型补全原本不存在的空间;机器人训练则要求模型尽可能忠于现实,错误的尺寸、位置或物理规律,都可能导致机器人在真实环境中做出错误判断。

同一个模型能否兼顾视觉创造力与物理准确性,将决定Atlas最终只是更强的内容生成工具,还是能够成为机器人训练的基础设施。

这也关系到行业对AGI实现路径的重新判断。

Atlas是否足以通向AGI,现在还无法判断。但它至少让行业更加清楚地看到:一个只会谈论世界的AI,距离真正进入世界,还有多远。图片

* 文中图片来自World Lab官方

图片

 - END - 

文章标签机器人大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多