← 返回信息流
模型 量子位 · 鱼羊 2026-09-02 01:07 🔥 热度 9

李飞飞发布:全球首个多模态世界模型

李飞飞团队发布全球首个多模态世界模型Atlas

李飞飞发布:全球首个多模态世界模型

一张图补全3D世界,还能给机器人造训练场

鱼羊 发自 凹非寺

量子位 | 公众号 QbitAI

「全球首个」多模态世界模型,来了!

来自李飞飞World Labs。

World Labs对这个名为Atlas的新一代世界模型,用词可谓毫不克制,「全球首个」之外,slogan也明确强调出,这一次,可不只是生成一段可互动视频了哟:

建模世界,移动相机,模拟空间和时间。

就是说,Atlas能够以像素级的相机控制生成图像和视频帧,并完成3D重建。并且空间和时间都能理解。

李飞飞本人将其视作World Labs的「里程碑式」成果,直接一手置顶:

Atlas为从视觉特效到机器人的众多应用场景打开了大门。

飞飞高徒、英伟达机器人主管Jim Fan也来捧场,指出:这是机器人领域Real-to-Sim的一大步。

具体来说,Atlas是一个多模态自回归扩散Transformer,它的能力包括:

相机控制生成:仅需一张图片,Atlas即可生成具有像素级相机控制的图片和视频,最高可输出1分钟、1440p的视频。

空间重建:Atlas可以基于一张到数十张输入图像,重建真实世界场景。既可以生成新视角下的图像帧,也能输出显式3D表示,其效果超过当前专门针对3D重建训练的最先进模型。

时空模拟:Atlas可以根据输入视频同时建模空间和时间,可以转换已有视频中的观察视角,制作具有戏剧性的视觉效果,同时支持机器人Real-to-Sim工作流。

图像生成:Atlas可以根据文本生成图片和360°全景图,能够遵循复杂Prompt、准确渲染文字,并生成大量不同的视觉风格。

对于机器人模拟,仅需喂Atlas几张照片,它就能生成逼真的RGB和深度数据。这样一来,机器人就能在更多不同的模拟空间中进行训练和测试。

从头训练的多模态世界模型

技术细节上,Atlas是一个全能模型(omni model)。

它的目标,是在一个统一的模型架构中,同时处理多任务、多种输入和输出数据。

与此同时,空间控制是整个模型的核心。

为了实现这些目标,李飞飞团队设计了一种全新的基础架构,来作为未来世界模型的基础——多模态自回归扩散 Transformer。

文本、图像、视频、3D数据……各种输入都会被锚定在三维空间中,从而形成一个空间上下文。

然后,Atlas会根据这个上下文生成多模态输出。

这样一来,比如把两张毫无关系的参考图片放进同一个上下文中,再分别指定它们在3D空间中的位置,Atlas就能把它们缝合成一个空间自然、连续的世界。

更具体地拆解一下,多模态,指的是Atlas可以原生处理多种不同的数据类型,包括文本、图像、相机位姿、3D深度图等。

视频则被表示为图像序列。

每一张图像和每一幅深度图,都对应一个明确的相机位姿。

自回归,指Atlas操作的是一系列元素组成的序列,序列中的每一个元素都可以属于前面提到的某一种数据模态。

Atlas每次生成一个新的输出,都会以前面已经存在的序列内容作为条件。

这种灵活的设计天然适用于各种不同任务。

每一种任务,本质上都只是一种不同类型的序列——前面是输入,后面是输出。

扩散模型,指Atlas是一个Rectified Flow(校正流)模型,通过逐步去噪来生成输出。

扩散模型尤其擅长对图片和视频这种高维连续数据进行建模。同时,在推理时,只需要改变去噪步骤的数量,就可以实现速度和质量的平衡。

而Transformer不必多说,在世界模型领域,Transformer也被证明是非常稳健的基础架构。

也就是说,Atlas实际上融合了大语言模型和视频模型中的大量思想。

Atlas既可以利用大量原本服务于LLM推理和加速的技术,包括KV Cache、缓存感知路由、解耦式服务等等。

另一方面,它又和现代图像、视频生成模型一样,是一个潜空间扩散模型,可以利用扩散蒸馏、无分类器引导、移位噪声调度等算法,并引入更先进的VAE架构。

研究团队在相机控制生成和3D重建两个关键任务上对这个新一代世界模型进行了定量评估。

在相机控制生成上,结果显示,Atlas优于SOTA视频模型。

并且相机轨迹越复杂,Atlas的优势越大。

在根据稀疏输入视角进行3D重建的任务中,Atlas同样超过了表现最好的专业开源3D重建模型。(分数越低表现越好)

值得一提的是,Atlas从设计之初就为Scaling做好了准备。

李飞飞团队表示,已经看到了非常有利的证据,证明Atlas的能力会随着规模扩大而继续提高。

目前,Atlas正在向部分合作伙伴开放早期访问。

也可以在官网申请访问权限。

具身智能Real-to-Sim的关键一步

李飞飞新世界模型一出,关注的焦点,还是汇聚在具身智能上。

把今年World Labs的动作联系起来,Atlas的意义也更加明朗。

今年6月,李飞飞亲自下场定义世界模型,将其分类为渲染器、模拟器、规划器。

并明确指出,「最关键的是模拟器」。

因为模拟器承担的是世界本身的几何、物理和动力学,是渲染和行动共同依赖的基础。

紧接着,7月21日,World Labs收购机器人仿真公司SceniX。

7月28日,公开Real-to-Sim-to-Real系统,强调机器人最大瓶颈是缺乏廉价、可控、可规模化的训练经验。

现在,Atlas来了。

从真实照片/视频,到3D空间,再到机器人传感器视图和可变化的模拟环境,这一条路径被打通了。

World Labs官方表示,接下来,Atlas会成为未来版Marble以及World Labs其他产品的底层模型。

参考链接:

https://www.worldlabs.ai/blog/atlas

查看原文 ↗ 大模型发布多模态

📌 相关阅读

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:编程基准翻倍,缓存读取成本直降 75% 热度 27 GPT-6 热度 15 Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线 热度 10 巨简单,更懂家!海信JUOS正式发布:行业首个家庭智能伴侣级AIOS 热度 10 【精翻】C4D 如何将 AI 模型转化为电影级 3D 动画 热度 9