全球首个多模态世界模型来了,“AI教母”李飞飞新里程碑!
“AI教母”李飞飞旗下创企World Labs发布了“全球首个多模态世界模型”——Atlas,该模型不再满足于生成图片、文字,而是可生成具有像素级精确的图像和视频帧,并将其重建为3D世界。
Atlas的核心能力围绕“理解与模拟3D世界”展开,旨在让AI真正理解3D世界的物理法则和几何结构,而不仅仅是生成看起来合理的2D画面,底层创新在于用“空间上下文”(Spatial Context)替换“文本上下文”。不同于大模型处理文本上下文,Atlas采用多模态自回归扩散Transformer架构,将输入的每一张图片和视频都锚定在三维空间中的一个精确位置,并附有相应的相机位姿和深度信息。这相当于给模型提供了一个带有“坐标轴”和“比例尺”的三维草稿本,让AI在理解世界时有了明确的几何和物理参考。
Atlas更深远的意义,在于打通那条通往“具身智能”的路。该模型被李飞飞本人视为其团队的一个“里程碑式”成果,“这是迄今为止最优秀的相机控制世界模型,为从视觉特效到机器人等众多应用场景打开了大门。”可以预见,一个用3D视角理解现实世界的AI,能和人类一样看待时间和空间,这将推动多个物理AI场景落地。
值得注意的是,尽管Atlas展现了强大的能力,但它仍存在明显的技术边界,并非成熟的通用世界模拟器。比如它擅长构建几何连贯的静态空间,对于物体碰撞、复杂动力学的通用物理模拟能力仍待验证。当镜头转向完全未拍摄的区域时,模型依然需要进行“想象”,依靠先验知识补全画面,生成的画面可能并非真实世界的精确复刻,随着生成路径变长,也可能出现局部几何漂移或纹理闪烁。目前,Atlas已进入早期访问阶段,仅向部分合作伙伴开放,未来它将用于驱动World Labs自家的Marble等产品。
“AI教母”李飞飞旗下创企World Labs发布了“全球首个多模态世界模型”——Atlas,该模型不再满足于生成图片、文字,而是可生成具有像素级精确的图像和视频帧,并将其重建为3D世界。
Atlas的核心能力围绕“理解与模拟3D世界”展开,旨在让AI真正理解3D世界的物理法则和几何结构,而不仅仅是生成看起来合理的2D画面,底层创新在于用“空间上下文”(Spatial Context)替换“文本上下文”。不同于大模型处理文本上下文,Atlas采用多模态自回归扩散Transformer架构,将输入的每一张图片和视频都锚定在三维空间中的一个精确位置,并附有相应的相机位姿和深度信息。这相当于给模型提供了一个带有“坐标轴”和“比例尺”的三维草稿本,让AI在理解世界时有了明确的几何和物理参考。
Atlas更深远的意义,在于打通那条通往“具身智能”的路。该模型被李飞飞本人视为其团队的一个“里程碑式”成果,“这是迄今为止最优秀的相机控制世界模型,为从视觉特效到机器人等众多应用场景打开了大门。”可以预见,一个用3D视角理解现实世界的AI,能和人类一样看待时间和空间,这将推动多个物理AI场景落地。
值得注意的是,尽管Atlas展现了强大的能力,但它仍存在明显的技术边界,并非成熟的通用世界模拟器。比如它擅长构建几何连贯的静态空间,对于物体碰撞、复杂动力学的通用物理模拟能力仍待验证。当镜头转向完全未拍摄的区域时,模型依然需要进行“想象”,依靠先验知识补全画面,生成的画面可能并非真实世界的精确复刻,随着生成路径变长,也可能出现局部几何漂移或纹理闪烁。目前,Atlas已进入早期访问阶段,仅向部分合作伙伴开放,未来它将用于驱动World Labs自家的Marble等产品。


