2026-09-02-星期三 · WorldLabs · 世界模型

收录于 第 80 期(2026-09-02) · 本期共 15 条

❯ 李飞飞团队发布世界模型 Atlas,一张照片补全 3D 世界并给机器人造训练场

一个模型干四件事李飞飞创办的 World Labs 于 9 月 1 日发布世界模型 Atlas,公司称这是首个此类多模态世界模型。技术形态是从零预训练的多模态自回归扩散 Transformer,原生处理文本、图像、视频与 3D 四种输入,把世界生成、三维重建与模拟当成同一个问题的不同侧面。输出规格是最高 1440p、单次最长一分钟。

相机原生据其技术博客,此前的同类方案多把相机位姿当成后处理约束,Atlas 的关键选择是把相机几何当作原生输入,而不是从文本提示里连哄带骗地推出来。由此得到像素级镜头控制:给定一张甚至几张地面照片,重建大场景并原生输出 3D,可导出点云与高斯泼溅格式。在三维重建上公司给出的误差是 25.3‰,优于 Pi3X 与 Depth Anything 3 等专用模型——通用模型在专项任务上压过专用模型,是这次发布最硬的一条。

机器人这条线Real-to-Sim 的演示比跑分更说明问题:World Labs 用手机拍摄两个大场景、各取 24 帧完成重建,再让模拟机器人在其中穿行,由 Atlas 渲染机身相机应看到的 RGB 图像与深度数据。这把机器人训练环境的获取成本,从搭建实景或手工建模压到了一段手机视频。刚性、铰接与可形变物体的物理交互也在重建范围内。英伟达的 Isaac GR00T 仿真系统目前是行业默认工具链,Atlas 切的正是这块。

还没公布的Atlas 现向部分合作伙伴开放早期访问,也可在官网申请,未来将作为 Marble 及其他产品的底层模型。但这次发布没有论文、没有定价、没有延迟与算力占用数据、也没有合作方名单。做机器人数据采集的团队在把它算进方案前要拿到的正是这几个数字:渲染一帧的成本和延迟,决定它是训练管线里的一环还是一次演示。

▪ SIGNAL通用世界模型在三维重建上压过了专用模型,机器人训练数据的采购单从此多了一个选项。