探所 Curio 再探再报 了解探所 →
#AI

李飞飞团队发布世界模型 Atlas

World Labs 发布了名为 **Atlas** 的多模态世界模型,官方定位为「全模态」模型:文本、图像、视频、三维数据走同一套架构,输出可以是图片、视频、点云,也可以是三维高斯泼溅。这家由李飞飞联合创立、估值很高的公司此前动作集中在融资和 Marble 平台,模型本体这次才算完整露面。

最硬的一处设计是把 **相机位姿做成原生条件输入**。生成视频时,镜头往哪走、多快、什幺焦段都能在像素级指定,不靠提示词写「缓慢推近」再祈祷模型听懂。这直接把镜头这一维从生成问题降级成控制问题,下游结果是视频生成可与三维重建对齐:同一场景既出视频也出点云,共享同一套坐标。

💡 为什么值得看原生输入相机位姿,1 至 100 多张照片可重建三维场景并推镜,视频与点云共享坐标。

查证

来源与可信度

· World Labs 发布名为 Atlas 的多模态世界模型 [1][2]
· Atlas 采用多模态自回归扩散 Transformer 架构,扩散部分为 Rectified Flow 校正流 [1][2]
· Atlas 把相机位姿作为原生条件输入,支持像素级相机控制 [1][2]
孤证 · Atlas 支持从 1 张到 100 多张照片重建真实场景,输出新视角图像帧或显式 3D 表示 [1]

延伸阅读

相机控制的工程意义 · news.cocoloop.cn 6 分钟
cocoloop 把「位姿做条件输入=从生成降级为控制」这个判断讲得最透,并指出对影视预演和机器人仿真的具体价值,适合想理解为什幺这一步是分界线的人。
具身智能链路 · qbitai.com 5 分钟
量子位梳理了 6 月定义世界模型、7 月收购 SceniX、公开 Real-to-Sim 系统、再到 Atlas 的完整路径,适合看这条产品线如何收敛到机器人训练场景。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store