#AI
李飞飞团队发布世界模型 Atlas
World Labs 发布了名为 **Atlas** 的多模态世界模型,官方定位为「全模态」模型:文本、图像、视频、三维数据走同一套架构,输出可以是图片、视频、点云,也可以是三维高斯泼溅。这家由李飞飞联合创立、估值很高的公司此前动作集中在融资和 Marble 平台,模型本体这次才算完整露面。
最硬的一处设计是把 **相机位姿做成原生条件输入**。生成视频时,镜头往哪走、多快、什幺焦段都能在像素级指定,不靠提示词写「缓慢推近」再祈祷模型听懂。这直接把镜头这一维从生成问题降级成控制问题,下游结果是视频生成可与三维重建对齐:同一场景既出视频也出点云,共享同一套坐标。
💡 为什么值得看原生输入相机位姿,1 至 100 多张照片可重建三维场景并推镜,视频与点云共享坐标。
查证
来源与可信度
孤证
· Atlas 支持从 1 张到 100 多张照片重建真实场景,输出新视角图像帧或显式 3D 表示
[1]
延伸阅读
cocoloop 把「位姿做条件输入=从生成降级为控制」这个判断讲得最透,并指出对影视预演和机器人仿真的具体价值,适合想理解为什幺这一步是分界线的人。
量子位梳理了 6 月定义世界模型、7 月收购 SceniX、公开 Real-to-Sim 系统、再到 Atlas 的完整路径,适合看这条产品线如何收敛到机器人训练场景。