智源研究院探索世界模型新路线,主张潜空间统一表征
智源研究院院长王仲远在接受硬氪采访中系统阐述了全球世界模型领域的四条主流技术路线,以及智源自身探索的第五条路线。传统路线分别是语言中心(VLM/VLA)、像素中心(Sora类视频生成)、三维结构中心(3D 重建)、视觉表征中心(JEPA)。智源提出的新方案是将多模态信息压缩进统一的「潜空间表征」,再由不同解码器按需还原——类似为机器人大脑准备「万能草稿纸」,统一处理视频、文字、动作等信息,解决当前 VLA 无法理解物理因果的问题。王仲远认为世界模型仍处深度学习 2012 年前后的早期阶段,接下来的核心挑战在于物理一致性、因果推断、多场景泛化三个维度,预计需要三年甚至更长时间才能真正成为机器人大脑。
世界模型领域的五条技术分化
①
技术分化
全球世界模型探索被撕扯成五条路线:语言中心(文本空间预测)、像素中心(视觉空间学习)、三维结构中心(几何重建)、视觉表征中心(压缩嵌入演化),以及智源的第五条——多模态潜空间统一表征。每条路线所学习的「世界」定义截然不同,反映了学术与工业对物理理解的不同诠释。
②
核心差异
智源方案的创新在于跨模态压缩:将视频、文字、指令等统一压缩进潜空间,再由不同解码器输出。这避免了单模态方案的物理一致性问题——语言模型只学到文本描述、视觉生成只学到像素真实,都无法真正理解「推杯子会掉」这样的因果规律。
③
应用前景
王仲远认为世界模型价值将在两个方向兑现:突破具身智能卡点(机器人理解物理规律、预测动作后果),以及工业仿真、科学研究等真实物理场景应用。但他强调这是长期过程,当前阶段类似深度学习 2012 年,数据孤岛、路线未定、基准不统一。