AI2 MolmoMotion:语言引导三维运动预测
Allen Institute 在 HuggingFace 发布 MolmoMotion 模型。该工作扩展了多模态视觉语言模型的能力范围,从静态图像理解推进到动态三维运动预测——输入文本描述与参考图像或骨骼数据,模型可预测对象或人物的未来运动轨迹。这代表多模态模型向视频生成、运动控制领域的技术延伸,涉及动作合成、角色动画、机器人规划等下游应用场景。
Allen Institute 在 HuggingFace 发布 MolmoMotion 模型。该工作扩展了多模态视觉语言模型的能力范围,从静态图像理解推进到动态三维运动预测——输入文本描述与参考图像或骨骼数据,模型可预测对象或人物的未来运动轨迹。这代表多模态模型向视频生成、运动控制领域的技术延伸,涉及动作合成、角色动画、机器人规划等下游应用场景。