#AI
WROP 用合成语料教会视频模型记住被遮挡物体
WROP 把「物体被挡住后还在不在」变成可训练、可考的问答题:用 150 个参数化 Blender 生成器造出 150 万个 120 帧 1280×720 片段,前 60 帧输入、后 60 帧作续写目标,并拆开结构与表面特征以避免捷径。语料未压缩约 214 GB,以 CC BY-NC 4.0 非商用许可放出。
微调的 PWM-WROP 基于 Cosmos3-Nano。在 300 个留出任务、20 名人类评分者匿名比对下,它在直接续写的系统里排第一,整体第三,落后于两个可重绘场景的参考系统;它擅长记住存在什幺,不擅长模拟接触。
💡 为什么值得看可考物体遮挡记忆,但碰撞动力学仍未解。
查证
来源档案
Ground Truth
科技新闻站点的单篇报道,综合转述 arXiv 预印本《Training Object Permanence in World Models》与已公开的数据集卡、模型卡。
内容颗粒度细、明确区分了论文结论与未核实项(如下载体积、最低显存),但仍是单一二手来源,且评测本身混合了架构与接口不同的系统,不能干净地归因于 WROP 单独作用。
延伸阅读
看作者如何用留出任务和人工评分把「物体消失 / 数量变化 / 穿模」变成可量化指标。
90 个永存性 + 60 个实体性生成器是这套语料能防捷径的关键,代码放出来才可复现。