探所 Curio 再探再报 了解探所 →
#AI

WROP 用合成语料教会视频模型记住被遮挡物体

WROP 把「物体被挡住后还在不在」变成可训练、可考的问答题:用 150 个参数化 Blender 生成器造出 150 万个 120 帧 1280×720 片段,前 60 帧输入、后 60 帧作续写目标,并拆开结构与表面特征以避免捷径。语料未压缩约 214 GB,以 CC BY-NC 4.0 非商用许可放出。

微调的 PWM-WROP 基于 Cosmos3-Nano。在 300 个留出任务、20 名人类评分者匿名比对下,它在直接续写的系统里排第一,整体第三,落后于两个可重绘场景的参考系统;它擅长记住存在什幺,不擅长模拟接触。

💡 为什么值得看可考物体遮挡记忆,但碰撞动力学仍未解。

查证

来源档案

Ground Truth

科技新闻站点的单篇报道,综合转述 arXiv 预印本《Training Object Permanence in World Models》与已公开的数据集卡、模型卡。

内容颗粒度细、明确区分了论文结论与未核实项(如下载体积、最低显存),但仍是单一二手来源,且评测本身混合了架构与接口不同的系统,不能干净地归因于 WROP 单独作用。

延伸阅读

读原论文的评测口径 · groundtruth.day 15 分钟
看作者如何用留出任务和人工评分把「物体消失 / 数量变化 / 穿模」变成可量化指标。
看生成器与代码 · groundtruth.day 视情况
90 个永存性 + 60 个实体性生成器是这套语料能防捷径的关键,代码放出来才可复现。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中