探所 Curio 再探再报 了解探所 →
#AI

自回归视频模型的长程一致性缺陷被点名

AI 长视频生成的一个内核短板被点出:当主角离镜后再次返回画面时,模型往往记不住他的身份、服饰甚至手里的物体,出现一致性丢失。智源社区(AI_era)发文指出,这暴露的是自回归视频模型在**时序连贯性与长程一致性上的根本缺陷**,远不只是「生成时长」的表面问题。

根因在机制层:自回归模型分段生成视频,靠 **KV 缓存维持上下文**;但为了控制算力,缓存被强制截断或压缩,前序细节的长期记忆随之缺失,模型自然没法准确还原早先的画面元素。该文认为这不是工程调优问题,而是当前视频生成架构的硬约束。

💡 为什么值得看KV 缓存截断丢失长程记忆,机制缺陷致主角变化。

查证

来源档案

智源社区(AI_era)

北京智源人工智能研究院旗下社区账号,转载/编译类科技资讯

对机制缺陷的定性描述与主流研究(如 Quant VideoGen 等论文)方向一致,但该条本身为单源社区资讯、无独立第二源互证,按线索档对待;具体技术细节可交叉验证后再采信

延伸阅读

机制根因拆解 · link.baai.ac.cn 5 分钟
想看为什幺 KV 缓存截断会导致长期记忆缺失、以及它与自回归生成时序的耦合关系,从这里延展到相关论文最顺
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store