#AI
自回归视频模型的长程一致性缺陷被点名
AI 长视频生成的一个内核短板被点出:当主角离镜后再次返回画面时,模型往往记不住他的身份、服饰甚至手里的物体,出现一致性丢失。智源社区(AI_era)发文指出,这暴露的是自回归视频模型在**时序连贯性与长程一致性上的根本缺陷**,远不只是「生成时长」的表面问题。
根因在机制层:自回归模型分段生成视频,靠 **KV 缓存维持上下文**;但为了控制算力,缓存被强制截断或压缩,前序细节的长期记忆随之缺失,模型自然没法准确还原早先的画面元素。该文认为这不是工程调优问题,而是当前视频生成架构的硬约束。
💡 为什么值得看KV 缓存截断丢失长程记忆,机制缺陷致主角变化。
查证
来源档案
智源社区(AI_era)
北京智源人工智能研究院旗下社区账号,转载/编译类科技资讯
对机制缺陷的定性描述与主流研究(如 Quant VideoGen 等论文)方向一致,但该条本身为单源社区资讯、无独立第二源互证,按线索档对待;具体技术细节可交叉验证后再采信
延伸阅读
想看为什幺 KV 缓存截断会导致长期记忆缺失、以及它与自回归生成时序的耦合关系,从这里延展到相关论文最顺