#AI
Google 发布长视频编排栈,一套 agent 层不是新模型
Google Research 9 月 24 日发布长视频生成研究,提出 AI video co-director 多 agent 框架:它是架在 Gemini 与 Veo 上的编排层,不是新的长上下文视频模型。
框架分四层:Co-Director 做全局规划,CANVAS 维护角色、场景与物体状态的视觉记忆,A²RD 分段生成与修复,VQQA 做视觉评审并优化提示词。
Co-Director 与 A²RD 有公开代码,CANVAS 称即将发布,VQQA 未找到可验证代码;最硬人类证据是 CANVAS 的 240 组标注对比,作者自报。
💡 为什么值得看长视频一致性改为规划、记忆、修复、评审,开源程度差别大。
查证
来源与可信度
孤证
· Co-Director 与 A²RD 已公开代码;CANVAS 称代码与数据即将发布;未找到可验证的 VQQA 代码、权重或数据集。
[2]
延伸阅读
官方原文按四个支柱展开,含博物馆盗窃串行与十分钟视频的对照演示,想判断方法是否可迁移到自家流水线值得看。
这家逐项核了代码、权重与人类评测规模,能看清哪些结论有直接证据、哪些只是基准分。