探所 Curio 再探再报 了解探所 →
#AI

Google 发布长视频编排栈,一套 agent 层不是新模型

Google Research 9 月 24 日发布长视频生成研究,提出 AI video co-director 多 agent 框架:它是架在 Gemini 与 Veo 上的编排层,不是新的长上下文视频模型。

框架分四层:Co-Director 做全局规划,CANVAS 维护角色、场景与物体状态的视觉记忆,A²RD 分段生成与修复,VQQA 做视觉评审并优化提示词。

Co-Director 与 A²RD 有公开代码,CANVAS 称即将发布,VQQA 未找到可验证代码;最硬人类证据是 CANVAS 的 240 组标注对比,作者自报。

💡 为什么值得看长视频一致性改为规划、记忆、修复、评审,开源程度差别大。

查证

来源与可信度

强 · Google Research 于 2026 年 9 月 24 日发布长视频生成研究,提出 AI video co-director 多 agent 编排框架。 [1][2]
强 · 该框架是架在 Gemini 与 Veo 之上的编排层,不是新的长上下文视频基础模型。 [1][2]
强 · 框架由四个组件构成:负责全局规划的 Co-Director、维护视觉连续性的 CANVAS、分段生成与修复的 A²RD、做视觉评审与提示词优化的 VQQA。 [1][2]
孤证 · Co-Director 与 A²RD 已公开代码;CANVAS 称代码与数据即将发布;未找到可验证的 VQQA 代码、权重或数据集。 [2]

延伸阅读

四组件的分工细节 · research.google
官方原文按四个支柱展开,含博物馆盗窃串行与十分钟视频的对照演示,想判断方法是否可迁移到自家流水线值得看。
开源与验证程度核对 · groundtruth.day
这家逐项核了代码、权重与人类评测规模,能看清哪些结论有直接证据、哪些只是基准分。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中