谷歌研究推出 AI 视频联合导演:统一的多代理系统显著提升长视频连贯性
谷歌研究团队公布了 AI 视频联合导演,这一基于四大支柱的多代理框架将长篇视频创作视为全局优化问题,实现了连续性、角色稳定性和叙事连贯性的显著提升。

谷歌研究宣布推出名为 AI 视频联合导演的统一多代理框架。该系统将生成延伸且连贯的视频视作一次整体的优化与世界状态追踪任务,构建于 Gemini 与 Veo 基础模型之上,并继承了 SynthID 水印等安全防护措施。
四大支柱驱动整体架构
整体架构围绕四个独立的支柱组织。联合导演(Co‑Director)通过多臂老虎机算法负责创意规划,CANVAS 通过持久化视觉记忆进行视觉分镜管理,A²RD 采用多模态视频记忆逐段生成视频,而 VQQA 则通过视觉问答实现闭环细化。
联合导演的核心是一个编排器(Orchestrator),它利用多臂老虎机挑选创意配置——包括策略、叙事模式和美学原型。所选配置驱动前期制作代理构建分镜,随后专门的子代理(关键帧、视频、音频)生成相应媒体资产。一个大型语言模型评审会返回奖励信号给老虎机,从而实现迭代优化。
CANVAS 保障视觉连续性
CANVAS 通过保存角色、场景和对象状态的结构化视觉记忆来防止语义漂移和背景不一致。在 HardContinuityBench 的“博物馆抢劫”测试中,CANVAS 能在整个场景中保持盗贼的帽子和被盗珠宝不变,而 Gemini‑3.1‑Pro 与 AutoStudio 则出现属性和场景的改变。
视觉记忆在每帧生成后都会更新,使系统在创作新内容时能够引用先前的视觉事实。这一机制直接针对生成模型常见的失去对象追踪或在缺乏叙事依据的情况下随意更换环境的问题。
A²RD 无需额外训练即可生成分钟级视频
A²RD 采用检索‑合成‑细化‑更新的循环流程,除基础 Gemini 与 Veo 模型外不需要额外训练。该架构自动在外推(创造新叙事节点)与内插(锚定重复实体)之间切换。一次十分钟的连续演示展示了角色身份在整段视频中保持稳定。
由于 A²RD 并不依赖任务特定的微调,它可以适用于时长从一分钟到十分钟的各种故事,同时保持视觉和叙事的连贯性。
VQQA 通过视觉问答细化结果
VQQA 为中间生成的视频输出生成视觉问题,然后使用视觉‑语言模型计算语义梯度。梯度用于改写提示文本,随后全局选择器从所有迭代中挑选最佳视频。该方法在 T2V‑CompBench 上实现了 11.57% 的绝对提升,在 VBench2 上提升了 8.43%,相较于普通生成流水线有显著优势。
- 联合导演:GenAD‑Bench 上 81.4 分,人工评分 3.96/5
- CANVAS:背景连续性提升 21.6%,角色一致性提升 9.6%,配饰稳定性提升 7.6%
- A²RD:整体连贯性提升最高 30%,1‑10 分钟片段的叙事连贯性提升 20%
- VQQA:T2V‑CompBench 提升 11.57%,VBench2 提升 8.43%
这些数据均来源于谷歌研究内部基准测试,展示了每个支柱相较于先前基线的可量化改进。
尽管结果令人鼓舞,框架仍存在若干已记录的局限性。CANVAS 的源代码尚未公开,导致外部无法验证其视觉记忆实现细节。
完整流水线尚未商业化,企业目前无法直接从谷歌购买即插即用的解决方案。
所有基准场景均为合成数据,未能全面反映真实生产流水线的复杂性,且公开数据未证实系统在十分钟以上视频上的可扩展性。
除 SynthID 水印外,安全分类器的具体实现并未详细披露,额外安全层的有效性仍不确定。
对企业的实际意义
对于已经在媒体创作中使用生成式 AI 的组织而言,AI 视频联合导演提供了一条实现更长、更一致输出的可行路径。四大支柱的模块化特性意味着团队可以单独采用其中的组件——比如使用 CANVAS 提升分镜连贯性,或利用 VQQA 进行迭代细化——而无需等待完整商业版本的发布。
报告的增益表明,引入多臂老虎机规划器可能显著减少实现连贯叙事所需的人工修订次数,从而降低制作成本。但由于代码未公开且流水线未包装,企业必须投入工程资源在内部原型化这些概念。
企业还需权衡安全态势。虽然 SynthID 提供了水印,但额外安全分类器的性能未知,这意味着任何部署都必须自行加入内容审核与风险控制措施。
总之,谷歌研究的 AI 视频联合导演为多代理视频生成提供了一个引人注目的蓝图,在连续性、角色稳定性和叙事流畅性方面实现了可量化的提升。要想采用该技术,组织需要进行内部开发、仔细评估合成基准的适用性,并补充安全防护,但该架构指向了一个未来:长篇 AI 生成视频能够在更少人工干预下实现高质量制作。
信息来源
- Automating coherent long-form video generationGoogle Research · 2026年9月24日
- Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation - MarkTechPostMarkTechPost · 2026年9月28日


