Google Research が発表した AI ビデオ共同ディレクター:長尺動画の一貫性を高める統合型マルチエージェントシステム
Google Research は、長尺動画生成を全体最適化問題として捉える四本柱のマルチエージェントフレームワーク「AI ビデオ共同ディレクター」を発表し、継続性・キャラクター安定性・物語の一貫性で測定可能な向上を実証しました。

Google Research は、AI ビデオ共同ディレクターと呼ばれる統合型マルチエージェントフレームワークを発表しました。このシステムは、拡張された一貫性のある動画制作を単一の最適化および世界状態追跡問題として扱います。Gemini と Veo の基盤モデル上に構築され、SynthID ウォーターマークなどのセキュリティ保護機能を継承しています。
四本柱がアーキテクチャを支える
アーキテクチャは四つの明確な柱で構成されています。Co‑Director はマルチアームドバンディットアルゴリズムで創造的計画を司り、CANVAS は永続的な視覚メモリでビジュアルストーリーボードを管理、A²RD はマルチモーダル動画メモリを用いてセグメントごとに動画を生成し、VQQA は視覚的質問応答を通じた閉ループ精緻化を実行します。
Co‑Director の中核はオーケストレーターで、戦略・ナラティブモード・美学的原型といった創造的構成をマルチアームドバンディットで選択します。選択された構成はプリプロダクションエージェントに渡され、ストーリーボードを構築。その後、キー フレーム、動画、音声といった専門サブエージェントがメディア資産を生成します。大規模言語モデルのジャッジが報酬信号をバンディットに返し、反復的最適化を可能にします。
CANVAS が視覚的連続性を保つ
CANVAS はキャラクター、ロケーション、オブジェクト状態の構造化された視覚メモリを保持することで、意味的ドリフトや背景の不整合を防止します。HardContinuityBench の「博物館強盗」テストでは、CANVAS が盗賊の帽子と盗まれた宝石をシーン全体で保持したのに対し、Gemini‑3.1‑Pro と AutoStudio はそれらの属性や設定を変更しました。
視覚メモリは生成された各フレーム後に更新され、システムは新しいコンテンツを作成する際に過去の視覚事実を参照できます。この仕組みは、生成モデルがオブジェクトを失ったり、物語上の根拠なしに環境を変えるという一般的な失敗モードに直接対処します。
A²RD が追加学習なしで数分間の動画を生成
A²RD は取得‑合成‑精緻化‑更新のループを採用し、基礎となる Gemini と Veo モデル以外の追加学習を必要としません。アーキテクチャは自動的に外挿(新しい物語ビートの創出)と内挿(繰り返し出現するエンティティの固定)を交互に行います。10分間の連続デモでは、走査全体でキャラクターのアイデンティティが安定していることが示されました。
A²RD はタスク固有のファインチューニングに依存しないため、1 分から 10 分までのさまざまなストーリー長に適用でき、視覚的および物語的な一貫性を保持します。
VQQA が視覚的質問応答で結果を洗練
VQQA は中間動画出力に対して視覚的質問を生成し、ビジョン‑言語モデルで意味的勾配を算出します。その勾配はプロンプトテキストを書き換え、グローバルセレクタがすべてのイテレーションから最良の動画を選択します。この手法は、ベーシックな生成パイプラインと比較して T2V‑CompBench で 11.57 %、VBench2 で 8.43 % の絶対的な向上を達成しました。
- Co‑Director: GenAD‑Bench で 81.4、ヒューマン評価 3.96/5
- CANVAS: 背景連続性 +21.6 %、キャラクター一貫性 +9.6 %、アクセサリ安定性 +7.6 %
- A²RD: 全体的な一貫性最大 +30 %、1‑10 分クリップの物語一貫性 +20 %
- VQQA: T2V‑CompBench +11.57 %、VBench2 +8.43 %
これらの数値は Google Research が内部ベンチマークで報告したもので、各柱が従来のベースラインに対して測定可能な改善をもたらすことを示しています。
しかし、期待できる成果にもかかわらず、フレームワークにはいくつかの既知の制限があります。CANVAS のソースコードは公開されておらず、視覚メモリ実装の独立検証ができません。
完全なパイプラインはまだ商用化されていないため、組織が Google からターンキーソリューションを購入することは現時点では不可能です。
すべてのベンチマークシナリオは合成データであり、実際の制作パイプラインの複雑さを完全に反映しているわけではなく、10 分を超える動画へのスケーラビリティを裏付ける公開データもありません。
SynthID のウォーターマーク以外のセキュリティ分類子は詳細が示されておらず、追加安全層の有効性は不確かです。
企業への実務的示唆
既に生成 AI をメディア制作に活用している組織にとって、AI ビデオ共同ディレクターは長尺でより一貫したアウトプットへの実行可能な道筋を示します。四本柱のモジュラー構造により、チームは CANVAS でストーリーボードの一貫性を確保したり、VQQA で反復的な精緻化を行うなど、個別コンポーネントを全体リリースを待たずに導入できます。
報告された改善は、マルチアームドバンディットプランナーを統合することで、物語の一貫性を得るために必要な手動修正回数を減らし、結果として制作コストを削減できる可能性を示唆しています。ただし、コードが非公開でパイプラインがパッケージ化されていないため、企業は概念を社内でプロトタイプ化するためのエンジニアリングリソースを割り当てる必要があります。
また、セキュリティ姿勢も考慮すべきです。SynthID がウォーターマークを提供する一方で、追加の安全分類子の性能が不明なため、導入時には自社のコンテンツモデレーション体制を併用することが求められます。
要約すると、Google Research の AI ビデオ共同ディレクターは、連続性・キャラクター安定性・物語の流れにおいて定量的な向上を実現する、マルチエージェント動画生成の有力な設計図を提供します。採用には内部開発努力、合成ベンチマークの適用性評価、追加的な安全対策が必要ですが、このアーキテクチャは長尺 AI 生成動画が少ない手動介入で実現できる未来への道を示しています。
出典
- Automating coherent long-form video generationGoogle Research · 2026年9月24日
- Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation - MarkTechPostMarkTechPost · 2026年9月28日


