Google Research 推出 AI 影片協同導演:多代理系統提升長片連貫性與敘事穩定
Google Research 於 2026 年推出 AI 影片協同導演,採用四大支柱的多代理框架,將長篇影片生成視為全域最佳化問題,顯著提升連續性、角色穩定性與敘事一致性。

Google Research 宣布推出一套統一的多代理框架,名為 AI 影片協同導演。該系統將製作延伸且具連貫性的影片視為單一最佳化與全局狀態追蹤問題,並以 Gemini 與 Veo 基礎模型為底,繼承了如 SynthID 水印等安全防護機制。
四大支柱驅動架構
此架構圍繞四個截然不同的支柱構建。Co‑Director 透過多臂強盜演算法負責創意規劃,CANVAS 以持續的視覺記憶管理視覺分鏡,A²RD 以多模態影片記憶逐段產生影片,而 VQQA 則透過視覺問答執行閉環精煉。
Co‑Director 的核心是一個指揮官(Orchestrator),它藉由多臂強盜演算法挑選創意配置——包括策略、敘事模式與美學原型——並將所選配置傳遞給前期製作代理,該代理負責構建分鏡;之後的子代理(關鍵影格、影片、音訊)產出相應媒體資產。大型語言模型評審會回傳獎勵訊號給強盜演算法,使系統得以迭代最佳化。
CANVAS 保障視覺連續性
CANVAS 透過保存角色、場景與物件狀態的結構化視覺記憶,對抗語意漂移與背景不一致的問題。在 HardContinuityBench 的「博物館搶劫」測試中,CANVAS 能在整個場景中保留盜賊的帽子與被盜珠寶,而 Gemini‑3.1‑Pro 與 AutoStudio 則改變了這些屬性與設定。
視覺記憶在每一幀生成後即時更新,使系統在構思新內容時能參照先前的視覺事實。此機制直接解決了生成模型常見的失誤——即失去對物件的追蹤或在未提供敘事依據的情況下更換環境。
A²RD 產出分鐘級影片,無需額外訓練
A²RD 採用檢索‑合成‑精煉‑更新的迴路,僅依賴 Gemini 與 Veo 基礎模型,無需額外訓練。架構自動在外推(創造新敘事節拍)與內插(錨定重複實體)之間切換。十分鐘連續示範顯示,角色身份在整段影片中保持穩定。
因為 A²RD 不依賴特定任務的微調,它可應用於長度介於一至十分鐘的各種敘事,同時維持視覺與敘事的連貫性。
VQQA 以視覺問答精煉結果
VQQA 針對中間產出的影片生成視覺問題,然後利用視覺語言模型計算語意梯度。這些梯度會改寫提示文字,而全局選擇器則在所有迭代中挑選最佳影片。此方法在 T2V‑CompBench 上取得 11.57 % 的絕對提升,於 VBench2 上提升 8.43 %。
- Co‑Director:在 GenAD‑Bench 上得分 81.4,人工評分 3.96/5
- CANVAS:背景連續性提升 +21.6 %,角色一致性提升 +9.6 %,配件穩定性提升 +7.6 %
- A²RD:整體連貫性提升最高 +30 %,敘事連貫性提升 +20 %,適用於 1–10 分鐘剪輯
- VQQA:在 T2V‑CompBench 提升 +11.57 %,在 VBench2 提升 +8.43 %
上述數據皆來自 Google Research 內部基準測試,說明每個支柱相較於先前基線所帶來的可量化改進。
儘管數據令人鼓舞,該框架仍有多項已記錄的限制。CANVAS 的原始碼尚未釋出,無法讓外部驗證其視覺記憶的實作細節。
完整流水線尚未商業化,企業目前無法直接從 Google 購買即插即用的解決方案。
所有基準情境皆為合成測試,未能完整反映真實製作流程的複雜性,且公開資料未證實系統能支援超過十分鐘的影片規模。
除 SynthID 水印外,其他安全分類器的細節未公開,使其額外防護層的效能仍存不確定性。
對企業的實務意涵
對於已在媒體創作中使用生成式 AI 的組織而言,AI 影片協同導演展示了一條可行的路徑,能產出更長且更一致的影片。四大支柱的模組化設計意味著團隊可先行採用單一元件,例如使用 CANVAS 來提升分鏡一致性,或利用 VQQA 進行迭代精煉,而不必等候完整商業版的推出。
報告的效益顯示,引入多臂強盜規劃器有望減少為達成敘事連貫性所需的手動修訂次數,從而降低製作成本。但因為程式碼未公開且流水線未打包,企業必須投入工程資源自行原型開發這些概念。
企業同時需要衡量安全風險。雖然 SynthID 提供了水印標記,其他安全分類器的效能未知,任何部署都必須自行加入內容審查與防護機制。
總結而言,Google Research 的 AI 影片協同導演提供了一套具說服力的多代理影片生成藍圖,於連續性、角色穩定性與敘事流暢度上帶來可量化的提升。若要採用,企業需投入內部開發、仔細評估合成基準的相關性,並補足安全防護措施;然而,此架構指向未來,長篇 AI 生成影片有望以更少的人工作業完成。
資料來源
- Automating coherent long-form video generationGoogle Research · 2026年9月24日
- Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation - MarkTechPostMarkTechPost · 2026年9月28日


