Google Research onthult AI‑video‑co‑directeur: multi‑agentensysteem dat lange video’s meer samenhangend maakt
Google Research presenteert AI‑video‑co‑directeur, een vier‑pijlers multi‑agentenraamwerk dat lange‑formaat video‑productie als globale optimalisatie behandelt en meetbare verbeteringen biedt in continuïteit, karakterstabiliteit en narratieve samenhang.

Google Research heeft een verenigd multi‑agenten‑raamwerk gelanceerd dat AI‑video‑co‑directeur heet. Het systeem benadert de creatie van uitgebreide, samenhangende video’s als één optimalisatie‑ en wereld‑toestand‑volgprobleem. Het bouwt voort op de Gemini‑ en Veo‑basismodellen en erft beveiligingsmaatregelen zoals het SynthID‑watermerk.
Vier pijlers vormen de architectuur
De architectuur is georganiseerd rond vier afzonderlijke pijlers. Co‑Director regelt creatieve planning via een multi‑armed‑bandit‑algoritme, CANVAS beheert visueel story‑boarding met een persistente visuele geheugen, A²RD genereert video‑segment‑voor‑segment met multimodaal videogeheugen, en VQQA voert gesloten‑lus verfijning uit via visuele vraag‑antwoord.
De kern van Co‑Director is een Orchestrator die een creatieve configuratie – strategie, narratieve modus en esthetisch archetype – selecteert met behulp van een multi‑armed‑bandit. De gekozen configuratie stuurt een pre‑productie‑agent aan die een storyboard opstelt; daarna produceren gespecialiseerde sub‑agents (Keyframe, Video, Audio) de media‑assets. Een grote‑taal‑model‑rechter levert een beloningssignaal aan de bandit, waardoor iteratieve optimalisatie mogelijk wordt.
CANVAS bewaakt visuele continuïteit
CANVAS bestrijdt semantische drift en achtergrond‑inconsistentie door een gestructureerd visueel geheugen van personages, locaties en object‑toestanden te behouden. In de HardContinuityBench‑“museumoverval”‑test hield CANVAS de hoed van de dief en het gestolen juweel gedurende de hele scène vast, terwijl Gemini‑3.1‑Pro en AutoStudio die attributen en instellingen veranderden.
Het visuele geheugen wordt na elk gegenereerd frame bijgewerkt, waardoor het systeem eerdere visuele feiten kan raadplegen bij het samenstellen van nieuwe content. Dit mechanisme pakt direct de veelvoorkomende fout aan waarbij generatieve modellen objecten kwijtraken of omgevingen wijzigen zonder narratieve rechtvaardiging.
A²RD maakt minuten‑lange video zonder extra training
A²RD volgt een retrieve‑synthesize‑refine‑update‑lus die geen extra training vereist bovenop de basis‑Gemini‑ en Veo‑modellen. De architectuur wisselt automatisch tussen extrapolatie – het creëren van nieuwe narratieve beats – en interpolatie – het verankeren van terugkerende entiteiten. Een tien‑minuten‑lange doorlopende demonstratie toonde een stabiele karakteridentiteit gedurende de volledige run.
Omdat A²RD niet afhankelijk is van taak‑specifieke fine‑tuning, kan het op een breed scala aan verhaallengtes worden toegepast, van één tot tien minuten, terwijl zowel visuele als narratieve samenhang behouden blijft.
VQQA verfijnt resultaten met visuele vraag‑antwoord
VQQA genereert visuele vragen over tussenliggende video‑outputs, gebruikt vervolgens een vision‑language‑model om semantische gradients te berekenen. Die gradients herschrijven de prompt‑tekst, en een globale selector kiest de beste video uit alle iteraties. De aanpak leverde absolute winsten op van 11,57 % op T2V‑CompBench en 8,43 % op VBench2 ten opzichte van een vanilla‑generatie‑pipeline.
- Co‑Director: 81,4 op GenAD‑Bench, 3,96/5 menselijke beoordeling
- CANVAS: +21,6 % achtergrondcontinuïteit, +9,6 % karakterconsistentie, +7,6 % accessoire‑stabiliteit
- A²RD: tot +30 % algehele samenhang, +20 % narratieve samenhang voor clips van 1–10 min
- VQQA: +11,57 % op T2V‑CompBench, +8,43 % op VBench2
Deze cijfers komen uit interne benchmarks gerapporteerd door Google Research. Ze illustreren hoe elke pijler meetbare verbeteringen oplevert ten opzichte van eerdere baselines.
Ondanks de veelbelovende cijfers kent het raamwerk verschillende gedocumenteerde beperkingen. De broncode van CANVAS is niet vrijgegeven, waardoor onafhankelijke verificatie van de implementatie van het visuele geheugen niet mogelijk is.
De volledige pijplijn is nog niet gecommercialiseerd, wat betekent dat organisaties momenteel geen kant‑en‑klare oplossing van Google kunnen aanschaffen.
Alle benchmark‑scenario’s zijn synthetisch; ze weerspiegelen niet de volledige complexiteit van productiepijplijnen in de echte wereld, en er is geen openbaar bewijs dat de schaalbaarheid verder reikt dan video's van tien minuten.
Beveiligingsclassifiers naast het SynthID‑watermerk zijn niet in detail beschreven, waardoor de effectiviteit van extra veiligheidslagen onzeker blijft.
Praktische implicaties voor bedrijven
Voor organisaties die al generatieve AI inzetten bij mediaproductie laat de AI‑video‑co‑directeur een haalbaar pad zien naar langere, consistenter uitkomsten. De modulaire aard van de vier pijlers betekent dat teams individuele componenten – zoals CANVAS voor storyboard‑consistentie of VQQA voor iteratieve verfijning – kunnen adopteren zonder te wachten op een volledige commerciële release.
De gerapporteerde winsten suggereren dat het integreren van een multi‑armed‑bandit‑planner het aantal handmatige revisies dat nodig is om een samenhangend narratief te bereiken, kan verminderen, wat de productiekosten potentieel verlaagt. Omdat de code echter niet openbaar is en de pijplijn niet als pakket wordt geleverd, moeten bedrijven engineering‑middelen reserveren om de concepten intern te prototypen.
Bedrijven moeten ook de beveiligingshouding afwegen. Terwijl SynthID een watermerk biedt, betekent de onbekende prestatie van aanvullende classifiers dat elke implementatie eigen content‑moderatie‑maatregelen moet bevatten.
Samengevat biedt Google Research’s AI‑video‑co‑directeur een overtuigend blauwdruk voor multi‑agent video‑generatie, met kwantificeerbare verbeteringen in continuïteit, karakterstabiliteit en narratieve flow. Adoptie vraagt om interne ontwikkelingsinspanningen, zorgvuldige evaluatie van de relevantie van synthetische benchmarks, en aanvullende veiligheidsmaatregelen, maar de architectuur wijst op een toekomst waarin lange AI‑gegenereerde video met veel minder handmatige interventies kan worden geproduceerd.
Bronnen
- Automating coherent long-form video generationGoogle Research · 24 september 2026
- Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation - MarkTechPostMarkTechPost · 28 september 2026


