Google Research تكشف عن مدير فيديو AI مشترك: نظام متعدد الوكلاء يعزز تماسك الفيديو الطويل
قدمت Google Research مدير فيديو AI مشترك، إطار عمل رباعي الوحدات يُنظّم إنتاج الفيديو الطويل كمسألة تحسين شاملة، محققاً تحسينات ملحوظة في الاستمرارية وثبات الشخصيات وتماسك السرد.

أعلنت Google Research عن إطار عمل موحد متعدد الوكلاء يُدعى مدير فيديو AI مشترك. يتعامل النظام مع إنشاء فيديو طويل ومترابط كمسألة تحسين واحدة ومتابعة حالة عالمية. يبنى على نماذج Gemini وVeo الأساسية ويستفيد من إجراءات الأمان مثل علامة مائية SynthID.
أربع دعائم تشكّل العمارة
تنظم العمارة حول أربع دعائم متميزة. يتولى مدير المشرف التخطيط الإبداعي عبر خوارزمية متعدد ذراع، بينما يدير CANVAS تخطيط القصة البصرية بذاكرة بصرية مستمرة، وتنتج A²RD مقاطع الفيديو جزءاً جزءاً باستخدام ذاكرة فيديو متعددة الوسائط، وتُجري VQQA تحسيناً حلقيًا عبر أسئلة وإجابات بصرية.
يتمحور جوهر مدير المشرف حول منسق يختار تكوينًا إبداعيًا—استراتيجية، نمط سردي، ونموذج جمالي—باستخدام متعدد ذراع. يدفع هذا التكوين وكيل ما قبل الإنتاج لإنشاء لوحة قصة، ثم تُنتج الوكلاء المتخصصون (إطار رئيسي، فيديو، صوت) الأصول الإعلامية. يُعيد نموذج اللغة الكبير كحكم إشارة مكافأة إلى الخوارزمية، مما يتيح التحسين التكراري.
CANVAS يحافظ على الاستمرارية البصرية
يكافح CANVAS الانجراف الدلالي وعدم توافق الخلفية من خلال حفظ ذاكرة بصرية مُنظمة للشخصيات والمواقع وحالات الكائنات. في اختبار HardContinuityBench "سرقة المتحف"، حافظ CANVAS على قبعة اللص والجوهرة المسروقة طوال المشهد، بينما غيّرت Gemini‑3.1‑Pro وAutoStudio تلك الخصائص والإعدادات.
تُحدّث الذاكرة البصرية بعد كل إطار مُولَّد، ما يسمح للنظام بالرجوع إلى الحقائق البصرية السابقة عند تأليف محتوى جديد. هذه الآلية تعالج مباشرةً الفشل الشائع حيث تفقد النماذج التوليدية تعقب الكائنات أو تغير البيئات دون مبرر سردي.
A²RD ينتج فيديو دقائق طويلة دون تدريب إضافي
يتبع A²RD حلقة استرجاع‑توليف‑تحسين‑تحديث لا تحتاج إلى تدريب إضافي بعيدًا عن نماذج Gemini وVeo الأساسية. يتناوب الهيكل تلقائيًا بين الاستنتاج—إنشاء نبضات سردية جديدة—والاستدراج—تثبيت الكيانات المتكررة. أظهر عرض مستمر لمدة عشر دقائق هوية شخصية ثابتة طوال التشغيل.
نظرًا لأن A²RD لا يعتمد على تحسين مخصص للمهمة، يمكن تطبيقه على مجموعة متنوعة من أطوال القصة من دقيقة إلى عشر دقائق مع الحفاظ على التماسك البصري والسردي.
VQQA يحسّن النتائج عبر الأسئلة البصرية
تُنشئ VQQA أسئلة بصرية حول مخرجات الفيديو الوسيطة، ثم تستخدم نموذج رؤية‑لغة لحساب تدرجات دلالية. تُعيد هذه التدرجات صياغة نص الطلب، ويختار مُحدد عالمي أفضل فيديو بين جميع التكرارات. أسفرت المقاربة عن تحسينات مطلقة قدرها 11.57 % على T2V‑CompBench و8.43 % على VBench2 مقارنةً بخط أنابيب توليد عادي.
- مدير المشرف: 81.4 على GenAD‑Bench، تقييم بشري 3.96/5
- CANVAS: +21.6 % استمرارية الخلفية، +9.6 % ثبات الشخصية، +7.6 % استقرار الإكسسوارات
- A²RD: حتى +30 % تحسين التماسك العام، +20 % تماسك سردي لمقاطع 1–10 دقيقة
- VQQA: +11.57 % على T2V‑CompBench، +8.43 % على VBench2
هذه الأرقام مستمدة من معايير داخلية أبلغت عنها Google Research. تُظهر كيف تُضيف كل دعامة تحسينات قابلة للقياس مقارنةً بالخطوط الأساسية السابقة.
على الرغم من الأرقام المشجعة، فإن الإطار يواجه عدة حدود موثقة. لم يُصدر كود المصدر الخاص بـ CANVAS، ما يمنع التحقق المستقل من تنفيذ الذاكرة البصرية.
لم تُ commercialise الخط الأنابيب بالكامل بعد، لذا لا يمكن للمنظمات حاليًا شراء حل جاهز من Google.
جميع سيناريوهات الاختبار اصطناعية؛ لا تعكس تعقيد خطوط إنتاج العالم الحقيقي، ولا يوجد بيانات عامة تؤكد القابلية للتوسع إلى ما يتجاوز الفيديوهات ذات العشر دقائق.
لم تُفصَّل المصنفات الأمنية بخلاف علامة SynthID، ما يترك فعالية طبقات الأمان الإضافية غير مؤكدة.
آثار عملية للمؤسسات
بالنسبة للمنظمات التي تستخدم الذكاء الاصطناعي التوليدي في إنشاء الوسائط، يُظهر مدير فيديو AI المشترك مسارًا قابلًا للتطبيق نحو مخرجات أطول وأكثر اتساقًا. الطبيعة المعيارية للدعائم الأربعة تسمح للفرق باعتماد مكونات فردية—مثل CANVAS لاستمرار لوحة القصة أو VQQA للتحسين التكراري—دون انتظار إصدار تجاري كامل.
تشير الزيادات المبلغ عنها إلى أن دمج مخطط متعدد الذراع قد يقلل عدد المراجعات اليدوية اللازمة لتحقيق سرد متماسك، مما قد يخفض تكاليف الإنتاج. ومع ذلك، وبسبب عدم إتاحة الكود وعدم تجميع الخط الأنابيب في حزمة، سيتعين على الشركات تخصيص موارد هندسية لتجربة المفاهيم داخليًا.
يجب على المؤسسات أيضًا تقييم وضع الأمان. بينما توفر SynthID علامة مائية، فإن عدم وضوح أداء المصنفات الأمنية الإضافية يعني أن أي نشر يحتاج إلى آليات مراقبة محتوى خاصة.
باختصار، يُقدم مدير فيديو AI المشترك من Google Research مخططًا جذابًا لتوليد الفيديو متعدد الوكلاء، مع تحسينات قابلة للقياس في الاستمرارية، ثبات الشخصيات وتدفق السرد. سيتطلب الاعتماد جهدًا داخليًا في التطوير، وتقييمًا دقيقًا لملاءمة المعايير الاصطناعية، وإجراءات أمان إضافية، لكنه يشير إلى مستقبل يمكن فيه إنتاج فيديو AI طويل الشكل بحد أدنى من التدخل البشري.
المصادر
- Automating coherent long-form video generationGoogle Research · ٢٤ سبتمبر ٢٠٢٦
- Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation - MarkTechPostMarkTechPost · ٢٨ سبتمبر ٢٠٢٦


