Google Gemini 3.8 Flash TTS: تصميم الأصوات بالأوامر النصية
أطلقت Google نموذجي Gemini 3.8 Flash TTS وFlash-Lite TTS، ما يتيح تصميم الأصوات عبر الأوامر النصية وإخراج الحوارات متعددة الأطراف مباشرة عبر واجهة البرمجة.

وسعت شركة Google عائلة نماذج Gemini Audio الخاصة بها عبر إطلاق نموذجي Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS لتحويل النص إلى كلام منطوق. وينقل هذان النموذجان تقنيات التوليف الصوتي من مرحلة الاعتماد على الإعدادات المسبقة والقوالب الثابتة إلى مرحلة الإنتاج الصوتي الموجه بالكامل عبر الأوامر والتعليمات النصية الطبيعية. ووصفت Google هذا الإصدار بأنه أكثر أنظمة توليد الصوت تعبيراً ومرونة أنتجتها حتى الآن، حيث يمنح المهندسين والمبدعين القدرة على ابتكار أصوات مخصصة بدقة فائقة والتحكم الكامل في الأداء التمثيلي والصوتي باستخدام إرشادات نصية عادية. وقد أتاحت الشركة النموذجين للاستخدام الفوري عبر واجهة برمجة تطبيقات Gemini API ومنصة Google AI Studio تحت المعرفين gemini-3.8-flash-tts وgemini-3.8-flash-lite-tts. وأكدت Google أن الوصول يقتصر حصرياً على واجهات برمجة التطبيقات السحابية دون توفير أوزان مفتوحة للاستضافة المحلية المستقلة، مع الإشارة إلى أن إتاحة النماذج للمؤسسات عبر منصة Gemini Enterprise ستتم قريباً.
يقدم هذا الإعلان بنية تقنية مزدوجة المستويات تهدف إلى الموازنة بين العمق الإبداعي والمرونة التعبيرية من جهة، والتكلفة التشغيلية وسرعة الاستجابة وزمن الانتقال من جهة أخرى. وقد جرى تطوير نموذج Gemini 3.8 Flash TTS خصيصاً لتلبية متطلبات الإخراج الفني المعقد وتصميم الشخصيات التفاعلية وبناء التجارب الصوتية الغنية في مجالات ألعاب الفيديو، والبودكاست، والكتب الصوتية، والوسائط المتعددة التفاعلية. وفي المقابل، صُمم نموذج Gemini 3.8 Flash-Lite TTS ليناسب حالات الاستخدام ذات الأحجام الضخمة التي تتطلب كفاءة قصوى في التكلفة وسرعة عالية، مثل الدبلجة واسعة النطاق لوسائل الإعلام، وتوليد المحتوى الإخباري والتعليمي السريع، والوكلاء الصوتيين التفاعليين لأنظمة المحادثة الآلية. وينضم هذان النموذجان إلى محفظة Google الصوتية القائمة التي تضم نماذج 3.5 Live Translate، و3.5 Transcribe، و3.8 Live، و3.8 Live Extended Thinking.
التصميم التوليدي للأصوات وتوجيه تفاصيل الأداء الدرامي
يتمثل التحول التقني الجوهري في إصدار 3.8 في تجاوز قيود المكتبة السابقة التي كانت تقتصر على 30 صوتاً مسجلاً مسبقاً. وبات بإمكان المطورين الآن الاستفادة من ميزة التصميم التوليدي للأصوات لابتكار أصوات بشرية جديدة بالكامل من الصفر، بالاعتماد على أوامر وصفية باللغة الطبيعية تحدد دور الشخصية، وطبيعة لهجتها، وطبقة صوتها ورنينها، مع دعم شامل لأكثر من 100 لغة ولهجة محلية. واستعرضت Google في وثائقها الفنية أمثلة واقعية شملت توليد نبرة مقدم برامج إذاعية من ملبورن، وصوت روبوت معدني رتيب، وصوت تنين درامي ناطق باليابانية. وللمشروعات التي تفضل استخدام أصول جاهزة، توفر المنصة مكتبة ضخمة تضم أكثر من 2,000 صوت عالي الجودة ومُعد للإنتاج، بما في ذلك لهجات إقليمية دقيقة مثل الإنجليزية الاسكتلندية، والفرنسية الكيبيكية، والإسبانية المكسيكية. كما تتيح المنصة حفظ هذه الأصوات المبتكرة لإعادة استخدامها بشكل موثوق، تفادياً لحدوث أي انحراف في الخصائص الصوتية عبر مراحل الإنتاج الطويلة.
- توجيه السيناريو سطراً بسطر: تتيح للمطورين تضمين إرشادات إخراجية دقيقة أو الاعتماد على السياق الطبيعي للنص لضبط طريقة الإلقاء والتحول بين الهمس الخافت والحوار الحازم.
- إخراج الحوارات بين متحدثين بصورة أصلية: تنظيم مشاهد حوارية متعددة الأدوار من خلال نص سيناريو موحد، مع الحفاظ الكامل على التمايز الصوتي وتبادل الأدوار الطبيعي.
- استقرار الإنتاج الطويل: تضمن البنية الحفاظ على استمرارية خامة الصوت، وإيقاع الحديث، والنقاء الصوتي عبر ساعات متواصلة من المحتوى المُولد.
- الانفعالات البشرية غير اللفظية: إمكانية دمج وسوم نصية تفاعلية مباشرة مثل « laughs » و« sigh » و« gasp » لإضفاء واقعية وطبيعية بشرية على الأداء.
- المقاطعات الاستجابية الذكية: دعم علامات الاستماع النشط مثل « mhm » و« yeah » لضبط توقيت الردود والتوقفات الدرامية والتفاعلات التلقائية.
- إعادة مزج الأصوات: ميزة مرتقبة تتيح للمبدعين تعديل خامة ونبرة وسرعة ولهجة الأصوات الجاهزة في المكتبة عبر توجيهات نصية بسيطة.
تدعم منظومة العمل أيضاً إمكانية استنساخ الأصوات اعتماداً على عينة صوتية مرجعية لا تتجاوز مدتها 30 ثانية. وللحد من عمليات الاستنساخ غير المصرح بها ومخاطر التزييف، تفرض Google تسجيلاً صوتياً للموافقة الصريحة يصدر عن صاحب الصوت الأصلي، حيث يجري التحقق البرمجي التلقائي من تطابق نبرة الموافقة مع العينة المرجعية قبل تفعيل ميزة التوليد. وتخضع أدوات استنساخ الأصوات داخل منصة Google AI Studio لقيود قانونية وإقليمية صارمة، حيث تظل غير متاحة حالياً في عدد من المناطق والأسواق تشمل المنطقة الاقتصادية الأوروبية، والمملكة المتحدة، والهند.
نتائج الاختبارات المعيارية والتحقق من موثوقية المحتوى
وفقاً لنتائج الاختبارات المعيارية التي أعلنتها شركة Google، حقق نموذج Gemini 3.8 Flash TTS المركز الأول عالمياً في اختبار Hume AI Voice Design Benchmark مسجلاً 71.4 نقطة، إلى جانب صدارة واضحة في اختبار نمذجة اللهجات بمعدل 60.8 نقطة. وفي مؤشر الجودة الإجمالية التابع لمنصة Hume AI، انتزع نموذجا Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS المركزين الأول والثاني على التوالي، محققين قفزة أدائية ملموسة مقارنة بالجيل السابق Gemini 3.1 Flash TTS. وأظهرت تقييمات التفضيل البشري المستقلة عبر منصة Voice Arena تصدر النموذجين لقوائم التقييم في عدة لغات رئيسية، شملت اللغة العربية الفصحى الحديثة، والهندية، والبرتغالية البرازيلية، واليابانية، والفيتنامية، والإسبانية المكسيكية.
ولمكافحة إساءة الاستخدام وضمان شفافية الوسائط الاصطناعية، قامت Google بدمج علامة SynthID المائية غير المحسوسة مباشرة داخل جميع الترددات الصوتية الناتجة عن نماذج Gemini Audio. وتتضمن الأصوات المستنسخة عبر مسار النسخ الصوتي بيانات C2PA لبيان موثوقية المحتوى، ما يوفر بيانات وصفية مشفرة وقابلة للتحقق الفوري تؤكد الطبيعة الاصطناعية للمحتوى الصوتي وتاريخ إنشائه.
بنية النشر والتكامل والتأثير التشغيلي للمؤسسات
بدأت Google بالفعل في دمج النموذجين بشكل أصلي ومباشر داخل منتجاتها وسير عمل تطبيقاتها مثل Google Vids وGemini Notebook. وعلى صعيد البنية التحتية للمطورين والمنصات الخارجية، أعلنت منصات تقنية رائدة مثل Agora وLiveKit وPipecat وVercel عن دعمها الكامل للنماذج عبر واجهة برمجة تطبيقات Gemini API. وفي القطاع التجاري، بدأت شركات برمجيات وإعلام مثل Figma وHeyGen وLinguana وWondercraft و99.co وOllang في نشر النموذجين لإدارة عمليات الدبلجة الآلية، والتوطين الصوتي الإقليمي، وبناء وكلاء المحادثة التفاعلية الفورية.
بالنسبة للمؤسسات والشركات التقنية، يُحدث هذا التطور تحولاً ملموساً في الجوانب الاقتصادية والهندسية لتوظيف الصوت التوليدي. فلن تعد الفرق الفنية مقيدة بخيارات الكتالوجات الصوتية الجامدة أو مضطرة لبناء مسارات تقنية معقدة ومنفصلة لإنتاج حوارات متعددة الشخصيات. وتتيح البنية المزدوجة لمهندسي النظم توجيه التطبيقات الحساسة لزمن الاستجابة وذات الكثافة العالية، مثل روبوتات خدمة العملاء، إلى نموذج Flash-Lite TTS، مع تخصيص Flash TTS لإنتاج المحتوى السردي الإبداعي المرتبط بالهوية المؤسسية والأعمال الدرامية، وكل ذلك ضمن إطار موحد لإدارة واجهات البرمجة مع تتبع مدمج لأصالة المحتوى ومصدره.
المصادر
- Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTSMarkTechPost · ٢٣ سبتمبر ٢٠٢٦
- Gemini 3.8 text-to-speech says helloGoogle · ٢٣ سبتمبر ٢٠٢٦



