غوغل تطلق Gemini 3.5 Transcribe لتصفية كلمات التردد فوريًا
يتعرف نموذج التفريغ الصوتي الجديد من غوغل على أكثر من 85 لغة، ويزيل فوريًا كلمات التردد والتصحيحات الذاتية، بمعدل خطأ 2.6% في الصوت المسجّل مسبقًا وفق DeepMind.

كشفت غوغل ديب مايند في 26 أغسطس 2026 عن نموذج Gemini 3.5 Transcribe، ووصفته المدونة الرسمية للشركة بأنه "أدق نموذج لتحويل الكلام إلى نص" حتى الآن، وهو مصمم لتحويل الصوت الخام مباشرة إلى نص دقيق ومنسّق. ويهدف النظام إلى ما تسميه غوغل "التفاعلات الصوتية الذكية"، متجاوزًا أنظمة التعرف على الكلام التقليدية التي تواجه صعوبة مع ضجيج الخلفية والمصطلحات التقنية وكلمات التردد.
وفق أرقام تنسبها غوغل إلى شركة Artificial Analysis المستقلة للتقييم، يحقق Gemini 3.5 Transcribe معدل خطأ في الكلمات (WER) بمتوسط 4.0% في وضع البث المباشر، و2.6% في الصوت المسجّل مسبقًا. وعلى معيار FLEURS متعدد اللغات، سجّل النموذج معدل خطأ 5.50% في البث المباشر و5.04% في الاستخدام غير المباشر، وتقول غوغل إن الوقت اللازم للوصول إلى النص النهائي تحسّن بنسبة 70% مقارنة بالنموذج السابق Chirp 3.
ما الذي يميزه عن التعرف الصوتي التقليدي
يقوم جوهر النموذج على ما تسميه غوغل "التفريغ الذكي": فهو يتعامل بسلاسة مع التصحيحات الذاتية — المثال الذي تقدمه غوغل هو شخص يقول "لنلتقِ يوم الثلاثاء، لا، الأربعاء" — ويزيل كلمات التردد مثل "آه" و"يعني"، وينسّق النص تلقائيًا. ويمكن للمطورين والمستخدمين أيضًا تزويده بقائمة مفردات مخصصة، ليتعرف بدقة على المصطلحات المتخصصة أو التهجئات غير المألوفة بدلًا من التخمين.
وبحسب إعلان ديب مايند، يكتشف Gemini 3.5 Transcribe تلقائيًا ويفرّغ أكثر من 85 لغة، متعاملًا مع اللهجات واللكنات الإقليمية دون أن يحدد المستخدم اللغة مسبقًا. وفي الصوت المسجّل مسبقًا، يمكنه أيضًا نسب الكلام إلى ثلاثة متحدثين مختلفين على الأكثر مع طوابع زمنية لكل كلمة؛ وتوضح غوغل أن دعم أكثر من ثلاثة متحدثين لا يزال في طور التجربة. تجدر الإشارة إلى أن مدونة غوغل لم تنشر قائمة باللغات الـ85 بالتحديد، ما يترك مسألة دعم اللغة العربية تحديدًا دون تأكيد صريح حتى الآن.
وإلى جانب التفريغ، يمكن للنموذج تفعيل "استدعاء الوظائف" لتفويض مهام مثل توليد الصور أو تحليل الملفات إلى نماذج Gemini أخرى، وهي ميزة متاحة حاليًا في تطبيق Gemini على macOS. كما أفاد موقع The Decoder الألماني بأن النموذج يمكنه أيضًا تفويض عمليات البحث على الويب بالطريقة نفسها، وهو استخدام لم تذكره منشورة غوغل الرسمية صراحةً.
واجهتا برمجة، ومجالات استخدام متزايدة
- البث المباشر في الوقت الفعلي عبر Live API (نموذج gemini-3.5-transcribe-live)، بزمن استجابة أقل من ثانية للوكلاء الصوتيين والترجمة الفورية المباشرة
- معالجة الصوت المسجّل مسبقًا عبر Interactions API (نموذج gemini-3.5-transcribe)، للاجتماعات وسجلات المكالمات والتحليل بعد المكالمات
- Rambler، ميزة إملاء جديدة في Gboard على أندرويد، متاحة في بعض الدول واللغات
- تطبيق Gemini على macOS، المتاح حاليًا بالإنجليزية فقط، ويجمع بين التفريغ والأوامر الصوتية وسياق الشاشة
- Google Antigravity، حيث يجمع النموذج بين سياق الشاشة وسجل المحادثة لتفريغ أسماء الملفات والمصطلحات التقنية بدقة
- وضع Build في Google AI Studio، لوصف التطبيقات وبنائها بالصوت
تعتمد منصات خارجية مثل Agora وFishjam وLangChain وLiveKit وPipecat وVercel وVision Agents بالفعل على Live API لتقديم واجهات صوتية، وتستشهد غوغل بردود فعل إيجابية من شركات مثل Vivo وIntellitek Health وLingopal. ووصفت غوغل دعم متصفح Chrome، الذي سيتيح الإملاء في أي حقل نصي على الويب، بأنه "قادم قريبًا".
إطلاق هادئ وسط انتظار أطول
تلاحظ صحيفة The Verge أن Gemini 3.5 Transcribe يصدر في وقت لا يزال فيه نموذج Gemini 3.5 Pro، الذي وعدت غوغل بإطلاقه في يونيو، غير متوفر. كما ذكرت الصحيفة في البداية — قبل أن تصحح المعلومة بعد أن تواصلت غوغل معها مجددًا — أن نموذجين صوتيين إضافيين، هما Gemini 3.5 Live وGemini 3.5 Live Experimental، سيُطلقان مع Transcribe، لكن تبيّن أنهما لم يُطلقا فعليًا في الوقت نفسه رغم المعلومات التي قدمتها غوغل في البداية، ولم يُحدَّد موعد جديد لهما. ويبقى الإتاحة نفسها متدرجة: النموذج متاح للمطورين في معاينة عامة عبر Google AI Studio وAntigravity، وللشركات في معاينة عامة عبر Gemini Enterprise Agent Platform، بينما لم يصل إلى عامة المستخدمين إلا بشكل جزئي حتى الآن.
بالنسبة للشركات في المنطقة العربية التي تعالج كميات كبيرة من الصوت متعدد اللغات — مراكز خدمة العملاء، اجتماعات المبيعات، البودكاست، الترجمة النصية — يمكن لطبقة تفريغ تزيل كلمات التردد وتنسب الكلام تلقائيًا أن تقلّص وقت المراجعة اليدوية الذي يلي عادة أي تفريغ خام. ويشير معدل الخطأ الأقل في الصوت المسجّل مسبقًا (2.6%) مقارنة بالبث المباشر (4.0%) إلى أن الاستخدامات غير الفورية، مثل تحليل مكالمات مراكز الاتصال، تبقى حاليًا الخيار الأكثر أمانًا، بينما لا تزال الترجمة الفورية والوكلاء الصوتيون أكثر عرضة للأخطاء. وعلى الشركات التي تدرس اعتماد النموذج أن تأخذ بالحسبان أن نسب الكلام لأكثر من ثلاثة متحدثين والدعم الكامل للغة العربية على macOS غير متوفرين بعد، وأن مدى دقة تعرف النموذج على اللهجات العربية المختلفة تحديدًا لم تؤكده غوغل صراحةً حتى الآن، ما يستدعي الحذر قبل الاعتماد عليه في اجتماعات إنتاجية بعدة متحدثين.
المصادر
- Introducing Gemini 3.5 TranscribeGoogle DeepMind · ٢٦ أغسطس ٢٠٢٦
- Google's new AI transcription edits out your 'ums' and 'ahs'The Verge · ٢٦ أغسطس ٢٠٢٦
- Googles Gemini 3.5 Transcribe erkennt über 85 Sprachen und filtert Füllwörter in Echtzeit herausThe Decoder · ٢٦ أغسطس ٢٠٢٦



