Google lance Gemini 3.8 Live Avatar avec synchronisation labiale en temps réel dans 97 langues pour les entreprises
Google a présenté le 25 septembre 2026 Gemini 3.8 Live Avatar, un présentateur synthétique capable de parler, de synchroniser les lèvres et d’afficher des données à l’écran en 97 langues, disponible dès maintenant pour les clients Gemini Enterprise.

Le 25 septembre 2026, Google a annoncé l’ajout d’un Avatar Live à sa plateforme Gemini 3.8 Live. Cette fonctionnalité est présentée comme une personnalité animée qui réagit en temps réel, ajustant les mouvements des lèvres et les expressions faciales au discours tout en pouvant superposer des informations visuelles à l’écran.
Selon Google, l’avatar peut passer sans heurt d’une langue à l’autre parmi les 97 prises en charge. L’entreprise insiste sur le fait que le changement de langue n’altère pas la fidélité vidéo et n’entraîne pas le glissement visuel souvent observé dans les vidéos synthétiques en temps réel.
Fonctionnement de la technologie
Gemini 3.8 Live avait été présenté une semaine plus tôt comme un modèle capable de traiter des entrées visuelles quasi en temps réel. L’Avatar Live s’appuie sur cette base en générant un visage 3 D animé qui synchronise les formes de la bouche avec la sortie phonétique du modèle linguistique de Gemini. Lors de la démonstration publique, l’avatar est passé de l’anglais au japonais en plein milieu d’une phrase tout en conservant des mouvements labiaux adaptés aux phonèmes propres à chaque langue.
Le système prend également en charge les superpositions à l’écran. Pendant qu’il parle, l’avatar peut afficher des graphiques, des puces ou d’autres repères visuels, transformant une simple réponse vocale en une présentation plus complète.
Déploiement réservé aux entreprises
Google a limité l’accès à l’Avatar Live aux clients Gemini Enterprise lors du lancement. Les organisations abonnées au niveau entreprise peuvent choisir parmi un catalogue d’avatars pré‑définis ou commander des visages conçus sur mesure pour respecter les directives de leur identité visuelle.
Chaque séquence vidéo générée porte un filigrane SynthID invisible. Google précise que ce filigrane, associé à des garde‑fous intégrés, vise à protéger l’identité et à aider les plateformes tierces à vérifier que le contenu est synthétique.
Avantages potentiels et cas d’usage
- Agents du support client capables de converser dans la langue maternelle de l’appelant sans recruter du personnel multilingue
- Modules de formation interne où un présentateur unique délivre le contenu dans plusieurs langues
- Vidéos marketing pouvant être localisées instantanément pour des campagnes mondiales
- Webinaires en direct où l’avatar change de langue à la volée pour des audiences multilingues
La capacité à maintenir une cohérence visuelle entre les langues est particulièrement précieuse pour les communications centrées sur la marque. Les entreprises évitent ainsi l’effet de vallée dérangeante qui apparaît parfois lorsqu’on ajoute des sous‑titres à un présentateur figé, car les mouvements de la bouche de l’avatar restent synchronisés avec les mots prononcés.
Cependant, ce lancement soulève des questions d’identité, de transparence et d’accessibilité. Les régulateurs et les groupes de défense ont averti que les présentateurs synthétiques pourraient être détournés pour usurper l’identité de personnes réelles ou masquer la provenance de l’information. L’inclusion d’un filigrane SynthID constitue une première mesure, mais Google n’a pas détaillé comment ce filigrane sera détecté par les plateformes tierces.
Du point de vue de l’accessibilité, l’avatar pourrait améliorer la consommation de contenu pour les utilisateurs malentendants lorsqu’il est couplé à des sous‑titres précis, tout en offrant des repères visuels aux personnes qui lisent sur les lèvres. Google n’a pas encore annoncé de certifications d’accessibilité spécifiques pour cette fonctionnalité.
Pour une organisation francophone, cela signifie une nouvelle méthode évolutive de production de vidéos multilingues sans devoir engager des acteurs vocaux, des traducteurs et des monteurs pour chaque langue. Une licence Gemini Enterprise unique peut générer un présentateur synthétique qui délivre le même message dans des dizaines de marchés, en préservant le ton de la marque et le style visuel tout en réduisant le temps de production de semaines à quelques minutes. Le résultat : des cycles de mise sur le marché plus rapides, des budgets de localisation allégés et une expérience utilisateur cohérente dans les 97 langues prises en charge.
Pour une organisation francophone, l’intérêt principal réside dans la possibilité de présenter un même contenu avec une animation cohérente dans plusieurs langues. La fonctionnalité reste toutefois réservée à Gemini Enterprise et son déploiement suppose d’évaluer clairement l’identité de l’avatar, le signalement du contenu synthétique et l’accessibilité de chaque présentation.
Sources
- Gemini 3.8 Live with Live Avatar gives Google’s AI a faceThe Verge · 25 septembre 2026
- أكثر من مجرد صوت.. جوجل تمنح Gemini وجهًا متحركًا يتحدث بـ97 لغةAIT News · 25 septembre 2026



