Gemini 3.8 Live vise les agents vocaux en production
Google lance deux modèles parole-parole hébergés pour agents vocaux, avec appels d outils asynchrones, vision presque temps réel et scores attribués à Google.

Google a présenté Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking le 15 septembre 2026 comme deux modèles natifs parole-parole destinés aux agents vocaux en production. La différence annoncée est d abord opérationnelle. Gemini 3.8 Live vise l échelle et l efficacité économique, pour les entreprises qui veulent faire tourner de nombreuses conversations en direct à un coût prévisible. Gemini 3.8 Live Extended Thinking vise les tâches complexes et le raisonnement en plusieurs étapes, quand l agent doit réfléchir avant de répondre, appeler un outil ou changer de stratégie. Les deux modèles sont disponibles via Gemini Live API et Google AI Studio. Ils sont hébergés, pas open weights, et ne peuvent donc pas être auto-hébergés.
Deux modèles hébergés pour la voix en direct
Cette annonce compte parce qu un agent vocal ne casse pas comme un chatbot textuel. Dans une interface écrite, une pause de récupération de données se voit et peut être tolérée. Dans un appel ou une réunion, le système doit gérer les silences, les interruptions, les tours de parole et les résultats d outils sans donner l impression que la conversation s est arrêtée. Google met en avant l appel de fonctions asynchrone pour répondre à une partie de ce problème. Le modèle peut lancer des outils et des API en arrière-plan tout en poursuivant l échange, au lieu de bloquer l utilisateur jusqu à la fin de chaque action externe.
- Gemini 3.8 Live vise l échelle et le coût pour les agents vocaux de production.
- Gemini 3.8 Live Extended Thinking vise les tâches complexes et le raisonnement en plusieurs étapes.
- Les deux modèles sont natifs parole-parole et disponibles depuis le 15 septembre 2026 via Gemini Live API et Google AI Studio.
- Google indique que l appel de fonctions asynchrone permet de lancer outils et API en arrière-plan pendant la conversation.
- Les modèles sont hébergés et non open weights, ce qui exclut l auto-hébergement.
Ce que Google dit des capacités en direct
Google présente aussi ces modèles comme des systèmes multimodaux en direct, pas seulement comme des moteurs vocaux. Ils peuvent traiter des entrées visuelles presque en temps réel, ce qui devient utile quand un agent doit regarder un écran, un produit, un document ou un environnement de travail pendant qu il parle. Google indique également que les modèles détectent et changent automatiquement entre 97 langues. Cette capacité vise les appels multilingues où l utilisateur ne reste pas dans une seule langue. L entreprise met enfin en avant une meilleure précision pour les codes et les données alphanumériques, point crucial pour les numéros de commande, identifiants de compte, références de réservation ou chaînes de vérification.
Des scores annoncés, pas une validation générale
Google communique plusieurs scores pour Gemini 3.8 Live Extended Thinking : 82,6 au Speech to Speech Quality Index, 68,6 % à tau-Voice, 35,1 % à Sierra tau-Voice-banking et 97,7 % à Big Bench Audio. Google indique aussi que Gemini 3.8 Live est deuxième de Speech Agent Arena. Ces chiffres donnent un signal sur les progrès revendiqués par Google, mais ils restent des résultats annoncés et non une validation indépendante générale de tous les usages en production. La qualité d un agent vocal dépend aussi de la latence, de l acoustique, de la téléphonie, des interruptions, de la fiabilité des outils et de la supervision.
MarkTechPost rapporte des tarifs de 0,005 dollar par minute d entrée audio et 0,018 dollar par minute de sortie audio. Le média présente cette estimation comme fondée sur 3 dollars par million de jetons d entrée et 12 dollars par million de jetons de sortie. Pour les acheteurs, le sujet n est pas seulement le prix affiché, mais le coût réel d une tâche résolue. Un agent en production facture aussi les salutations, les répétitions, les abandons, les transferts, les erreurs et le trafic de supervision. L avantage économique promis par Gemini 3.8 Live devra donc être mesuré sur toute la boucle de conversation.
Partenaires et chemins de déploiement
Google cite Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents parmi les partenaires d infrastructure temps réel associés au lancement. Le déploiement suit plusieurs chemins. L API et Google AI Studio sont disponibles immédiatement; des previews privées sont prévues dans Gemini Enterprise; et la disponibilité dans Search Live, Gemini Live et certaines expériences Workspace dépendra des offres concernées. Google précise aussi que tous les sons générés par ses produits IA portent le filigrane imperceptible SynthID. Cela ne remplace ni la transparence ni les journaux d audit, mais ajoute un contrôle à examiner.
Avant une mise en production, les acheteurs devraient tester la latence de bout en bout, les interruptions, la reprise après erreur, le coût réel, la traçabilité des appels d outils et la supervision humaine. Cette partie relève de l analyse, pas d une annonce de Google. Pour les entreprises francophones, le changement concret est qu une ligne Gemini native parole-parole peut désormais être évaluée comme une brique de production hébergée. Le bon pilote n est donc pas une démonstration fluide, mais un parcours d appel mesuré avec accents variés, bruit, codes à épeler, échecs d API, règles d escalade et reprise par un conseiller humain.
Sources
- Introducing Gemini 3.8 Live and 3.8 Live Extended ThinkingGoogle · 15 septembre 2026
- Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice AgentsMarkTechPost · 15 septembre 2026



