Sarvam AI lance Saaras V4, modèle de reconnaissance vocale multilingue couvrant 22 langues indiennes et l'anglais
Le 24 août 2026, Sarvam AI a présenté Saaras V4, un système de reconnaissance vocale de nouvelle génération supportant 22 langues indiennes et l'anglais, avec cinq modes de transcription intégrés et des taux d’erreur de mots parmi les meilleurs du secteur.

Le 24 août 2026, Sarvam AI a dévoilé Saaras V4, la dernière itération de sa plateforme de reconnaissance vocale. L’annonce a positionné le modèle comme une solution unique pour les 22 langues officiellement reconnues en Inde, ainsi que pour l'anglais, une couverture qui reste rare parmi les moteurs de parole commerciaux.
La description technique fournie par Sarvam AI indique que Saaras V4 combine un encodeur audio dédié avec un décodeur hybride à espace d’état de type grand modèle de langage (LLM). Le décodeur comporte trois milliards de paramètres et a été entraîné entièrement en interne, ce qui signifie que Sarvam AI a conservé le contrôle total sur la chaîne de données, l’architecture du modèle et les procédures d’optimisation.
Des modes de transcription intégrés qui suppriment les étapes de post‑traitement
Une caractéristique notable de Saaras V4 est l’inclusion de cinq modes de transcription directement dans le moteur : transcribe, verbatim, codemix, translit et translate. En intégrant ces capacités, le modèle élimine le besoin de phases de post‑traitement séparées qui, traditionnellement, introduisent des erreurs d’alignement, des incohérences de formatage ou des fautes d’identification de langue.
Le mode transcribe fournit un texte propre et ponctué, adapté aux applications générales. Le mode verbatim conserve chaque remplissage, chaque hésitation et chaque son non lexical, ce qui s’avère utile pour les dossiers juridiques ou médicaux. Le mode codemix traite la parole qui mélange plusieurs langues dans une même phrase, un phénomène courant dans les contextes multilingues indiens. Le mode translit convertit le contenu oral en une écriture cible, tandis que le mode translate produit une version anglaise de l’énoncé original, permettant une accessibilité interlinguistique sans passer par des pipelines de traduction externes.
Allégations de performance et limites de la validation externe
Sarvam AI affirme que Saaras V4 atteint le taux d’erreur de mots (WER) le plus bas jamais rapporté sur les 22 langues indiennes ainsi que sur sept jeux de référence anglais incluant des accents mondiaux et des variantes d’anglais indien. Ces affirmations sont présentées comme des benchmarks internes, et l’entreprise n’a pas encore publié d’études de réplication indépendantes ni de résultats d’audits tiers.
L’absence de validation externe signifie que les organisations doivent considérer les chiffres de WER comme provisoires. Si les tests internes peuvent démontrer une performance solide dans des conditions contrôlées, les déploiements en conditions réelles rencontrent souvent des environnements acoustiques, des démographies d’orateurs et des variations dialectales qui diffèrent du corpus d’entraînement. Tant que des évaluations revues par les pairs n’apparaissent pas, la marge exacte d’amélioration par rapport aux systèmes concurrents reste incertaine.
Robustesse face au bruit, au code‑mixing et aux dialectes
Selon les tests internes de Sarvam AI, Saaras V4 conserve une robustesse notable sur des enregistrements bruyants, gère le discours code‑mixé et s’adapte aux changements dialectaux. L’entreprise rapporte un taux d’erreur d’identification de langue de 2,9 % pour les dix langues indiennes les plus parlées et de 5,22 % pour l’ensemble des 22 langues. Ces chiffres suggèrent que le modèle peut détecter de façon fiable la langue d’une utterance même lorsque les locuteurs alternent entre plusieurs langues au sein d’une même phrase.
Les affirmations de robustesse sont liées à des protocoles d’évaluation internes qui simulent du bruit de fond et des entrées multilingues. Aucun jeu de données public ni script reproductible n’a été publié, ce qui limite la capacité des chercheurs externes à confirmer la tolérance du modèle aux conditions acoustiques défavorables.
Latence de streaming et considérations de déploiement
Saaras V4 est présenté comme supportant un streaming à faible latence. La documentation spécifie un temps jusqu’au premier token inférieur à 150 millisecondes, et le moteur peut traiter des enregistrements de plusieurs minutes à une vitesse d’une seconde audio par seconde de calcul. Ces métriques sont pertinentes pour les services de transcription en temps réel, l’analyse des centres d’appels et le sous‑titrage en direct.
Cependant, le guide d’auto‑hébergement ne couvre actuellement que la version 3 de la plateforme. L’absence de documentation sur le déploiement en local pour la version 4 crée une barrière pour les organisations qui exigent une installation sur site en raison de réglementations de confidentialité des données ou de contraintes réseau. Les clients pourraient devoir s’appuyer sur l’offre cloud gérée par Sarvam AI jusqu’à la publication du guide de déploiement v4.
- Décodeur hybride à espace d’état LLM de trois milliards de paramètres
- Cinq modes de transcription intégrés (transcribe, verbatim, codemix, translit, translate)
- Taux d’erreur d’identification de langue : 2,9 % (top 10 langues), 5,22 % (les 22)
- Latence de streaming : premier token <150 ms, vitesse de traitement 1 × temps réel
Le tarif est transparent et échelonné. Sarvam AI indique un coût de 30 ₹ par heure pour la transcription en temps réel ou en batch, tandis que l’ajout de la diarisation des intervenants porte le tarif à 45 ₹ par heure. Ces tarifs s’appliquent à l’utilisation du service hébergé ; les poids du modèle ne sont pas diffusés en open‑source, ce qui empêche toute modification ou redistribution directe.
Le caractère fermé des poids du modèle signifie que les organisations ne peuvent pas auditer l’architecture sous‑jacente pour détecter d’éventuels biais, vulnérabilités de sécurité ou non‑conformités aux régulations locales. Bien que la structure tarifaire soit simple, le manque de transparence du modèle peut influencer les décisions d’achat des entités qui privilégient la visibilité et la traçabilité.
D’un point de vue pratique, les entreprises souhaitant adopter Saaras V4 doivent peser les avantages des capacités multilingues intégrées contre les incertitudes liées à la validation externe et au déploiement sur site. La capacité du modèle à gérer le code‑mixing et les variations dialectales correspond à la réalité linguistique de nombreux marchés indiens, ce qui pourrait réduire le besoin d’utiliser plusieurs moteurs spécialisés.
Néanmoins, les organisations devraient planifier une phase de validation incluant des tests pilotes sur leurs propres corpus audio, la mesure de la latence dans leur environnement réseau, et l’évaluation de la précision d’identification de langue pour les dialectes spécifiques qu’elles rencontrent. Un tel essai peut révéler d’éventuels écarts entre les benchmarks internes rapportés par Sarvam AI et les performances observées en production.
En résumé, Saaras V4 représente une avancée technique importante pour Sarvam AI, offrant une solution unifiée pour un large éventail de langues indiennes et l’anglais, avec plusieurs options de transcription et un streaming à faible latence. Les affirmations internes de l’entreprise concernant une précision et une robustesse de pointe sont prometteuses, mais l’absence de vérification indépendante et la documentation de déploiement limitée introduisent un risque mesurable. Les organisations qui adoptent le service devraient mener des tests internes rigoureux, prendre en compte les implications d’un modèle propriétaire, et surveiller les futures mises à jour du guide d’auto‑hébergement avant de s’engager dans des déploiements à grande échelle et à haute criticité.
Sources
- Introducing Saaras V4 - Sarvam AISarvam AI · 25 septembre 2026
- Sarvam AI Releases Saaras V4: A Speech-to-Text Model for All 22 Indian Languages and Global English - MarkTechPostMarkTechPost · 26 septembre 2026



