SpaceXAI lance Grok Voice Transcribe 2.0 avec un doublement de précision multilingue
SpaceXAI a présenté le 18 septembre 2026 Grok Voice Transcribe 2.0, promettant deux fois plus de précision que son prédécesseur au même tarif et la détection automatique de 19 langues.

Le 18 septembre 2026, SpaceXAI a annoncé la disponibilité générale de Grok Voice Transcribe 2.0 via son API de reconnaissance vocale, identifiée sous le nom grok-voice-transcribe-2.0. L’entreprise positionne ce nouveau service comme une mise à jour directe de la version originale, en mettant en avant un doublement de la précision de transcription tout en maintenant le même coût horaire.
Selon les propres mesures de SpaceXAI, le modèle atteint désormais un taux d’erreur de mots (WER) de 6,8 % sur des phrases multilingues courtes, contre 20,6 % pour la version 1.0. Cela représente une réduction d’environ 67 % des erreurs sur cet ensemble de test, qui couvre 19 langues et simule des énoncés réels en langues mixtes.
Performances au benchmark et classement public
L’entreprise cite le tableau de bord public Artificial Analysis, où Grok Voice Transcribe 2.0 occupe actuellement la première place en précision parmi 32 modèles de transcription en streaming. SpaceXAI précise que ce classement repose sur des évaluations indépendantes, bien que la méthodologie exacte du tableau de bord ne soit pas détaillée dans le communiqué.
Outre l’amélioration du WER annoncée, des tests internes sur quatre jeux de données propriétaires – appels téléphoniques, discours conversationnels, identifiants dictés et courtes phrases multilingues – ont montré des baisses d’erreurs cohérentes dans tous les domaines. Le gain le plus remarquable a été observé sur le jeu de courtes phrases, où le taux d’erreur est passé de 20,6 % à 6,8 %.
Capacités techniques et fonctionnalités de l’API
Grok Voice Transcribe 2.0 prend en charge les modes batch et streaming. En mode batch, les utilisateurs soumettent des fichiers audio pour un traitement hors ligne, tandis que le mode streaming fournit une transcription en temps réel avec horodatage mot à mot, diarisation des locuteurs et prise en charge de jusqu’à huit canaux audio. Toutes ces fonctions sont incluses dans le prix de base de 0,10 $ par heure pour le batch et 0,20 $ par heure pour le streaming.
Le modèle détecte automatiquement la langue parlée et peut changer de langue en cours d’enregistrement, une capacité particulièrement utile lors de réunions multilingues ou d’appels de support client où agents et appelants alternent les langues.
Au‑delà de la simple transcription, l’API renvoie du texte formaté, met en évidence une liste soignée de cent termes spécialisés et sépare les locuteurs sans frais supplémentaires. Cette offre groupée contraste avec de nombreux concurrents qui facturent la diarisation ou l’horodatage en supplément.
Adoption et intégration dans l’écosystème
Atlassian a déjà intégré Grok Voice Transcribe 2.0 à sa plateforme vidéo Loom pour générer des sous‑titres de réunions et de tutoriels enregistrés. Le service reste hébergé par SpaceXAI, et l’entreprise n’a pas publié de modèle à poids ouvert pour un déploiement en interne.
- 0,10 $ par heure pour la transcription batch
- 0,20 $ par heure pour la transcription streaming
- Détection automatique de la langue pour 19 langues
- Diarisation des locuteurs et horodatage mot à mot inclus
La tarification est simple : les clients sont facturés à l’heure d’audio traité, sans frais cachés pour les fonctionnalités avancées. Cette transparence vise les entreprises qui recherchent des modèles de coûts prévisibles pour des charges de transcription à grande échelle.
Ce que cela signifie pour les organisations francophones
Pour les organisations qui opèrent principalement en français mais qui interagissent avec des clients ou partenaires multilingues, Grok Voice Transcribe 2.0 propose une API unique capable de gérer des contenus en langues mixtes sans devoir orienter l’audio vers des services distincts selon la langue. La réduction du taux d’erreur sur les courtes phrases améliore la fiabilité de la prise de notes automatisée, de la journalisation de conformité et du sous‑titrage en temps réel, ce qui peut diminuer les coûts de révision manuelle. De plus, la diarisation des locuteurs et les horodatages inclus dans le prix de base simplifient l’intégration aux pipelines d’analyse, permettant d’extraire plus rapidement des insights à partir d’enregistrements d’appels et de conférences vidéo.
Sources
- Introducing Grok Voice Transcribe 2.0SpaceXAI · 18 septembre 2026
- SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per HourMarkTechPost · 18 septembre 2026



