Microsoft lance MAI‑Transcribe‑2‑Streaming pour la parole en temps réel dans 60 langues à 0,54 $ de l’heure
Microsoft AI a mis son service MAI‑Transcribe‑2‑Streaming en aperçu public le 1 octobre 2026, promettant une génération d’hypothèses en moins de 100 ms, une détection continue de la langue sur 60 langues et un taux d’erreur leader du marché.

Le 1 octobre 2026, Microsoft AI a annoncé que son service MAI‑Transcribe‑2‑Streaming était entré en aperçu public. Ce service est présenté comme un moteur cloud de transcription vocale en temps réel capable de gérer des flux audio dans soixante langues, fournissant à la fois des transcriptions partielles et finales au fur et à mesure que l’audio progresse. Microsoft le commercialise comme une option à faible coût pour les développeurs qui ont besoin de sous-titres instantanés, de pipelines de traduction en direct ou d’analyses pilotées par la voix. En d’autres termes, il s’agit d’une solution qui permet aux applications de recevoir du texte dès que les mots sont prononcés, réduisant ainsi le délai entre la parole et le texte affiché.
Capacités de transcription en temps réel
La transcription en flux diffère du traitement par lots parce que le modèle émet des hypothèses pendant que le locuteur parle encore. MAI‑Transcribe‑2‑Streaming affirme produire une première hypothèse environ cent millisecondes après la réception du segment audio, suivie de résultats partiels affinés et d’une transcription finale enrichie de ponctuation. Le système effectue également une détection continue de la langue, changeant automatiquement ses modèles acoustiques et linguistiques lorsqu’il détecte un changement parmi les soixante langues prises en charge, éliminant ainsi la nécessité d’une étape de sélection de langue séparée. Cette capacité à basculer de façon transparente entre les langues améliore l’expérience utilisateur dans les environnements multilingues.
Les développeurs peuvent accéder au service via Microsoft Foundry, qui expose une API Realtime reproduisant les modèles WebSocket utilisés par les points de terminaison de streaming d’OpenAI. La même fonctionnalité est également disponible via le SDK Azure Speech, permettant l’intégration dans les applications Windows, Linux, mobiles et web avec des modifications de code minimales. La documentation de Microsoft souligne que l’API accepte des trames audio brutes et renvoie des fragments de transcription encodés en JSON, ce qui le rend compatible avec les pipelines en temps réel existants. Ainsi, les équipes de développement peuvent rapidement ajouter la transcription en direct à leurs produits sans devoir réécrire l’infrastructure de traitement audio.
Performances au benchmark et précision
Artificial Analysis, une plateforme de benchmark indépendante, a placé MAI‑Transcribe‑2‑Streaming en tête de son classement de taux d’erreur de mots (WER) en streaming, qui a comparé trente‑huit modèles sur un mix de test commun de huit heures. Selon le benchmark, le modèle a atteint un WER de 2,5 % pour les transcriptions finales avec une latence moyenne de 0,13 seconde, et le même WER de 2,5 % pour les premiers résultats partiels livrés en 0,12 seconde. MarkTechPost a rapporté ces chiffres, notant que le mix de test incluait une variété de locuteurs, d’accents et de bruits de fond. Ces résultats montrent que le service maintient une précision élevée même dans des conditions audio variées.
Les mesures internes de Microsoft soutiennent les chiffres du benchmark, et l’entreprise avertit que les affirmations de vitesse en dehors du test Artificial Analysis doivent être considérées comme des estimations internes. L’aperçu public ne comprend pas d’accord de niveau de service (SLA) de production, ce qui signifie que les entreprises prévoyant des déploiements critiques devront évaluer la fiabilité et la latence sous leurs propres charges de travail avant de s’engager dans une offre payante. Cette précaution incite les organisations à réaliser leurs propres tests de performance pour garantir que le service répond à leurs exigences opérationnelles.
Tarification, modèles associés et limites de l’aperçu
Pendant la durée de l’aperçu, Microsoft a fixé le prix d’introduction à cinquante‑quatre cents par heure d’audio traité, tarif qui restera en vigueur jusqu’à la fin de 2026. L’aperçu ne comporte pas de SLA formel, et l’utilisation au‑delà des chiffres de benchmark annoncés n’est pas garantie. En parallèle du service de transcription, Microsoft a également publié MAI‑Voice‑2.1 et Voice‑2.1‑Flash, ce dernier étant présenté comme capable de générer quarante‑cinq secondes de parole synthétique avec une latence de bout en bout d’environ 150 millisecondes à un coût de quinze dollars par million de caractères.
Le modèle Flash est destiné aux scénarios de génération vocale à faible latence tels que les assistants interactifs ou le doublage en temps réel, complétant le moteur de transcription en streaming en offrant une voie de sortie vocale rapide et de haute qualité. Les deux modèles partagent la même surface d’intégration via Microsoft Foundry, permettant aux développeurs d’enchaîner transcription et synthèse dans une même session WebSocket si désiré. Cette intégration fluide simplifie la création d’applications qui nécessitent à la fois la conversion de la parole en texte et la génération de parole à partir de texte.
- Prise en charge de 60 langues avec détection automatique
- Hypothèse initiale générée en ~100 ms après réception de l’audio
- WER de 2,5 % rapporté au benchmark avec latence de 0,13 s pour les transcriptions finales
- Prix d’introduction de 0,54 $ par heure d’audio (période d’aperçu)
- Accès via l’API Realtime de Microsoft Foundry et le SDK Azure Speech
La combinaison d’une faible latence, d’une couverture multilingue étendue et d’un modèle de tarification transparent ouvre de nouvelles possibilités pour les développeurs qui construisent des sous‑titres en direct, des analyses de centres d’appels multilingues ou des services de traduction en temps réel. Parce que le service diffuse des résultats partiels, les applications peuvent commencer à traiter le texte avant que le locuteur ne termine, réduisant ainsi les temps de réponse de bout en bout pour les composants d’IA en aval tels que l’analyse de sentiment ou la détection d’intention. La structure de coût modeste réduit également la barrière d’entrée pour les startups et les équipes de recherche qui évitaient auparavant la transcription cloud en raison de frais élevés au minute.
Pour les organisations opérant sur les marchés anglophones, l’aperçu signifie que les interfaces vocales en temps réel peuvent désormais être déployées à une fraction du coût des offres Azure Speech précédentes, tout en couvrant un large éventail de langues pour les équipes mondiales. Les entreprises peuvent expérimenter le sous‑titrage en direct pour les webinaires, intégrer des sous‑titres instantanés dans les plateformes vidéo, ou enrichir le support client piloté par la voix avec une transcription en temps réel, le tout sans s’engager immédiatement dans un SLA de production tant que le service reste en phase d’aperçu.
Sources
- Our first streaming transcription model debuts at no. 1 on Artificial AnalysisMicrosoft AI · 1 octobre 2026
- Microsoft AI Releases MAI-Transcribe-2-StreamingMarkTechPost · 2 octobre 2026



