Microsoft lança MAI‑Transcribe‑2‑Streaming para fala em tempo real em 60 idiomas a 0,54 USD por hora
A Microsoft AI colocou o serviço MAI‑Transcribe‑2‑Streaming em pré‑visualização pública em 1 de outubro de 2026, prometendo geração de hipóteses em menos de 100 ms, deteção contínua de idioma em 60 línguas e taxa de erro líder em benchmarks.

Em 1 de outubro de 2026, a divisão Microsoft AI anunciou que o seu serviço MAI‑Transcribe‑2‑Streaming entrou em fase de pré‑visualização pública. Esta oferta está posicionada como um motor de transcrição de fala para texto baseado na nuvem, capaz de processar fluxos de áudio em sessenta idiomas diferentes, entregando simultaneamente transcrições parciais e a transcrição final à medida que o áudio avança. A Microsoft promove o serviço como uma opção de baixo custo para programadores que necessitam de legendas instantâneas, pipelines de tradução ao vivo ou análises impulsionadas por voz. Em termos simples, trata‑se de uma solução que permite transformar a fala em texto quase que imediatamente, reduzindo a necessidade de processos em lote e facilitando a integração em aplicações que exigem respostas em tempo real.
Capacidades de transcrição em tempo real
A transcrição em streaming difere do processamento por lote porque o modelo gera hipóteses enquanto o orador ainda está a falar. O MAI‑Transcribe‑2‑Streaming afirma produzir uma hipótese inicial aproximadamente cem milissegundos após a receção da amostra de áudio, seguida de resultados parciais refinados e, finalmente, de uma transcrição completa enriquecida com pontuação. O sistema também executa deteção contínua de idioma, mudando automaticamente os seus modelos acústicos e linguísticos quando identifica uma mudança entre os sessenta idiomas suportados, eliminando assim a necessidade de um passo separado de seleção de idioma. Esta capacidade de mudar de idioma em tempo real permite que aplicações multilíngues operem sem interrupções, mantendo a fluidez da experiência do utilizador.
Os programadores podem aceder ao serviço através da Microsoft Foundry, que disponibiliza uma API Realtime que replica os padrões de WebSocket utilizados pelos pontos finais de streaming da OpenAI. A mesma funcionalidade está também disponível via o Azure Speech SDK, permitindo a integração em aplicações Windows, Linux, móveis e web com alterações mínimas de código. A documentação da Microsoft sublinha que a API aceita quadros de áudio brutos e devolve fragmentos de transcrição codificados em JSON, tornando‑a compatível com pipelines de tempo real já existentes. Em resumo, a API foi concebida para ser simples de integrar, reduzindo a carga de trabalho dos desenvolvedores que pretendem acrescentar funcionalidades de transcrição em tempo real às suas soluções.
Desempenho em benchmarks e precisão
Artificial Analysis, uma plataforma independente de benchmarking, colocou o MAI‑Transcribe‑2‑Streaming no topo da sua tabela de classificação de taxa de erro de palavra (WER) em streaming, após comparar trinta‑e‑oito modelos num conjunto de teste comum de oito horas. De acordo com o benchmark, o modelo atingiu um WER de 2,5 % para transcrições finais com uma latência média de 0,13 segundos, e o mesmo WER de 2,5 % para os primeiros resultados parciais entregues em 0,12 segundos. O MarkTechPost reportou estes números, salientando que o conjunto de teste incluía uma variedade de falantes, sotaques e ruídos de fundo, o que demonstra a robustez do modelo em condições reais de utilização.
As medições internas da Microsoft sustentam os números apresentados no benchmark, e a empresa alerta que as alegações de velocidade fora do teste da Artificial Analysis devem ser tratadas como estimativas internas. A pré‑visualização pública não inclui um acordo de nível de serviço (SLA) de grau de produção, o que significa que as empresas que planeiam implantações críticas deverão avaliar a fiabilidade e a latência sob as suas próprias cargas de trabalho antes de se comprometerem com um nível pago. Em outras palavras, embora os resultados de benchmark sejam impressionantes, a Microsoft recomenda que os utilizadores empresariais realizem testes próprios para validar o desempenho nas suas condições específicas.
Preços, modelos relacionados e limites da pré‑visualização
Durante o período da pré‑visualização, a Microsoft definiu um preço introdutório de cinquenta e quatro centavos de dólar por hora de áudio processado, tarifa que permanecerá em vigor até ao final de 2026. A pré‑visualização não oferece um SLA formal, e o uso além dos valores de benchmark anunciados não está garantido. Paralelamente ao serviço de transcrição, a Microsoft também lançou os modelos MAI‑Voice‑2.1 e Voice‑2.1‑Flash, sendo este último anunciado como capaz de gerar quarenta‑e‑cinco segundos de fala sintética com uma latência de ponta a ponta de aproximadamente 150 milissegundos, ao custo de quinze dólares por milhão de caracteres.
O modelo Flash destina‑se a cenários de geração de voz de baixa latência, como assistentes interativos ou dublagem em tempo real, complementando o motor de transcrição em streaming ao fornecer um caminho rápido e de alta qualidade para a saída de voz. Ambos os modelos partilham a mesma superfície de integração através da Microsoft Foundry, permitindo que os programadores encadeiem transcrição e síntese numa única sessão WebSocket, se assim o desejarem. Esta integração estreita simplifica a construção de fluxos de trabalho completos que vão da captura de áudio à geração de texto e, subsequentemente, à produção de voz sintetizada em tempo real.
- Suporta 60 idiomas com deteção automática
- Hipótese inicial gerada em ~100 ms após a receção do áudio
- WER de 2,5 % reportado no benchmark com latência de 0,13 s para transcrições finais
- Preço introdutório de $0,54 por hora de áudio (período de pré‑visualização)
- Acesso via API Realtime da Microsoft Foundry e Azure Speech SDK
A combinação de baixa latência, cobertura multilingue e um modelo de preços transparente abre novas possibilidades para programadores que desenvolvem legendas ao vivo, análises de centros de contacto multilíngues ou serviços de tradução em tempo real. Porque o serviço transmite resultados parciais, as aplicações podem começar a processar o texto antes de o orador terminar, reduzindo os tempos de resposta de ponta a ponta para componentes de IA subsequentes, como análise de sentimento ou deteção de intenção. A estrutura de custos modesta também reduz a barreira de entrada para startups e equipas de investigação que anteriormente evitavam a transcrição na nuvem devido a tarifas elevadas por minuto.
Para organizações que operam em mercados de língua inglesa, a pré‑visualização significa que as interfaces de fala em tempo real podem agora ser implementadas a uma fração do custo das ofertas anteriores do Azure Speech, mantendo ainda uma ampla cobertura de idiomas para equipas globais. As empresas podem experimentar legendas ao vivo para webinars, integrar subtítulos instantâneos em plataformas de vídeo ou reforçar o apoio ao cliente baseado em voz com transcrição em tempo real, tudo sem a necessidade de comprometer um SLA de produção até que o serviço evolua para além da fase de pré‑visualização.
Fontes
- Our first streaming transcription model debuts at no. 1 on Artificial AnalysisMicrosoft AI · 1 de outubro de 2026
- Microsoft AI Releases MAI-Transcribe-2-StreamingMarkTechPost · 2 de outubro de 2026



