SpaceXAI lança Grok Voice Transcribe 2.0 com precisão multilíngue aprimorada
SpaceXAI revelou o Grok Voice Transcribe 2.0 a 18 de setembro de 2026, prometendo o dobro da precisão da versão anterior ao mesmo preço e detecção automática de 19 idiomas.

A 18 de setembro de 2026, a SpaceXAI anunciou a disponibilidade geral do Grok Voice Transcribe 2.0 através da sua API de reconhecimento de fala, identificada como grok-voice-transcribe-2.0. A empresa apresenta o novo serviço como uma atualização direta do Grok Voice Transcribe original, enfatizando uma melhoria de duas vezes na precisão da transcrição, mantendo o custo por hora inalterado.
Segundo os próprios testes de referência da SpaceXAI, o modelo atinge agora uma taxa de erro de palavras (WER) de 6,8 % em frases curtas multilíngues, contra 20,6 % registados pela versão 1.0. Isto representa uma redução aproximada de 67 % nos erros para esse conjunto de testes específico, que cobre 19 idiomas e simula intervenções reais em língua mista.
Desempenho de referência e classificação pública
A empresa cita o quadro público Artificial Analysis, onde o Grok Voice Transcribe 2.0 ocupa atualmente o primeiro lugar em precisão entre 32 modelos de transcrição em streaming. A SpaceXAI sublinha que a classificação baseia‑se em avaliações independentes, embora a metodologia exata do quadro não seja divulgada no comunicado.
Para além da melhoria do WER, testes internos em quatro conjuntos de dados proprietários — chamadas telefónicas, discurso conversacional, identificadores ditados e frases curtas multilíngues — mostraram reduções consistentes de erros em todos os domínios. Os ganhos mais marcantes foram observados no conjunto de frases curtas, onde a queda de 20,6 % para 6,8 % foi registada.
Capacidades técnicas e funcionalidades da API
O Grok Voice Transcribe 2.0 suporta modos batch e streaming. No modo batch, os utilizadores podem submeter ficheiros de áudio para processamento offline, enquanto o modo streaming fornece transcrição em tempo real com marcadores de tempo a nível de palavra, diarização de oradores e até oito canais de áudio. Todas estas funcionalidades estão incluídas no preço base de 0,10 $ por hora para batch e 0,20 $ por hora para streaming.
O modelo detecta automaticamente a língua falada e pode mudar a deteção durante a gravação, uma capacidade particularmente útil em reuniões multilíngues ou chamadas de apoio ao cliente onde agentes e interlocutores alternam entre idiomas.
Para além da transcrição básica, a API devolve texto formatado, acentuação de uma lista curada de cem termos especializados e separação de oradores sem custos adicionais. Esta oferta integrada contrasta com muitos concorrentes que cobram extra por diarização ou marcação de tempo.
Adopção e integração no ecossistema
A Atlassian já integrou o Grok Voice Transcribe 2.0 na sua plataforma de vídeo Loom para gerar legendas em reuniões gravadas e tutoriais. O serviço continua alojado pela SpaceXAI, e a empresa não divulgou nenhum modelo de código aberto para implementação on‑premises.
- 0,10 $ por hora para transcrição batch
- 0,20 $ por hora para transcrição streaming
- Deteção automática de idioma para 19 línguas
- Diarização de oradores e marcadores de tempo incluídos
A estrutura de preços é simples: os clientes são faturados por hora de áudio processado, sem taxas ocultas para funcionalidades avançadas. Esta simplicidade destina‑se a atrair empresas que necessitam de modelos de custos previsíveis para cargas de trabalho de transcrição em grande escala.
O que isso significa para organizações que utilizam principalmente o português
Para organizações que operam predominantemente em português, mas que interagem com clientes ou parceiros multilíngues, o Grok Voice Transcribe 2.0 oferece uma única API capaz de tratar conteúdo em várias línguas sem necessidade de encaminhar o áudio para serviços específicos de cada idioma. A taxa de erro reduzida em frases curtas aumenta a fiabilidade da tomada automática de notas, registo de conformidade e legendas em tempo real, podendo reduzir os custos de edição manual. Além disso, a inclusão de diarização de oradores e marcadores de tempo no preço base simplifica a integração com pipelines de análise, permitindo uma extração mais rápida de insights a partir de gravações de chamadas e videoconferências.
Fontes
- Introducing Grok Voice Transcribe 2.0SpaceXAI · 18 de setembro de 2026
- SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per HourMarkTechPost · 18 de setembro de 2026



