SpaceXAI lanza Grok Voice Transcribe 2.0 con precisión duplicada y detección automática de 19 idiomas
SpaceXAI presentó Grok Voice Transcribe 2.0 el 18 de septiembre de 2026, ofreciendo el doble de precisión que su predecesor al mismo precio y detección automática de idioma en 19 lenguas.

El 18 de septiembre de 2026, SpaceXAI anunció la disponibilidad general de Grok Voice Transcribe 2.0 a través de su API de reconocimiento de voz, identificada como grok-voice-transcribe-2.0. La compañía posiciona el nuevo servicio como una actualización directa del Grok Voice Transcribe original, destacando una mejora de dos veces en la precisión de la transcripción sin cambiar el coste por hora.
Según los propios benchmarks de SpaceXAI, el modelo alcanza ahora una tasa de error de palabras (WER) del 6,8 % en frases cortas multilingües, frente al 20,6 % registrado por la versión 1.0. Esto representa una reducción aproximada del 67 % en los errores para ese conjunto de pruebas, que cubre 19 idiomas y simula situaciones reales de habla mixta.
Rendimiento en benchmarks y posición pública
La compañía cita la tabla de clasificación pública de Artificial Analysis, donde Grok Voice Transcribe 2.0 ocupa actualmente el primer puesto en precisión entre 32 modelos de transcripción en streaming. SpaceXAI señala que la clasificación se basa en evaluaciones independientes, aunque la metodología exacta del ranking no se detalla en el comunicado.
Además de la mejora en el WER, pruebas internas en cuatro conjuntos de datos propietarios —llamadas telefónicas, conversaciones, dictados de identificadores y frases cortas multilingües— mostraron reducciones consistentes de errores en todos los dominios. Los mayores avances se observaron en el conjunto de frases cortas, donde la caída del error del 20,6 % al 6,8 % fue registrada.
Capacidades técnicas y características de la API
Grok Voice Transcribe 2.0 admite tanto modos por lotes como en streaming. En modo por lotes, los usuarios pueden enviar archivos de audio para procesamiento offline, mientras que el modo streaming ofrece transcripción en tiempo real con marcas de tiempo a nivel de palabra, diarización de hablantes y hasta ocho canales de audio. Todas estas funciones están incluidas en el precio base de 0,10 USD por hora para lotes y 0,20 USD por hora para streaming.
El modelo detecta automáticamente el idioma hablado y puede cambiar la detección a mitad de grabación, una capacidad especialmente útil para reuniones multilingües o llamadas de atención al cliente donde agentes y usuarios alternan idiomas.
Más allá de la transcripción básica, la API devuelve texto formateado, acentuación de una lista curada de cien términos especializados y separación de hablantes sin cargos adicionales. Esta oferta empaquetada contrasta con muchos competidores que cobran extra por diarización o marcas de tiempo.
Adopción e integración en el ecosistema
Atlassian ya ha integrado Grok Voice Transcribe 2.0 en su plataforma de video Loom para generar subtítulos en reuniones y tutoriales grabados. El servicio sigue alojado por SpaceXAI y la compañía no ha publicado ningún modelo de peso abierto para despliegues locales.
- 0,10 USD por hora para transcripción por lotes
- 0,20 USD por hora para transcripción en streaming
- Detección automática de idioma para 19 lenguas
- Diarización de hablantes y marcas de tiempo a nivel de palabra incluidas
La estructura de precios es sencilla: los clientes pagan por hora de audio procesado, sin tarifas ocultas para funciones avanzadas. Esta simplicidad está pensada para atraer a empresas que requieren modelos de coste predecibles en cargas de trabajo de transcripción a gran escala.
Qué implica para organizaciones de habla hispana
Para organizaciones que operan principalmente en español pero interactúan con clientes o socios multilingües, Grok Voice Transcribe 2.0 ofrece una API única capaz de manejar contenido mixto sin necesidad de redirigir el audio a servicios específicos por idioma. La reducción del error en frases cortas mejora la fiabilidad de la toma de notas automática, el registro de cumplimiento y los subtítulos en tiempo real, lo que puede disminuir los costos de edición manual. Además, la inclusión de diarización de hablantes y marcas de tiempo en el precio base simplifica la integración con pipelines de análisis, permitiendo extraer insights más rápidamente de grabaciones de llamadas y videoconferencias.
Fuentes
- Introducing Grok Voice Transcribe 2.0SpaceXAI · 18 de septiembre de 2026
- SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per HourMarkTechPost · 18 de septiembre de 2026



