SpaceXAI, 다국어 스트리밍 정확도 향상된 Grok Voice Transcribe 2.0 출시
SpaceXAI는 2026년 9월 18일 Grok Voice Transcribe 2.0을 공개하며, 전 모델 대비 두 배 높은 정확도를 동일 가격에 제공하고 19개 언어에 대한 자동 언어 감지를 지원한다고 발표했습니다.

2026년 9월 18일, SpaceXAI는 Grok Voice Transcribe 2.0을 일반 이용 가능하도록 발표했으며, 해당 서비스는 grok-voice-transcribe-2.0이라는 이름의 음성 인식 API를 통해 제공됩니다. 회사는 이 새로운 서비스가 기존 Grok Voice Transcribe의 직접적인 업그레이드이며, 전 시간당 비용을 유지하면서 전사적 정확도가 두 배 향상되었다고 강조했습니다.
SpaceXAI 자체 벤치마크에 따르면, 이번 모델은 짧은 다국어 문장에서 6.8%의 단어 오류율(WER)을 기록했으며, 이는 1.0 버전에서 측정된 20.6%보다 크게 감소한 수치입니다. 이는 19개 언어를 포함한 테스트 세트에서 오류가 약 67% 감소했음을 의미합니다.
벤치마크 성능 및 공개 순위
회사에 따르면, Grok Voice Transcribe 2.0은 현재 32개의 스트리밍 전사 모델 중 정밀도 부문에서 1위를 차지하고 있습니다. 이 순위는 독립적인 평가를 기반으로 하지만, 리더보드의 구체적인 방법론은 보도자료에 명시되지 않았습니다.
헤드라인 WER 개선 외에도, 전화 통화, 대화형 음성, 식별자 기록, 짧은 다국어 구문 등 네 가지 자체 데이터셋에 대한 내부 테스트에서도 모든 도메인에서 일관된 오류 감소가 확인되었습니다. 특히 짧은 구문 세트에서는 오류가 20.6%에서 6.8%로 크게 낮아졌습니다.
기술 사양 및 API 기능
Grok Voice Transcribe 2.0은 배치 모드와 스트리밍 모드를 모두 지원합니다. 배치 모드에서는 오디오 파일을 오프라인으로 처리할 수 있고, 스트리밍 모드에서는 실시간 전사와 함께 단어 수준 타임스탬프, 화자 구분, 최대 8개의 오디오 채널을 제공합니다. 이 모든 기능은 배치 시 시간당 0.10달러, 스트리밍 시 시간당 0.20달러의 기본 가격에 포함됩니다.
모델은 자동으로 말해진 언어를 감지하며, 녹음 중에도 언어 전환을 인식할 수 있어 다국어 회의나 고객 지원 전화에서 에이전트와 고객이 언어를 교체할 때 유용합니다.
기본 전사 외에도 API는 서식이 적용된 텍스트, 100개의 전문 용어에 대한 강조 표시, 화자 구분을 추가 비용 없이 반환합니다. 이는 다이아리제이션이나 타임스탬프에 별도 요금을 부과하는 경쟁사와 차별화되는 점입니다.
채택 현황 및 생태계 통합
Atlassian은 이미 Grok Voice Transcribe 2.0을 Loom 비디오 플랫폼에 통합해 녹화된 회의와 튜토리얼에 자막을 자동 생성하고 있습니다. 서비스는 SpaceXAI가 호스팅하며, 온프레미스 배포를 위한 오픈 웨이트 모델은 공개되지 않았습니다.
- 배치 전사 시간당 $0.10
- 스트리밍 전사 시간당 $0.20
- 19개 언어 자동 감지
- 화자 구분 및 단어 수준 타임스탬프 포함
가격 구조는 간단합니다: 고객은 처리된 오디오 시간당 요금만 지불하며, 고급 기능에 대한 숨은 비용은 없습니다. 이는 대규모 전사 작업을 수행하는 기업이 예측 가능한 비용 모델을 선호하도록 설계되었습니다.
한국 기업에 미치는 의미
Grok Voice Transcribe 2.0의 정확도 향상이 실제 서비스 환경에서 어떤 의미를 갖는지 검증하기 위해서는 기존 모델과의 직접 비교 실험이 필수적이다. 동일한 오디오 샘플을 두 모델에 각각 적용하고, 전사 결과를 정량적 지표인 단어 오류율(WER)뿐 아니라 의미적 일관성, 구문 구조 유지 여부까지 평가한다면 정확도 상승이 단순 수치 개선을 넘어 실제 사용자의 이해도와 작업 효율에 미치는 파급 효과를 보다 명확히 파악할 수 있다. 특히 다국어 혼합 구문에서의 오류 감소가 얼마나 일관되게 나타나는지를 확인하려면 언어 전환 빈도가 높은 대화 데이터를 포함한 포괄적인 테스트 세트를 활용해야 한다.
다국어 자동 언어 감지 기능은 이론적으로 언어 전환을 실시간으로 인식해 전사 오류를 최소화한다는 장점을 제공한다. 하지만 실제 적용 상황에서는 배경 소음, 억양 차이, 발음 변형 등 변인에 따라 감지 정확도가 변동될 수 있다. 따라서 언어 감지 모듈의 한계점을 명시하고, 감지가 실패했을 경우 전사 품질이 급격히 저하되는 시나리오를 사전에 정의해 두는 것이 중요하다. 이러한 한계는 API 사용자가 사전 처리 단계에서 음성 품질을 개선하거나, 감지 오류 발생 시 보조 언어 모델을 호출하도록 설계함으로써 보완될 수 있다.
API가 제공하는 화자 구분과 단어 수준 타임스탬프는 데이터 분석 파이프라인에 직접 연결하기에 유리한 구조를 만든다. 그러나 화자 구분 알고리즘은 화자 수가 많아지거나 음성 신호가 겹치는 경우 정확도가 떨어지는 경향이 있다. 이 점을 고려하면, 대규모 콜센터와 같이 다수의 화자가 동시에 발언하는 환경에서는 추가적인 후처리 절차가 필요하다. 후처리 단계에서 화자 라벨을 교정하거나, 타임스탬프 정밀도를 조정하는 방법을 도입하면 전체 시스템 신뢰성을 유지할 수 있다.
가격 구조가 단순하고 숨은 비용이 없다는 점은 예산 관리 측면에서 큰 장점이지만, 실제 사용량이 급증할 경우 비용 예측이 어려워질 수 있다. 특히 스트리밍 모드에서 실시간 전사를 지속적으로 이용하는 경우, 시간당 요금이 누적되어 예상보다 높은 비용이 발생할 위험이 있다. 따라서 기업은 사용량 모니터링 도구를 구축하고, 비용 한도를 설정한 알림 시스템을 도입해 비용 초과를 사전에 방지하는 전략을 수립해야 한다.
현재 32개 스트리밍 전사 모델 중 정밀도 1위를 차지한다는 평가는 독립적인 평가 기준이 명시되지 않아 해석에 주의가 필요하다. 리더보드에 포함된 모델들의 테스트 환경, 데이터 다양성, 평가 지표 가중치 등이 공개되지 않으면 실제 현장 적용 시 기대치와 차이가 발생할 가능성이 있다. 따라서 사용자는 자체 벤치마크를 수행하거나, 공개된 평가 방법론을 요구해 투명성을 확보하는 것이 바람직하다.
한국 기업이 Grok Voice Transcribe 2.0을 도입함으로써 얻을 수 있는 실질적 효과는 자동 회의록 작성 비용 절감과 실시간 자막 제공을 통한 접근성 향상이다. 그러나 이러한 효과를 최대로 실현하려면 기존 업무 흐름에 API 호출을 자동화하고, 전사 결과를 내부 시스템과 연동하는 엔드투엔드 파이프라인을 구축해야 한다. 또한, 다국어 회의에서 언어 전환이 빈번히 일어날 경우, 전사 정확도가 일정 수준 이하로 떨어지는 경우를 대비해 인간 검수 단계나 보조 번역 서비스를 병행하는 방안을 마련하는 것이 실용적이다.
주로 한국어를 사용하지만 다국어 고객이나 파트너와 교류하는 기업에게 Grok Voice Transcribe 2.0은 별도의 언어별 서비스를 호출할 필요 없이 혼합 언어 콘텐츠를 하나의 API로 처리할 수 있는 장점을 제공합니다. 짧은 구문에 대한 오류율 감소는 자동 회의록 작성, 규정 준수 로그, 실시간 자막 생성의 신뢰성을 높여 수동 편집 비용을 절감할 수 있습니다. 또한 기본 가격에 포함된 화자 구분과 타임스탬프는 분석 파이프라인과의 연동을 간소화해 콜 녹음 및 영상 회의에서 빠른 인사이트 도출을 가능하게 합니다.
출처
- Introducing Grok Voice Transcribe 2.0SpaceXAI · 2026년 9월 18일
- SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per HourMarkTechPost · 2026년 9월 18일



