Sarvam AI, 22개 인도 언어와 영어를 지원하는 다중언어 음성인식 모델 Saaras V4 출시
Sarvam AI는 2026년 8월 24일에 22개 인도 언어와 영어를 지원하고, 5가지 내장 전사 모드를 제공하며 최첨단 단어 오류율을 주장하는 Saaras V4를 발표했습니다.

2026년 8월 24일, Sarvam AI는 최신 음성인식 플랫폼인 Saaras V4를 공개했습니다. 이번 발표는 22개의 공식 인도 언어와 영어를 하나의 시스템으로 지원한다는 점에서 상업용 음성 엔진 중 드물게 포괄적인 범위를 제시했습니다.
Sarvam AI가 제공한 기술 설명에 따르면, Saaras V4는 전용 오디오 인코더와 하이브리드 상태공간 대형 언어 모델(LLM) 디코더를 결합한 구조를 가지고 있습니다. 디코더는 30억 개의 파라미터를 포함하고 전적으로 사내에서 학습했으며, 이를 통해 데이터 파이프라인, 모델 아키텍처 및 최적화 절차에 대한 완전한 통제권을 유지하고 있습니다.
통합 전사 모드로 후처리 단계 제거
Saaras V4의 눈에 띄는 특징은 엔진 내에 다섯 가지 전사 모드를 직접 포함한다는 점입니다: transcribe, verbatim, codemix, translit, translate. 이러한 기능을 내장함으로써 전통적으로 정렬 오류, 형식 불일치, 언어 식별 실수를 초래하던 별도 후처리 단계가 필요하지 않게 됩니다.
transcribe 모드는 일반적인 응용에 적합한 깔끔하고 구두점이 포함된 텍스트를 제공합니다. verbatim 모드는 모든 filler, hesitation, 비언어적 소리를 그대로 보존해 법률·의료 기록에 유용합니다. codemix는 하나의 발화 안에 여러 언어가 혼합된 말을 처리하며, 이는 인도 다언어 환경에서 흔히 나타나는 패턴입니다. translit은 구어 내용을 목표 스크립트로 변환하고, translate는 원본 발화를 영어로 번역해 외부 번역 파이프라인 없이도 다언어 접근성을 제공합니다.
성능 주장 및 외부 검증 제한
Sarvam AI는 Saaras V4가 22개 인도 언어와 7개의 영어 벤치마크(전 세계 억양 및 인도 영어 변형 포함)에서 보고된 최저 단어 오류율(WER)을 달성했다고 주장합니다. 이 수치는 내부 벤치마크 기반이며, 아직 독립적인 복제 연구나 제3자 감시 결과는 공개되지 않았습니다.
외부 검증이 부재한 상황에서는 조직이 보고된 WER 수치를 잠정적인 것으로 간주해야 합니다. 내부 테스트는 통제된 조건에서 강력한 성능을 보여줄 수 있지만, 실제 현장에서는 음향 환경, 화자 인구통계, 방언 변이가 학습 코퍼스와 다를 수 있습니다. 동료 검토 평가가 나오기 전까지 경쟁 시스템 대비 정확한 개선 폭은 불확실합니다.
소음, 코드믹스 및 방언에 대한 견고성
Sarvam AI 내부 테스트에 따르면, Saaras V4는 소음이 섞인 녹음에서도 견고성을 유지하고, 코드믹스된 음성을 처리하며, 방언 변화에 적응합니다. 회사는 상위 10개 언어에 대해 2.9%의 언어 식별 오류율, 전체 22개 언어에 대해 5.22%의 오류율을 보고했습니다. 이는 화자가 한 문장 안에서 언어를 전환하더라도 모델이 발화 언어를 신뢰성 있게 감지할 수 있음을 시사합니다.
이러한 견고성 주장은 배경 소음과 혼합 언어 입력을 시뮬레이션한 내부 평가 프로토콜에 기반합니다. 공개 데이터셋이나 재현 가능한 스크립트가 제공되지 않아 외부 연구자가 악조건 음향에 대한 모델의 내성을 확인하기는 어렵습니다.
스트리밍 지연 및 배포 고려사항
Saaras V4는 저지연 스트리밍을 지원한다고 광고됩니다. 문서에 따르면 첫 토큰까지의 시간은 150밀리초 미만이며, 엔진은 1초의 오디오를 1초의 연산 시간으로 처리합니다. 이러한 메트릭은 실시간 전사 서비스, 콜센터 분석, 라이브 캡션 등에 중요합니다.
하지만 현재 자체 호스팅 가이드는 버전 3만을 다루고 있어, 버전 4에 대한 온프레미스 문서가 부족합니다. 이는 데이터 프라이버시 규정이나 네트워크 제약으로 현지 배포가 필요한 조직에 장벽이 될 수 있습니다. 고객은 v4 배포 가이드가 공개될 때까지 Sarvam AI의 관리형 클라우드 서비스를 이용해야 할 가능성이 높습니다.
- 30억 파라미터 하이브리드 상태공간 LLM 디코더
- 5가지 내장 전사 모드 (transcribe, verbatim, codemix, translit, translate)
- 언어 식별 오류율: 상위 10개 언어 2.9%, 전체 22개 언어 5.22%
- 스트리밍 지연: 첫 토큰 <150 ms, 실시간 처리 속도 1×
가격 정책은 투명하고 단계별로 제시됩니다. Sarvam AI는 실시간 또는 배치 전사에 대해 시간당 30 ₹, 화자 구분을 추가하면 45 ₹를 부과합니다. 이 요금은 호스팅 서비스 이용에만 적용되며, 모델 가중치는 오픈소스로 제공되지 않아 직접 수정·재배포가 불가능합니다.
모델 가중치가 폐쇄형이라는 점은 조직이 편향, 보안 취약점, 현지 규정 준수 여부 등을 직접 감사할 수 없음을 의미합니다. 가격 구조는 단순하지만, 투명성을 중시하는 기관에서는 모델 개방성 부족이 구매 결정에 영향을 미칠 수 있습니다.
실무적인 관점에서 Saaras V4 도입을 검토하는 기업은 통합된 다언어 기능의 장점과 외부 검증·온프레미스 배포와 관련된 불확실성을 비교해야 합니다. 코드믹스와 방언 변이를 처리하는 모델의 능력은 인도 시장의 언어 현실과 부합해 다수의 전문 엔진을 별도로 운영할 필요성을 줄일 수 있습니다.
그럼에도 조직은 자체 음성 데이터셋을 활용한 파일럿 테스트, 네트워크 환경에서의 지연 측정, 특정 방언에 대한 언어 식별 정확도 평가 등을 포함하는 검증 단계를 계획해야 합니다. 이러한 시험을 통해 Sarvam AI가 보고한 내부 벤치마크와 실제 운영 환경에서의 성능 차이를 확인할 수 있습니다.
요약하면, Saaras V4는 Sarvam AI에게 기술적으로 중요한 도약을 의미합니다. 22개 인도 언어와 영어를 포괄하고 여러 전사 옵션 및 저지연 스트리밍을 제공하는 통합 솔루션을 선보였습니다. 회사가 주장하는 최첨단 정확도와 견고성은 기대감을 주지만, 독립적인 검증 부재와 제한된 온프레미스 문서는 실질적인 위험 요소로 작용합니다. 따라서 조직은 철저한 내부 테스트를 수행하고 폐쇄형 모델의 함의를 고려하며, 자체 호스팅 가이드가 업데이트될 때까지 대규모 핵심 서비스에 도입하기 전에 신중히 판단해야 합니다.
출처
- Introducing Saaras V4 - Sarvam AISarvam AI · 2026년 9월 25일
- Sarvam AI Releases Saaras V4: A Speech-to-Text Model for All 22 Indian Languages and Global English - MarkTechPostMarkTechPost · 2026년 9월 26일



