Sarvam AIがSaaras V4を発表、22言語と英語に対応した多言語音声認識モデルを提供
Sarvam AIは2026年8月24日にSaaras V4を発表し、22のインド公用語と英語に対応し、5つの組み込み文字起こしモードと最先端の誤認識率を実現しました。

2026年8月24日、Sarvam AIは音声認識プラットフォームの最新バージョンであるSaaras V4を公開しました。この発表は、22の公式に認められたインド語と英語を単一システムでカバーするという、商用音声エンジンでは稀な範囲を実現したことを強調しています。
Sarvam AIが提供した技術説明によると、Saaras V4は専用のオーディオエンコーダとハイブリッド状態空間大型言語モデル(LLM)デコーダを組み合わせた構成です。デコーダは30億パラメータを有し、すべて社内で学習されました。そのため、データパイプライン、モデルアーキテクチャ、最適化手法のすべてを完全にコントロールできる点が特徴です。
統合された文字起こしモードで後処理を不要に
Saaras V4の顕著な特徴は、エンジン内部に5つの文字起こしモード(transcribe、verbatim、codemix、translit、translate)を直接組み込んでいる点です。これにより、従来は別途実施していた後処理工程が不要となり、アラインメントエラーやフォーマット不一致、言語識別ミスといった問題が大幅に削減されます。
transcribeモードは一般的な用途に適した、句読点付きのクリーンなテキストを出力します。verbatimはすべての間投詞、ためらい音、非語彙音を保持し、法務や医療記録に有用です。codemixは単一発話内で複数言語が混在するインド特有のマルチリンガルパターンを処理します。translitは話された内容を指定された文字体系に変換し、translateは元の発話を英語に翻訳して、外部翻訳パイプラインなしでクロスランゲージアクセシビリティを提供します。
性能主張と外部検証の限界
Sarvam AIは、Saaras V4が22のインド語すべてと、グローバルアクセントやインド英語変種を含む7つの英語ベンチマークで、報告されている中で最も低い語彙誤認識率(WER)を達成したと主張しています。しかし、これらの数値は内部ベンチマークに基づくもので、独立した再現研究や第三者監査の結果はまだ公開されていません。
外部検証が欠如しているため、組織は報告されたWERを暫定的な指標として扱う必要があります。内部テストは制御された条件下での高性能を示すことができますが、実際の導入では音響環境、話者属性、方言変種がトレーニングコーパスと異なることが多く、性能差が生じる可能性があります。ピアレビューされた評価が出るまで、競合システムに対する正確な改善幅は不明です。
ノイズ、コードミックス、方言へのロバスト性
Sarvam AIの内部テストによれば、Saaras V4はノイズが多い録音でも堅牢に動作し、コードミックス音声や方言の変化にも適応できるとされています。特に、最も話者数が多い10言語での言語識別エラー率は2.9%、全22言語でのエラー率は5.22%と報告され、単一文中で言語が切り替わる場合でも正確に言語を検出できることが示唆されています。
これらのロバスト性主張は、背景ノイズや混合言語入力をシミュレートした内部評価プロトコルに基づいていますが、公開データセットや再現可能なスクリプトは提供されていません。そのため、外部研究者が悪条件下での耐性を検証することは現時点で困難です。
ストリーミング遅延と導入上の考慮点
Saaras V4は低遅延ストリーミングをサポートすると宣伝されています。ドキュメントでは、最初のトークンが出力されるまでの時間が150ミリ秒未満、さらにマルチ分録音をリアルタイムで1秒の音声につき1秒の計算時間で処理できると記載されています。これらの指標は、リアルタイム文字起こしサービス、コールセンター分析、ライブキャプションなどにとって重要です。
しかし、自己ホスティングガイドは現在バージョン3までしかカバーしておらず、バージョン4のオンプレミス導入手順が欠如しています。データプライバシー規制やネットワーク制約でローカル展開が必要な組織にとっては、ガイドの不在が大きな障壁となります。顧客は、Sarvam AIのマネージドクラウドサービスを利用せざるを得ない可能性があります。
- 30億パラメータのハイブリッド状態空間LLMデコーダ
- 5つの組み込み文字起こしモード(transcribe、verbatim、codemix、translit、translate)
- 言語識別エラー率:上位10言語で2.9%、全22言語で5.22%
- ストリーミング遅延:最初のトークン <150 ms、処理速度 1×リアルタイム
価格は透明で階層化されています。Sarvam AIはリアルタイムまたはバッチ文字起こしに対し1時間あたり30インドルピー、スピーカーダイアリゼーションを追加すると45インドルピーと提示しています。これらはホストサービス利用時の料金で、モデル自体の重みはオープンソースとして公開されておらず、直接の改変や再配布はできません。
モデル重みがクローズドソースであることは、組織がバイアス、セキュリティ脆弱性、ローカル規制への適合性を監査できないことを意味します。価格体系はシンプルですが、モデルの透明性欠如は、透明性を重視する調達決定に影響を与える可能性があります。
実務的観点から、Saaras V4を導入しようとする企業は、統合された多言語機能の利点と、外部検証やオンプレミス導入に関する不確実性を比較検討する必要があります。コードミックスや方言変種への対応は、インド市場の言語実態に合致しており、複数の専門エンジンを用意する必要性を低減できる可能性があります。
それでも、組織は自社の音声コーパスでのパイロットテスト、ネットワーク環境での遅延測定、対象方言に対する言語識別精度の評価を含む検証フェーズを計画すべきです。こうした試験により、Sarvam AIが内部で報告したベンチマークと実運用で観測される性能との差異を明らかにできます。
要約すると、Saaras V4はSarvam AIにとって技術的に重要なステップであり、広範なインド語と英語に対し統一されたソリューションと複数の文字起こしオプション、低遅延ストリーミングを提供します。内部主張は魅力的ですが、独立した検証がなく、導入ドキュメントが限定的である点はリスク要因です。導入組織は徹底した内部テストを実施し、クローズドソースモデルの影響を検討し、自己ホスティングガイドの更新を注視した上で、大規模かつミッションクリティカルな展開を決定すべきです。
出典
- Introducing Saaras V4 - Sarvam AISarvam AI · 2026年9月25日
- Sarvam AI Releases Saaras V4: A Speech-to-Text Model for All 22 Indian Languages and Global English - MarkTechPostMarkTechPost · 2026年9月26日



