SpaceXAIが多言語ストリーミング精度を向上させたGrok Voice Transcribe 2.0を発表
SpaceXAIは2026年9月18日、前バージョンの2倍の精度を同価格で提供し、19言語の自動言語検出に対応したGrok Voice Transcribe 2.0を公開しました。

2026年9月18日、SpaceXAIは音声認識API「grok-voice-transcribe-2.0」の一般提供開始を発表し、前モデルに比べて文字起こし精度が2倍に向上したことを強調しました。価格は従来と同じ時間単価です。
同社のベンチマークによると、短い多言語文に対する語彙誤り率(WER)は6.8%で、バージョン1.0の20.6%から大幅に改善されました。これは対象テストセットで約67%のエラー削減に相当し、19言語が混在する実世界の発話をシミュレートしています。
ベンチマーク結果と公開ランキング
SpaceXAIは、人工分析(Artificial Analysis)リーダーボードでGrok Voice Transcribe 2.0が32のストリーミング文字起こしモデル中で精度トップに位置していると報告しています。ランキングは独立した評価に基づくものですが、詳細な手法はプレスリリースで明らかにされていません。
ヘッドラインのWER改善に加え、電話会話、対話音声、指示文、短い多言語フレーズの4つの社内データセットでもエラーが一貫して減少しました。特に短フレーズでは、誤差が20.6%から6.8%へと劇的に低下しています。
技術的特徴とAPI機能
Grok Voice Transcribe 2.0はバッチモードとストリーミングモードの両方をサポートします。バッチモードではオフラインで音声ファイルを送信でき、ストリーミングモードではリアルタイムで文字起こしと単語レベルのタイムスタンプ、話者分離、最大8チャンネルの音声を処理します。これらはすべて基本料金(バッチ0.10ドル/時、ストリーミング0.20ドル/時)に含まれます。
モデルは自動で話された言語を検出し、録音中に言語が変わっても切り替えることができます。この機能は多言語会議やカスタマーサポートで、エージェントと顧客が言語を交互に使用するケースで特に有用です。
基本的な文字起こしに加えて、APIはフォーマット済みテキスト、100語の専門用語リストへのアクセント付与、話者分離を追加料金なしで返します。このパッケージ化された提供は、話者分離やタイムスタンプに別途料金を課す競合他社とは対照的です。
導入事例とエコシステム統合
Atlassianは既にGrok Voice Transcribe 2.0をLoom動画プラットフォームに統合し、録画会議やチュートリアルの字幕生成に利用しています。サービスはSpaceXAIがホスティングしており、オンプレミス向けのオープンウェイトモデルは提供されていません。
- バッチ文字起こし 0.10ドル/時
- ストリーミング文字起こし 0.20ドル/時
- 19言語の自動言語検出
- 話者分離と単語レベルタイムスタンプが標準装備
料金体系はシンプルで、処理した音声時間に対して従量課金され、追加機能に対する隠れた費用はありません。このシンプルさは、大規模な文字起こし作業を行う企業にとって予測可能なコストモデルを提供することを目的としています。
日本語主体の組織への影響
日本語を主に使用しつつ、多言語クライアントやパートナーとやり取りする組織にとって、Grok Voice Transcribe 2.0は単一のAPIで混在言語の音声を処理できる利点があります。短いフレーズでのエラー率低減は自動メモ取りやコンプライアンス記録、リアルタイム字幕の信頼性を向上させ、手作業の編集コスト削減につながります。また、話者分離とタイムスタンプが基本料金に含まれるため、分析パイプラインへの統合が容易となり、通話録音やビデオ会議からのインサイト抽出が迅速化します。
出典
- Introducing Grok Voice Transcribe 2.0SpaceXAI · 2026年9月18日
- SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per HourMarkTechPost · 2026年9月18日



