Microsoft、リアルタイム音声認識サービス「MAI‑Transcribe‑2‑Streaming」を60言語対応で時給0.54ドルで提供開始
Microsoft AIは2026年10月1日にMAI‑Transcribe‑2‑Streamingサービスをパブリックプレビューに投入し、100ミリ秒未満の仮説生成、60言語にわたる継続的言語検出、ベンチマークでトップクラスの誤り率を約束しました。

2026年10月1日、Microsoft AIはMAI‑Transcribe‑2‑Streamingサービスがパブリックプレビューに入ったことを発表しました。この発表は、同サービスがクラウドベースのリアルタイム音声からテキストへのエンジンとして提供され、60言語の音声ストリームを処理し、音声が進行するにつれて部分的および最終的な文字起こしを提供できることを示しています。Microsoftは、このサービスを即時字幕、ライブ翻訳パイプライン、音声駆動型分析を必要とする開発者向けの低コストオプションとして市場に位置付けています。
リアルタイム文字起こし機能
ストリーミング文字起こしは、バッチ処理とは異なり、話者が話し続けている間にモデルが仮説を出力します。MAI‑Transcribe‑2‑Streamingは、音声サンプルが到着してから約100ミリ秒後に初期仮説を生成し、その後に洗練された部分結果と句読点を含む最終文字起こしを提供すると主張しています。このシステムは継続的言語検出も行い、サポートされている60言語の中で言語が変わったことを検知すると自動的に音響モデルと語彙モデルを切り替え、別途言語選択ステップを必要としません。
開発者はMicrosoft Foundryを通じてこのサービスにアクセスでき、Realtime APIはOpenAIのストリーミングエンドポイントで使用されるWebSocketパターンを鏡像しています。同様の機能はAzure Speech SDKでも利用可能で、Windows、Linux、モバイル、Webアプリケーションへの統合が最小限のコード変更で実現できます。Microsoftのドキュメントは、APIが生音声フレームを受け取り、JSON形式で文字起こしの断片を返すことを強調しており、既存のリアルタイムパイプラインと互換性があると述べています。
ベンチマーク性能と精度
独立したベンチマークプラットフォームであるArtificial Analysisは、MAI‑Transcribe‑2‑Streamingをストリーミング単語誤り率(WER)リーダーボードのトップに配置しました。この評価は、共通の8時間テストミックス上で38モデルを比較したものです。ベンチマークによれば、最終文字起こしで2.5%のWERを達成し、平均レイテンシは0.13秒、最初の部分結果でも同じ2.5%のWERで0.12秒で提供されたと報告されています。MarkTechPostは、テストミックスにさまざまな話者、アクセント、背景ノイズが含まれていたことを指摘しながら、これらの数値を報じました。
Microsoft自身の測定がベンチマーク数値の根拠となっており、Artificial Analysisテスト以外での速度主張は内部推定として扱うよう同社は注意喚起しています。パブリックプレビューには本番向けのサービスレベルアグリーメント(SLA)は含まれておらず、ミッションクリティカルな導入を検討する企業は、支払階層に移行する前に自社のワークロード下で信頼性とレイテンシを評価する必要があります。
価格、関連モデルおよびプレビュー制限
プレビュー期間中、Microsoftは処理された音声1時間あたり54セントという導入価格を設定しました。この料金は2026年末まで有効です。プレビューには正式なSLAがなく、発表されたベンチマーク数値を超える利用は保証されません。文字起こしサービスに加えて、MicrosoftはMAI‑Voice‑2.1とVoice‑2.1‑Flashもリリースしました。後者は、約150ミリ秒のエンドツーエンドレイテンシで45秒の合成音声を生成でき、1百万文字あたり15ドルのコストがかかると広告されています。
Flashモデルは、インタラクティブアシスタントやリアルタイム吹き替えなど、低レイテンシ音声生成シナリオを対象としており、ストリーミング文字起こしエンジンを補完し、高品質な音声出力パスを高速に提供します。両モデルはMicrosoft Foundryを通じて同一の統合インターフェースを共有しており、開発者は必要に応じて単一のWebSocketセッションで文字起こしと合成を連結させることが可能です。
- 自動検出で60言語をサポート
- 音声受信後約100 msで初期仮説を生成
- ベンチマークで0.13 sレイテンシで2.5 % WER(最終結果)
- プレビュー期間中は音声1時間あたり$0.54の導入価格
- Microsoft Foundry Realtime APIとAzure Speech SDKでアクセス可能
低レイテンシ、多言語対応、透明な価格モデルの組み合わせは、ライブ字幕、多言語コールセンター分析、リアルタイム翻訳サービスを構築する開発者に新たな可能性を提供します。サービスが部分結果をストリーミングするため、アプリケーションは話者が話し終える前にテキスト処理を開始でき、感情分析や意図検出といった下流AIコンポーネントのエンドツーエンド応答時間を短縮します。手頃なコスト構造は、以前は高い分単位料金のためにクラウド文字起こしを避けていたスタートアップや研究チームの参入障壁も下げます。
英語圏市場で事業を展開する組織にとって、このプレビューは、従来のAzure Speech提供よりもはるかに低コストでリアルタイム音声インターフェースを導入できることを意味します。企業はウェビナーのライブ字幕を試験したり、動画プラットフォームに即時字幕を統合したり、音声駆動型カスタマーサポートにリアルタイム文字起こしを組み込んだりでき、サービスがプレビューから本番へ移行するまでに本格的なSLAにコミットする必要はありません。
出典
- Our first streaming transcription model debuts at no. 1 on Artificial AnalysisMicrosoft AI · 2026年10月1日
- Microsoft AI Releases MAI-Transcribe-2-StreamingMarkTechPost · 2026年10月2日



