Microsoft 推出 MAI‑Transcribe‑2‑Streaming 即時語音服務,支援 60 種語言,費用為每小時 0.54 美元
Microsoft AI 於 2026 年 10 月 1 日將 MAI‑Transcribe‑2‑Streaming 服務推向公開預覽,承諾在 100 毫秒內產生假設,持續偵測 60 種語言,並在基準測試中取得領先的錯誤率。

2026 年 10 月 1 日,Microsoft AI 宣布其 MAI‑Transcribe‑2‑Streaming 服務進入公開預覽階段。此服務定位為基於雲端的即時語音轉文字引擎,能夠處理六十種語言的音訊串流,並在音訊進行時提供部分與最終的轉錄結果。Microsoft 將此服務行銷為需要即時字幕、即時翻譯管線或語音驅動分析的開發者的低成本選項。簡言之,這是一種幾乎即時將語音轉換為文字的解決方案,降低了批次處理的需求,並方便在需要即時回應的應用中整合。
即時轉錄功能
串流轉錄與批次處理不同,因為模型在說話者仍在說話時就會輸出假設。MAI‑Transcribe‑2‑Streaming 宣稱在音訊樣本到達後約一百毫秒產生初始假設,隨後提供更精細的部分結果,最終交付帶有標點的完整轉錄。系統亦具備持續語言偵測功能,能在偵測到支援的六十種語言之間切換聲學模型與語言模型,從而免除單獨的語言選擇步驟。此即時語言切換能力使多語言應用能無縫運作,保持使用者體驗的流暢性。
開發者可以透過 Microsoft Foundry 存取此服務,Foundry 所提供的 Realtime API 採用與 OpenAI 串流端點相同的 WebSocket 模式。相同的功能也可透過 Azure Speech SDK 使用,使其能在 Windows、Linux、行動裝置與 Web 應用中以最少的程式碼變更進行整合。Microsoft 文件強調,API 接收原始音訊框架並回傳 JSON 編碼的轉錄片段,兼容現有的即時流水線。總之,該 API 旨在簡化整合過程,降低開發者在其解決方案中加入即時轉錄功能的工作量。
基準效能與準確率
獨立基準平台 Artificial Analysis 將 MAI‑Transcribe‑2‑Streaming 排在其串流詞錯誤率(WER)排行榜的首位,該排行榜比較了三十八個模型在共八小時的測試混音上的表現。根據該基準,模型在最終轉錄上達成了 2.5% 的 WER,平均延遲為 0.13 秒;在首次部分結果上同樣達成了 2.5% 的 WER,交付時間為 0.12 秒。MarkTechPost 報導了這些數據,並指出測試混音包含了多種說話者、口音與背景噪音,展示了模型在真實使用環境中的韌性。
Microsoft 自己的測量資料支撐了基準中的數字,公司提醒,Artificial Analysis 測試之外的速度聲明應視為內部估計。公開預覽不包含生產等級的服務等級協議(SLA),這意味著計畫關鍵任務部署的企業需要在自己的工作負載下評估可靠性與延遲後再決定是否付費使用。換言之,儘管基準結果令人印象深刻,Microsoft 建議企業使用者自行進行測試,以驗證在其特定條件下的效能。
定價、相關模型與預覽限制
在預覽期間,Microsoft 將每處理一小時音訊的入門價設定為 0.54 美元,該價格將持續至 2026 年底。預覽不提供正式的 SLA,且超出基準報告的使用量不作保證。除了轉錄服務,Microsoft 亦發布了 MAI‑Voice‑2.1 與 Voice‑2.1‑Flash,後者宣稱能在約 150 毫秒的端到端延遲下產生 45 秒的合成語音,費用為每百萬字元 15 美元。
Flash 模型針對低延遲語音生成情境,如互動式助理或即時配音,補充串流轉錄引擎,提供快速且高品質的語音輸出路徑。兩個模型均透過 Microsoft Foundry 的相同整合介面提供,開發者可以在同一 WebSocket 會話中串聯轉錄與合成,若有此需求。此緊密整合簡化了從音訊捕獲到文字生成,再到即時語音合成的完整工作流程建構。
- 支援 60 種語言並自動偵測
- 音訊接收後約 100 ms 產生初始假設
- 基準報告的最終轉錄 WER 為 2.5%,延遲 0.13 s
- 預覽期間每小時音訊 0.54 美元的入門價
- 透過 Microsoft Foundry Realtime API 與 Azure Speech SDK 存取
低延遲、多語言覆蓋以及透明的定價模式的組合,為開發即時字幕、多語言客服中心分析或即時翻譯服務的開發者開啟了新可能性。由於服務會串流輸出部分結果,應用可以在說話者結束前開始處理文字,從而縮短下游 AI 元件(如情感分析或意圖偵測)的端到端回應時間。適中的費用結構也降低了新創公司與研究團隊的進入門檻,這些團隊過去因每分鐘高額費用而迴避使用雲端轉錄服務。
對於在英語市場營運的組織而言,此次預覽意味著即時語音介面現在可以以往 Azure Speech 早期產品成本的一小部分部署,同時仍覆蓋廣泛的語言集合,滿足全球團隊的需求。企業可以嘗試為線上研討會提供即時字幕,將即時字幕整合到影片平台,或在語音驅動的客戶支援中加入即時轉錄,而無需在服務正式推出前簽署生產級 SLA。
資料來源
- Our first streaming transcription model debuts at no. 1 on Artificial AnalysisMicrosoft AI · 2026年10月1日
- Microsoft AI Releases MAI-Transcribe-2-StreamingMarkTechPost · 2026年10月2日



