Meta推出Muse Voice Transcribe即時語音轉錄模型
Meta Superintelligence Labs發布Muse Voice Transcribe,單一模型即可完成語音轉錄、區分最多20位說話者並即時偵測停頓,現已上線API並整合進Mac版Meta AI。

Meta Superintelligence Labs於2026年9月1日發布Muse Voice Transcribe,這是該公司首款即時音訊感知模型。該系統能夠轉錄語音、在同一段錄音中辨識20位以上不同的說話者,並精準偵測一個人何時停止說話——這三項任務過去需要三套獨立系統分別完成:一套負責轉錄,一套負責語者分離(diarization),第三套則判斷發言回合的結束,三者串接會帶來延遲與額外的出錯環節。該模型現已透過Meta的API上線,型號為muse-voice-transcribe-1.0,並已為Mac版Meta AI應用程式與該公司的程式設計助理Muse Code提供語音聽寫功能。Meta並未公開模型權重,因此只能以託管服務的形式使用,無法部署在自有伺服器上。
運作原理:在同一個迴圈中邊聽邊寫
Muse Voice Transcribe屬於Muse Spark系列,以80毫秒為單位處理音訊,即每秒處理12.5個音訊區塊。每個區塊會被轉換成一個詞元(token),模型在同一個解碼器內以自迴歸方式進行分析,這個解碼器同時也負責產生文字——聽到的內容與寫出的文字之間不存在獨立的對齊步驟,而這正是傳統流程最容易失去同步的環節。每處理完一個音訊區塊,模型都要做出二選一的判斷:要麼預測一個提示「繼續聆聽」的詞元,要麼直接輸出一個詞。當音訊串流結束時,一個特殊詞元會告訴模型不會再有新的輸入,模型隨即立刻釋放所有待輸出的文字——Meta將這種行為稱為「彈性聆聽」,並同樣用它來判斷每個時刻是誰在說話。
被訓練出來的延遲,而非事先設定
模型在寫出一個詞之前會等待多長的音訊——Meta稱之為「延遲」——並非固定值:累積的上下文越多,轉錄就越準確,但等待時間也隨之增加。Meta的工程師沒有以人工方式設定這種取捨,而是透過強化學習訓練:將轉錄準確度獎勵(詞錯誤率)與速度獎勵以相乘方式結合,讓模型自行學會依每個詞的難度動態調整延遲。為了辨識說話者,系統並未使用另一個獨立模型,而是在同一資料流中加入特殊詞元:一個詞元在說話者可能切換時立即標記,另一個則略為延遲,為說話者標上A到Z的標籤;同一個人的音訊可能被拆分到多個片段,但這些片段最終都會對應到同一個標籤。另外兩個詞元分別標記一段發言的起點與終點,供判斷回合結束的偵測器使用,這三項任務都在同一個轉錄基礎獎勵之上共同訓練。
結果領先Cartesia、ElevenLabs與Gemini
- 在Artificial Analysis AA-WER Streaming基準測試中,最終轉錄的詞錯誤率為3.1%,於語音結束後0.16秒內完成——優於Cartesia Ink-2(3.4%,0.43秒)與ElevenLabs Scribe v2 Realtime(3.6%,0.14秒)。
- 首次部分轉錄的錯誤率為3.6%,僅需0.13秒;採用外部端點的Cartesia Ink-2版本速度較快(0.07秒),但準確率較低(4.0%)。
- 在AMI-IHM、AMI-SDM與VoxConverse測試中,平均語者分離錯誤率為17.5%,其餘五套受測系統的錯誤率則介於21.1%至28.6%之間。
- 支援超過一小時的錄音與20人以上同時發言,無需額外後製處理;透過調整語言、關鍵字與上下文偏置,準確率還能進一步提升。
- 定價為每處理1,000分鐘音訊3美元(約每小時0.18美元),低於Cartesia Ink-2的4美元,也不到ElevenLabs Scribe v2 Realtime與Deepgram Flux每小時6.5美元的一半。
該模型以超過70種語言訓練,其中25種在發布前經過全面驗證,並能在一句話中途自然切換語言而不損失準確率,這在雙語使用者身上相當常見。Meta於2026年9月1日透過其在X上的@AIatMeta帳號宣布此發布,稱其為公司首款即時感知模型——這項發布搶在OpenAI或Google推出同類即時轉錄系統之前。已在Mac上安裝Meta AI應用程式的使用者現在就能體驗:只需按住Fn鍵,在任何應用程式中說話,聽寫內容便會由新模型進行轉錄。
對於經常錄製會議、記者會或多人同時發言採訪的臺灣企業與專業人士——記者、律師事務所、客服團隊、面向聽障人士的無障礙服務——而言,一款能在單次處理中完成轉錄、分離說話者並偵測停頓的模型,能降低基礎設施成本,並減少串接多套工具所帶來的出錯機率。但代價是必須接受該模型只能透過Meta的API使用,既無法自行部署於本地伺服器,也無法稽核其模型權重。在替換已投入正式環境的轉錄流程之前,值得先針對團隊實際使用的語言與口音核實真實錯誤率,因為在超過70種受支援語言中,只有25種經過全面驗證。
資料來源
- Meta Superintelligence Labs Releases Muse Voice Transcribe: One Real-Time Model for Streaming ASR, Diarization, and EndpointingMarkTechPost · 2026年9月1日
- Meta lanza Muse Voice Transcribe, su IA de transcripción en vivoHipertextual · 2026年9月1日


