Kyutai 推出 Voice of Reason 系列模型,直接從語音推理數學
Kyutai 釋出兩款基於 GLM‑4‑Voice‑9B 的開放權重 Voice of Reason 模型,能在不經文字轉錄的情況下直接解答口語數學題,最高在 spoken GSM8K 基準上達到 77.1% 的正確率。

Kyutai 宣布推出兩款以語音為原生輸入的模型,統稱 Voice of Reason,這兩款模型專為直接在口語輸入上執行數學推理而設計,並且全部採用開放權重,衍生自已支援高品質語音生成與理解的 GLM‑4‑Voice‑9B 架構,讓研究者與開發者得以自由下載與微調。
在技術層面,Voice of Reason 的核心創新在於系統能夠直接處理原始音訊,無需先將語音轉成文字或呼叫獨立的語言模型。這條端到端管線不僅消除了在語音與推理之間加入轉錄步驟時常見的延遲與錯誤傳播,還降低了整體計算資源的需求,使得即時口語數學解答成為可能。
監督式訓練:重新構造的數學題目
在監督式訓練階段,Kyutai 使用了 150 616 題 Orca‑Math 問題,這些題目經過重新編寫以適合口語呈現,並以多種合成聲音合成。此資料集提供模型聽見數學語言時的聲音範例,讓模型同時學習聲學特徵與問題背後的邏輯結構,確保模型在聽取口語敘述時能正確捕捉關鍵數字與運算符號。
強化學習提升效能
完成監督式訓練後,團隊再以強化學習(RL)進一步提升推理能力。根據 MarkTechPost 的報導,基礎模型在 spoken GSM8K 基準上僅有 27.3% 的正確率,經過監督式訓練提升至 61.7%,而在最佳解碼設定下更可達到 77.1%。
2026 年 9 月 16 日發表於 arXiv 的預印本補充說明指出,當 RL 與持續推理結合時,模型在自由格式答案生成上可達到 74.8% 的精確度,顯示其能產出完整、逐步的口語解題過程,而非僅給出最終答案的單一標記,這對於需要透明推理步驟的教育應用尤為重要。
兩種部署變體
Kyuti 提供兩個 checkpoint 變體,皆以 BF16 精度儲存。「direct」版本會持續說出推理過程,讓使用者即時聽到每一步的計算與判斷;「Stitch」版本則在語音段落之間插入 100 個 token 的靜默區塊,為下游系統提供可預測的暫停點,方便串流轉錄或與視覺顯示同步,提升多模態應用的靈活性。
這兩個 checkpoint 均可在單顆 NVIDIA H100 GPU 上進行推論,推理延遲維持在可接受的即時範圍;而模型的訓練則需 16 顆 H100 GPU 叢集以及 1 500 次強化學習更新,顯示為達到上述效能所投入的計算資源相當可觀,亦說明了模型背後的研發規模。
權衡與局限
將模型專門化於口語數學會帶來代價。於語音版 TriviaQA 基準測試時,正確率從 40.6% 下降至 34%,顯示模型在一般知識問答上的表現會因資源被轉向數學推理而受損,這是一個需要在未來版本中平衡的挑戰。
此外,評估方法混合了人工評審與合成資料,限制了結果的普遍適用性。作者承認仍需在更多元、真實世界的口語資料上進行測試,才能確認模型在各領域的穩健性,尤其是在不同口音與噪聲環境下的表現。
- 端到端語音處理消除轉錄錯誤
- 強化學習將口語數學正確率提升至超過 75%
- 兩種變體支援持續或暫停的口語推理
- 單卡 GPU 推論讓企業部署更具可行性
對於使用中文的教育科技、智慧教學與語音優先分析平台而言,這項技術可直接理解並解答口頭敘述的數學問題,免除額外的語音轉文字與文字解題流程,從而縮短延遲、保留自然的口語說明流程,提升教學與分析效率。
本報導於台北發佈,未來 Kyutai 計畫持續擴充模型的語言與領域覆蓋,期望在多語言口語推理與跨領域知識整合上取得更大突破。
資料來源
- Kyutai Releases Voice of Reason: A Speech-Native Model that Solves Spoken MathMarkTechPost · 2026年9月23日
- Voice of Reason: Reinforcement Learning for Spoken MatharXiv · 2026年9月16日



