Kyutaiが「Voice of Reason」モデルを発表、音声から直接数学推論を実現
Kyutaiは、GLM‑4‑Voice‑9Bを基盤としたオープンウェイトの「Voice of Reason」モデルを2種リリースし、音声だけで数学問題を解き、音声GSM8Kで最大77.1%の正解率を達成した。

Kyutaiは、音声入力から直接数学的推論を行うことを目的とした2つのスピーチネイティブモデル「Voice of Reason」を発表した。両モデルはオープンウェイトで、すでに高品質な音声生成と理解を提供するGLM‑4‑Voice‑9Bアーキテクチャを元にしている。
技術的な主なイノベーションは、音声をテキストに変換したり別個の言語モデルを呼び出したりせず、生の音声データをそのまま処理する点にある。このエンドツーエンドのパイプラインにより、音声と推論の間に転写ステップを挟むことで生じる遅延やエラー伝搬が排除される。
音声向けに再構成した数学問題での教師あり学習
教師あり学習のため、Kyutaiは150 616件のOrca‑Math問題を音声向けに再構成し、さまざまな合成音声で合成したデータセットを使用した。このデータは、数学的言語が話されたときの音響パターンと論理構造の両方をモデルに学習させることを可能にする。
強化学習で性能向上
教師ありフェーズの後、チームは強化学習(RL)を適用して推論能力を高めた。音声GSM8Kベンチマークでは、MarkTechPostの報告によれば、ベースモデルは27.3%の正解率だったが、教師あり学習後は61.7%に上昇し、最適なデコード設定を適用すると77.1%に達した。
2026年9月16日に公開されたarXivのプレプリントでは、RLと継続的推論を組み合わせた場合、自由形式の回答生成で74.8%の完全解答率を示したと付記されている。これは、最終的な答えトークンだけでなく、段階的な口頭解答を生成できることを示す。
2つのデプロイバリアント
Kyutaiは、BF16精度で保存された2つのチェックポイントバリアントを提供する。「direct」バージョンは推論を連続的に語り続ける一方、「Stitch」バージョンは音声セグメント間に100トークン分の無音ブロックを挿入する。無音ブロックは下流システムに予測可能なポーズを提供し、ストリーミング転写や映像表示との同期を容易にする。
両チェックポイントは、Kyutaiチームによれば、単一のNVIDIA H100 GPUで推論可能である。訓練には16台のH100 GPUクラスターと1 500回の強化学習アップデートが必要で、報告された性能を得るためにかなりの計算リソースが投入されたことが示唆される。
トレードオフと制限事項
音声数学に特化させた代償として、Vocal TriviaQAベンチマークでの評価は40.6%から34%へと低下し、一般知識質問への回答能力が数学推論にリソースを振り向けたことで低下していることが示された。
さらに、評価手法は人間評価者と合成データを組み合わせているため、結果の汎用性には限界がある。著者らは、実世界の多様な音声データセットでの追加テストが必要であると認めている。
- エンドツーエンド音声処理で転写エラーを排除
- 強化学習で音声数学の正解率を75%超に向上
- 連続または一時停止の2種バリアントで柔軟な推論
- 単一GPUでの推論が多くの企業に導入しやすい
日本の教育テック企業やオンラインチュータリングサービスにとって、音声だけで数学問題を理解し解くことができるツールは、音声認識とテキストベースのソルバーを別々に用意する必要がなくなるため、レイテンシ削減と自然な説明フローの維持に大きなメリットをもたらす。
出典
- Kyutai Releases Voice of Reason: A Speech-Native Model that Solves Spoken MathMarkTechPost · 2026年9月23日
- Voice of Reason: Reinforcement Learning for Spoken MatharXiv · 2026年9月16日



