Kyutai 推出 Voice of Reason 语音模型,实现直接口算数学推理
Kyutai 发布两款基于 GLM‑4‑Voice‑9B 的开源 Voice of Reason 模型,可在不进行文字转写的情况下直接解答口述数学题,口述 GSM8K 的最高准确率达到 77.1%。

Kyutai 最近正式发布了两款以语音为原生输入的模型,统一称为 Voice of Reason,目标是直接对口述的数学问题进行推理计算。两款模型均采用开源权重,基于已经具备高质量语音生成与理解能力的 GLM‑4‑Voice‑9B 架构,实现了从声音到答案的完整闭环。
该系列的核心技术创新在于系统能够直接处理原始音频信号,无需先进行文字转写或调用独立的语言模型。端到端的流水线设计消除了在语音与推理之间插入转写步骤时常见的延迟和错误传播,从而提升了整体响应速度和答案的可靠性。
监督训练:重新表述的数学题目
在监督训练阶段,Kyutai 采用了 150 616 条 Orca‑Math 题目,这些题目经过重新表述以适合口头呈现,并使用多种合成声音进行配音。该数据集为模型提供了大量数学语言的口语化示例,使其能够学习声学模式以及问题背后的逻辑结构。
强化学习提升性能
完成监督训练后,团队进一步采用强化学习(RL)来提升模型的推理能力。根据 MarkTechPost 的报道,在口述 GSM8K 基准测试中,基础模型的准确率为 27.3%,经过监督训练提升至 61.7%,在最佳解码配置下更是达到了 77.1%。
2026 年 9 月 16 日发布的 arXiv 预印本补充说明指出,当强化学习与连续推理相结合时,模型在自由形式答案生成上的精确率可达 74.8%。这一指标表明模型能够生成完整、逐步的口头解答,而不仅仅是输出最终答案的标记。
两种部署变体
Kyutai 为用户提供了两种检查点变体,均采用 BF16 精度进行存储。所谓 “direct” 版本会持续输出推理过程的语音,而 “Stitch” 版本则在语音片段之间插入 100 token 长的静默块,为下游系统提供可预测的暂停,便于流式转写或与视觉显示同步。
团队进一步说明,这两种检查点均可在单块 NVIDIA H100 GPU 上完成推理。然而模型的训练过程需要 16 块 H100 GPU 组成的集群,并进行 1 500 次强化学习更新,凸显出实现该性能水平所需的巨大计算投入。
权衡与局限
专注于口述数学推理会带来一定代价。对声学版 TriviaQA 基准的评估显示,模型的准确率从 40.6% 下降至 34%,表明当模型容量被用于数学推理时,其在通用知识问答方面的能力会出现削弱。
此外,评估方法混合了人工评审与合成数据,这限制了结果的普适性。作者承认,需要在更丰富、真实的口述数据集上进一步测试,才能将模型视为在各领域都具备鲁棒性。
- 端到端语音处理消除转写错误
- 强化学习将口算准确率提升至 75% 以上
- 两种变体支持连续或间歇式口头推理
- 单 GPU 推理让多数企业部署成为可能
对于中国的教育科技企业和在线辅导平台而言,这项技术可以直接理解并解答口头数学问题,无需额外的语音转文字和文本求解模块,从而显著降低响应时延,保持教学讲解的自然流畅。
在实际落地时,国内的教育机构可以将 Voice of Reason 集成到已有的智能课堂系统,通过单卡 H100 部署实现实时口算辅导,帮助学生在口头提问后立即获得逐步解析,提升学习体验并降低教师的工作负担。
信息来源
- Kyutai Releases Voice of Reason: A Speech-Native Model that Solves Spoken MathMarkTechPost · 2026年9月23日
- Voice of Reason: Reinforcement Learning for Spoken MatharXiv · 2026年9月16日



