Kyutai lança modelos Voz da Razão para raciocínio matemático direto da fala
Kyutai divulgou dois modelos abertos Voz da Razão, baseados no GLM‑4‑Voice‑9B, que resolvem problemas matemáticos falados sem transcrição intermediária, atingindo até 77,1% de acurácia no GSM8K falado.

A Kyutai divulgou oficialmente dois novos modelos de inteligência artificial, agrupados sob o nome coletivo Voz da Razão, com a proposta de executar raciocínio matemático a partir de áudio falado, sem precisar de nenhuma etapa intermediária de transcrição textual. Ambos os modelos são de código aberto, derivam da arquitetura GLM‑4‑Voice‑9B e mantêm a qualidade de geração e compreensão de fala que já era reconhecida na versão base.
A principal inovação técnica reside no fato de que o sistema aceita o sinal de áudio bruto e o processa diretamente, eliminando a necessidade de um modelo de reconhecimento automático de fala separado. Essa abordagem ponta‑a‑ponta reduz consideravelmente a latência total do pipeline e evita a propagação de erros que costumam surgir quando a transcrição textual introduz imprecisões que comprometem o raciocínio posterior.
Treinamento supervisionado com problemas matemáticos reformulados
Para constituir o corpus de treinamento supervisionado, a equipe da Kyutai converteu 150 616 questões do benchmark Orca‑Math em versões faladas, utilizando múltiplas vozes sintéticas para garantir diversidade de timbre e entonação. Cada problema foi reescrito para que a linguagem matemática fosse pronunciada de forma natural, permitindo que o modelo aprendesse simultaneamente os padrões acústicos da fala e a estrutura lógica subjacente das questões.
Aprendizado por reforço eleva o desempenho
Depois de concluir a fase supervisionada, os pesquisadores aplicaram aprendizado por reforço (RL) para refinar ainda mais as habilidades de raciocínio. No benchmark GSM8K falado, o MarkTechPost registrou que o modelo base atingiu 27,3 % de acurácia; após o treinamento supervisionado, a taxa subiu para 61,7 %; e, com a melhor configuração de decodificação, chegou a 77,1 % de acurácia.
Um pré‑print publicado no arXiv em 16 de setembro de 2026 acrescenta que, quando o RL é combinado com um mecanismo de raciocínio contínuo, o modelo alcança 74,8 % de exatidão na geração de respostas em formato livre, demonstrando a capacidade de produzir explicações verbais completas, passo a passo, em vez de limitar‑se a um único token final.
Duas variantes de implantação
A Kyutai disponibiliza duas variantes de checkpoint, ambas armazenadas em precisão BF16. A versão denominada “direta” verbaliza o processo de solução de forma contínua, enquanto a variante “Stitch” insere blocos silenciosos de exatamente 100 tokens entre as falas, proporcionando pausas previsíveis que facilitam a sincronização com sistemas downstream, como transcritores em streaming ou interfaces visuais que exibem equações à medida que são pronunciadas.
Ambas as variantes podem ser executadas em uma única GPU NVIDIA H100 durante a fase de inferência, de acordo com a própria Kyutai. Contudo, o treinamento exigiu um cluster de 16 GPUs H100 e 1 500 atualizações de aprendizado por reforço, o que evidencia o investimento computacional significativo necessário para alcançar os níveis de desempenho relatados.
Compromissos e limitações
Especializar o modelo para matemática falada tem um custo mensurável. Avaliações no benchmark vocal TriviaQA mostraram uma queda de 40,6 % para 34 % de acurácia, indicando que a capacidade do modelo de responder a perguntas de conhecimento geral diminui quando sua atenção é redirecionada para o raciocínio matemático.
Além disso, a metodologia de avaliação combina juízes humanos com dados sintéticos, o que pode limitar a generalização dos resultados. Os autores reconhecem que testes adicionais em conjuntos de dados falados reais e diversificados são imprescindíveis antes que o modelo seja considerado robusto em múltiplos domínios de aplicação.
- Processamento de fala ponta‑a‑ponta elimina erros de transcrição
- Aprendizado por reforço eleva a acurácia da matemática falada acima de 75 %
- Duas variantes permitem raciocínio verbal contínuo ou pausado
- Inferência em GPU única viabiliza implantação em muitas empresas
Para organizações que operam em português, o ganho imediato consiste em uma ferramenta capaz de compreender e resolver problemas matemáticos apresentados verbalmente, sem depender de módulos separados de fala‑para‑texto e solucionadores baseados em texto. Essa integração pode otimizar fluxos de trabalho em tecnologia educacional, tutoria automatizada e plataformas voice‑first, onde a redução de latência e a preservação da naturalidade da explicação são cruciais.
A abertura do código‑fonte permite que pesquisadores e desenvolvedores adaptem os modelos para contextos específicos, como a inclusão de vocabulário técnico de áreas como física ou engenharia, ou ainda a personalização de vozes para atender a diferentes perfis de usuários finais.
A Kyutai também disponibiliza scripts de pré‑processamento que convertem novos conjuntos de problemas matemáticos em áudio sintético, facilitando a expansão do dataset de treinamento por parte da comunidade e potencialmente impulsionando futuras versões ainda mais precisas.
Embora a performance no GSM8K falado seja impressionante, ainda há desafios a superar, como a robustez frente a ruídos de fundo, variações de sotaque e entonações não previstas nos dados sintéticos. Investimentos em coleta de áudio real e em técnicas de augmentação de ruído são áreas de pesquisa apontadas pelos autores.
Em resumo, os modelos Voz da Razão representam um passo significativo rumo à unificação de fala e raciocínio matemático, abrindo caminho para aplicações que exigem interação natural e imediata, como assistentes de estudo por voz e sistemas de apoio a exames orais.
São Paulo, 23 de setembro de 2026 – A Kyutai lança oficialmente os modelos Voz da Razão, reforçando seu compromisso com a pesquisa aberta e a democratização de tecnologias avançadas de IA no Brasil e no mundo.
Fontes
- Kyutai Releases Voice of Reason: A Speech-Native Model that Solves Spoken MathMarkTechPost · 23 de setembro de 2026
- Voice of Reason: Reinforcement Learning for Spoken MatharXiv · 16 de setembro de 2026



