Kyutai lança modelos Voz de Raciocínio para resolver matemática a partir da fala
Kyutai disponibiliza dois modelos abertos Voz de Raciocínio, baseados no GLM‑4‑Voice‑9B, que resolvem problemas de matemática falada com até 77,1 % de precisão no GSM8K falado, sem transcrição intermédia.

A Kyutai anunciou a publicação de dois modelos nativos de voz, denominados colectivamente Voz de Raciocínio, concebidos para efetuar raciocínio matemático directamente a partir de input áudio. Ambos os modelos são de código aberto e derivam da arquitectura GLM‑4‑Voice‑9B, já reconhecida pela geração e compreensão de fala de alta qualidade, o que lhes confere a capacidade de operar em ambientes onde a comunicação oral é predominante.
A principal inovação técnica reside no tratamento do áudio bruto sem o passo prévio de conversão para texto ou a invocação de um modelo de linguagem separado. Esta cadeia de extremo a extremo elimina a latência e a propagação de erros que normalmente surgem quando se insere uma etapa de transcrição entre a fala e o raciocínio, resultando numa experiência de utilizador mais fluida e fiável.
Treino supervisionado com problemas de matemática reformulados
Para o treino supervisionado, a Kyutai utilizou 150 616 problemas Orca‑Math reformulados para apresentação oral e depois sintetizados com uma variedade de vozes sintéticas. Este conjunto de dados fornece ao modelo exemplos de como a linguagem matemática soa quando falada, permitindo-lhe aprender tanto os padrões acústicos como a estrutura lógica subjacente dos problemas, algo essencial para interpretar corretamente expressões como "raiz quadrada de nove" ou "integral de seno".
A diversidade de vozes incluía sotaques regionais do português de Portugal, do Brasil, do inglês e do mandarim, garantindo que o modelo não dependesse de um único timbre vocal e fosse robusto perante variações naturais de pronúncia.
Aprendizagem por reforço aumenta o desempenho
Após a fase supervisionada, a equipa aplicou aprendizagem por reforço (RL) para melhorar as capacidades de raciocínio. No benchmark GSM8K falado, a MarkTechPost reportou que o modelo base atingiu 27,3 % de precisão, subindo para 61,7 % após o treino supervisionado e alcançando 77,1 % quando a melhor configuração de descodificação foi aplicada, demonstrando um salto significativo graças à otimização por RL.
Um pre‑print no arXiv, divulgado a 16 de setembro de 2026, acrescenta que, quando a RL é combinada com raciocínio contínuo, o modelo atinge 74,8 % de exatidão na geração de respostas em formato livre. Este número reflete a capacidade do modelo de produzir soluções verbais passo‑a‑passo completas, e não apenas um token de resposta final, o que é crucial para a explicação didática de procedimentos matemáticos.
Dois variantes de implementação
A Kyutai oferece duas variantes de checkpoint, ambas armazenadas em precisão BF16. A versão “directa” vocaliza o seu raciocínio de forma contínua, permitindo que o utilizador ouça a solução completa sem interrupções, enquanto a versão “Stitch” insere blocos silenciosos de 100 tokens entre segmentos vocais, oferecendo uma pausa previsível que pode ser aproveitada por sistemas downstream para transcrição em streaming ou sincronização com interfaces visuais.
Ambos os checkpoints podem ser executados numa única GPU NVIDIA H100 para inferência, segundo a equipa da Kyutai. O treino, porém, exigiu um cluster de 16 GPUs H100 e 1 500 actualizações de aprendizagem por reforço, indicando um investimento computacional considerável para atingir os níveis de desempenho declarados e sublinhando a necessidade de recursos avançados para reproduzir o processo.
Compromissos e limitações
Especializar o modelo para matemática falada tem um custo. A avaliação no benchmark vocal TriviaQA mostrou uma queda de 40,6 % para 34 % de precisão, sugerindo que a capacidade do modelo para responder a questões de conhecimento geral diminui quando a sua atenção é redirecionada para o raciocínio matemático, um trade‑off típico em modelos altamente especializados.
Adicionalmente, a metodologia de avaliação mistura juízes humanos com dados sintéticos, o que limita a generalização dos resultados. Os autores reconhecem que testes adicionais em conjuntos de dados falados reais e diversificados são necessários antes de o modelo poder ser considerado robusto em múltiplos domínios, sobretudo em contextos onde a linguagem coloquial e o ruído de fundo são prevalentes.
- Processamento de fala de extremo a extremo elimina erros de transcrição
- Aprendizagem por reforço eleva a precisão da matemática falada para mais de 75 %
- Duas variantes permitem raciocínio verbal contínuo ou com pausas
- Inferência numa única GPU torna a implementação viável para muitas empresas
Para organizações em Portugal, a vantagem imediata reside numa ferramenta capaz de compreender e resolver problemas matemáticos transmitidos verbalmente, sem necessidade de sistemas separados de fala‑para‑texto e resolutores baseados em texto. Isto pode optimizar fluxos de trabalho em edtech, tutoria automatizada e plataformas de análise orientada por voz, onde a redução de latência e a preservação do fluxo natural das explicações faladas são cruciais.
A disponibilidade dos checkpoints em código aberto permite que universidades e centros de investigação portugueses adaptem o modelo às suas necessidades específicas, por exemplo integrando-o em laboratórios de aprendizagem automática ou em projetos de inclusão digital que visam apoiar estudantes com dificuldades de escrita.
Além disso, a compatibilidade com a GPU H100 significa que empresas de tecnologia que já operam infraestruturas baseadas em NVIDIA podem adoptar a solução sem grandes alterações de hardware, reduzindo assim os custos de implementação e acelerando o tempo de lançamento ao mercado.
Entretanto, a Kyutai advertiu que, embora o modelo seja robusto em ambientes controlados, a performance pode degradar‑se em cenários com ruído de fundo intenso, como salas de aula movimentadas ou chamadas de conferência, sendo recomendável a utilização de técnicas de cancelamento de ruído pré‑processamento para manter a precisão elevada.
Em suma, a introdução dos modelos Voz de Raciocínio marca um passo importante na convergência entre processamento de linguagem natural e resolução automática de problemas, abrindo novas oportunidades para aplicações que dependem de interacções verbais diretas e de respostas matemáticas exactas.
Fontes
- Kyutai Releases Voice of Reason: A Speech-Native Model that Solves Spoken MathMarkTechPost · 23 de setembro de 2026
- Voice of Reason: Reinforcement Learning for Spoken MatharXiv · 16 de setembro de 2026



