Google Gemini 3.8 Flash TTS introduz conceção de voz por texto
A Google lançou o Gemini 3.8 Flash TTS e o Flash-Lite TTS, permitindo desenhar vozes por comandos de texto e dirigir diálogos linha a linha via API.

A Google expandiu a sua família Gemini Audio com a disponibilização oficial dos modelos Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. Estes dois novos modelos de conversão de texto em fala (text-to-speech) marcam uma transição técnica significativa, afastando a síntese vocal dos catálogos estáticos e predefinidos para passar a adotar uma produção sonora inteiramente orientada por instruções em linguagem natural. A empresa descreve este lançamento como o seu sistema de geração de áudio mais expressivo até à data, permitindo que engenheiros, programadores e criadores de conteúdos desenhem vozes personalizadas e controlem desempenhos interpretativos através de comandos textuais simples. Ambos os modelos encontram-se disponíveis de imediato através da Gemini API e do ambiente Google AI Studio, sob os identificadores técnicos de modelo gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts. A tecnológica norte-americana confirmou que o acesso permanece estritamente baseado em chamadas de API, não existindo disponibilização de pesos abertos (open weights) para alojamento local independente, enquanto uma integração empresarial no Gemini Enterprise foi anunciada como estando para breve.
Este lançamento introduz uma arquitetura de dois níveis concebida especificamente para equilibrar a profundidade criativa com os custos operacionais e a latência de resposta. O modelo Gemini 3.8 Flash TTS foi desenvolvido especificamente para direção criativa aprofundada, conceção detalhada de personagens e experiências de áudio complexas em videojogos, podcasts, audiolivros e formatos interativos. Em contrapartida, o Gemini 3.8 Flash-Lite TTS foi otimizado para operações de grande volume e de elevada eficiência de custos, visando dobragens de multimédia em larga escala, geração automatizada de conteúdos e agentes de conversação por voz em tempo real. Estes modelos complementam a gama existente da família Gemini Audio da Google, que inclui o 3.5 Live Translate, o 3.5 Transcribe, o 3.8 Live e o 3.8 Live Extended Thinking.
Conceção generativa de voz e direção interpretativa granular
Uma das principais transformações técnicas trazidas pela versão 3.8 consiste no alargamento substancial que ultrapassa a anterior biblioteca de 30 vozes originais. A partir de agora, os programadores podem recorrer à conceção generativa de voz para criar perfis vocais personalizados a partir do zero, utilizando instruções descritivas em texto que abrangem o papel, o sotaque e o timbre vocal em mais de 100 línguas e variantes dialetais. Na documentação técnica divulgada, a Google apresentou exemplos práticos que variam entre um locutor de rádio de Melbourne, um robô de tom monótono e metálico e um dragão dramático em língua japonesa. Para projetos que exijam recursos prontos a utilizar, a plataforma disponibiliza adicionalmente uma biblioteca com mais de 2 000 vozes prontas para produção, incluindo variedades linguísticas regionais como o inglês da Escócia, o francês do Quebeque e o espanhol do México. As vozes criadas sob medida podem ser guardadas e reutilizadas sistematicamente, prevenindo qualquer desvio acústico ao longo de fluxos de produção prolongados.
- Direção de guiões linha a linha: os programadores podem introduzir anotações de encenação escritas ou confiar no contexto do texto para orientar a entoação, variando entre sussurros íntimos e diálogos de tom autoritário.
- Encenação nativa de diálogos entre dois interlocutores: é possível orquestrar conversações com várias alternâncias a partir de um único guião, assegurando uma separação vocal nítida e transições de fala realistas.
- Estabilidade em formatos longos: a arquitetura técnica mantém a consistência do timbre, o ritmo da elocução e a fidelidade acústica continuamente ao longo de várias horas de áudio gerado.
- Interjeições e ruídos não verbais de conversação: os textos podem integrar marcadores diretos como « laughs », « sigh » e « gasp » para conferir textura humana natural à fala.
- Sinais de escuta ativa (backchanneling): inserções como « mhm » e « yeah » possibilitam uma calibração minuciosa do ritmo cómico e das pausas de reação durante a conversa.
- Remistura de voz: uma funcionalidade anunciada para breve que permitirá aos criadores ajustar timbre, tom, ritmo e sotaque de vozes da biblioteca através de pedidos em linguagem natural.
O fluxo de trabalho de geração suporta igualmente a replicação de voz a partir de uma amostra de áudio de referência de 30 segundos. Com o objetivo de mitigar a clonagem não autorizada, a Google exige uma gravação verbal de consentimento fornecida pelo titular da voz, a qual é verificada e validada biometricamente contra o orador de referência antes de qualquer geração ser autorizada. As ferramentas de replicação vocal no Google AI Studio encontram-se atualmente restritas e indisponíveis em diversas jurisdições, nomeadamente no Espaço Económico Europeu, no Reino Unido e na Índia.
Desempenho em testes comparativos e proveniência de conteúdos
De acordo com os dados comparativos publicados pela Google, o Gemini 3.8 Flash TTS alcançou a primeira posição global no Voice Design Benchmark da Hume AI com uma pontuação de 71,4, obtendo também a classificação cimeira de 60,8 na modelação de sotaques. No índice de qualidade global da Hume AI (Overall Quality Index), o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS conquistaram o primeiro e o segundo lugares, respetivamente, demonstrando progressos de desempenho notáveis face ao anterior Gemini 3.1 Flash TTS. Adicionalmente, a Google indicou que avaliações cegas de preferência humana realizadas na plataforma Voice Arena posicionaram ambos os modelos no topo das tabelas em várias línguas principais, incluindo o árabe padrão moderno, o híndi, o português do Brasil, o japonês, o vietnamita e o espanhol do México.
Para garantir a rastreabilidade da proveniência do conteúdo e mitigar utilizações indevidas, a Google incorpora uma marca de água impercetível SynthID diretamente no fluxo de áudio gerado pelos seus modelos Gemini Audio. As vozes clonadas produzidas através do pipeline de replicação integram também credenciais de conteúdo C2PA, oferecendo metadados verificáveis e auditáveis sobre a natureza sintética do material multimédia.
Arquitetura de integração e impacto operacional
Os novos modelos estão a ser incorporados nativamente em produtos do ecossistema Google, tais como o Google Vids e o Gemini Notebook. Ao nível da integração em software de terceiros, plataformas de infraestrutura de desenvolvimento como Agora, LiveKit, Pipecat e Vercel já ativaram suporte técnico através da Gemini API. Empresas comerciais de software e multimédia, entre as quais Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang, encontram-se a implementar os modelos para executar dobragens automatizadas, localização de áudio regional e agentes interativos em tempo real.
Para as empresas e organizações técnicas, esta atualização transforma a economia e a engenharia associadas à implementação de voz sintética. As equipas deixam de estar limitadas a catálogos vocais rígidos ou a fluxos de trabalho fragmentados e frágeis para a geração de diálogos multifacetados. A estrutura de dois níveis permite que os arquitetos de sistemas encaminhem aplicações de elevado volume e sensíveis à latência, como assistentes de apoio ao cliente, para o Flash-Lite TTS, reservando o Flash TTS para narrações de marca e produções audiovisuais complexas, tudo sob controlos padronizados de API e rastreio de proveniência integrado.
Fontes
- Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTSMarkTechPost · 23 de setembro de 2026
- Gemini 3.8 text-to-speech says helloGoogle · 23 de setembro de 2026



