Google Gemini 3.8 Flash TTS biedt stemontwerp via prompts
Google lanceert Gemini 3.8 Flash TTS en Flash-Lite TTS, waarmee teams via prompts stemmen ontwerpen en dialogen per regel regisseren via de Gemini API.

Google heeft zijn Gemini Audio-familie officieel uitgebreid met de introductie van Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS. Deze twee text-to-speech-modellen markeren een fundamentele verschuiving in spraaksynthese, waarbij statische stemprofielen plaatsmaken voor vocale producties die volledig worden gestuurd door natuurlijke taalinstructies. Google omschrijft deze release als zijn meest expressieve audiogeneratiesysteem tot nu toe. Het stelt softwareontwikkelaars, geluidstechnici en contentmakers in staat om op maat gemaakte stemmen te genereren en uitvoeringen tot in detail te regisseren met behulp van geschreven prompts. Beide modellen zijn per direct beschikbaar via de Gemini API en binnen Google AI Studio onder de model-ID's gemini-3.8-flash-tts en gemini-3.8-flash-lite-tts. Google heeft bevestigd dat de toegang strikt beperkt blijft tot API-aanroepen; er worden geen open weights verstrekt voor lokale hosting. Een implementatie voor zakelijke omgevingen binnen Gemini Enterprise wordt binnenkort verwacht.
De release introduceert een architectuur met twee niveaus die is ontworpen om creatieve expressie zorgvuldig af te stemmen op operationele kosten en latentie. Gemini 3.8 Flash TTS is specifiek ontwikkeld voor diepgaande creatieve regie, karakterontwerp en hoogwaardige audio-ervaringen in videogames, podcasts, audioboeken en interactieve media. Daartegenover staat Gemini 3.8 Flash-Lite TTS, dat is geoptimaliseerd voor grootschalige, kostenefficiënte verwerking met een lage latentie. Dit lichte model richt zich primair op grootschalige nasynchronisatie van media, geautomatiseerde contentgeneratie en spraakgestuurde agents voor klantinteractie. Beide modellen vormen een directe aanvulling op het bestaande Gemini Audio-portfolio van Google, dat reeds bestaat uit 3.5 Live Translate, 3.5 Transcribe, 3.8 Live en 3.8 Live Extended Thinking.
Generatief stemontwerp en gedetailleerde regie van audioprestaties
Een belangrijke technische doorbraak in de 3.8-versie is het loslaten van de eerdere bibliotheek van dertig vooraf gedefinieerde stemmen. Ontwikkelaars kunnen nu gebruikmaken van generatief stemontwerp om vanaf nul aangepaste stemmen op te bouwen aan de hand van beschrijvende prompts in natuurlijke taal. Daarin kunnen variabelen zoals rol, accent en vocaal timbre worden vastgelegd voor meer dan honderd talen en dialecten. In zijn technische documentatie toonde Google voorbeelden variërend van een radio-dj uit Melbourne en een blikkerige, monotone robot tot een dramatische Japanse draak. Voor producties die kant-en-klare stemmen vereisen, levert het platform een bibliotheek met meer dan 2.000 direct inzetbare stemmen, inclusief regionale varianten zoals Schots-Engels, Quebec-Frans en Mexicaans-Spaans. Op maat gemaakte stemmen kunnen worden opgeslagen en hergebruikt om akoestisch verloop over langdurige productietrajecten te voorkomen.
- Regie per regel in het script: Ontwikkelaars kunnen schriftelijke regieaanwijzingen toevoegen of vertrouwen op de natuurlijke tekstuele context om de intonatie te sturen van fluisteringen tot gezaghebbende dialogen.
- Natuurlijke scèneregistratie voor twee sprekers: Gesprekken met meerdere beurten kunnen worden aangestuurd vanuit één enkel script, met behoud van duidelijke vocale scheiding en realistische interacties.
- Stabiliteit bij lange producties: De architectuur behoudt het timbre, het spreektempo en de audiokwaliteit continu over uren aan gegenereerd materiaal.
- Niet-verbale menselijke expressies: Scripts kunnen directe tags bevatten zoals « laughs », « sigh » en « gasp » om menselijke nuances toe te voegen.
- Tussendoorse reacties en luistergeluiden: Actieve luisterindicaties zoals « mhm » en « yeah » maken een nauwkeurige afstemming van timing en reactiepauzes mogelijk.
- Stemmixing: Een aankomende functie waarmee makers het timbre, de toonhoogte, het tempo en het accent van bestaande bibliotheekstemmen kunnen aanpassen via tekstprompts.
De workflow ondersteunt tevens het klonen van stemmen op basis van een referentie-audiofragment van dertig seconden. Om ongeautoriseerd stemmisbruik te voorkomen, vereist Google een begeleidende mondelinge toestemmingsopname van de stemhouder. Deze opname wordt geverifieerd tegen de referentiespreker voordat de generatie wordt goedgekeurd. De functies voor het repliceren van stemmen binnen Google AI Studio zijn momenteel aan strikte geografische beperkingen onderhevig en zijn niet beschikbaar in verschillende rechtsgebieden, waaronder de Europese Economische Ruimte, het Verenigd Koninkrijk en India.
Benchmarkprestaties en herkomst van audio-inhoud
Volgens benchmarkgegevens van Google behaalde Gemini 3.8 Flash TTS de eerste plaats op de Voice Design Benchmark van Hume AI met een score van 71,4, naast een toonaangevende score van 60,8 op het gebied van accentmodellering. Op de Overall Quality Index van Hume AI bezetten Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS respectievelijk de eerste en tweede positie, wat aanzienlijke prestatieverbeteringen laat zien ten opzichte van Gemini 3.1 Flash TTS. Daarnaast meldde Google dat blinde menselijke voorkeurstests op Voice Arena beide modellen op de hoogste posities plaatsten in diverse grote talen, waaronder Modern Standaard Arabisch, Hindi, Braziliaans Portugees, Japans, Vietnamees en Mexicaans Spaans.
Om de herkomst van media te waarborgen en misbruik tegen te gaan, integreert Google een onhoorbaar SynthID-watermerk rechtstreeks in de audiouitvoer van zijn Gemini Audio-modellen. Stemmen die zijn gegenereerd via de replicatieworkflow worden bovendien voorzien van C2PA-contentreferenties, die verifieerbare metadata leveren over de synthetische aard van het audiomateriaal.
Implementatiearchitectuur en operationele impact
De modellen worden native geïntegreerd in Google-producten zoals Google Vids en Gemini Notebook. Voor externe softwaretoepassingen hebben infrastructuurplatforms voor ontwikkelaars, waaronder Agora, LiveKit, Pipecat en Vercel, directe ondersteuning via de Gemini API uitgerold. Commerciële mediabedrijven en softwareontwikkelaars zoals Figma, HeyGen, Linguana, Wondercraft, 99.co en Ollang zetten de modellen in voor geautomatiseerde nasynchronisatie, regionale audiolokalisatie en realtime interactieve spraakassistenten.
Voor ondernemingen en technische organisaties verandert deze release de economische en technische kaders van synthetische spraak. Ontwikkelteams zijn niet langer gebonden aan rigide stemcatalogi of afzonderlijke, complexe pipelines voor dialogen tussen meerdere personages. Dankzij de architectuur met twee niveaus kunnen systeemarchitecten latencygevoelige applicaties met grote volumes, zoals klantenservice-agents, toewijzen aan Flash-Lite TTS, terwijl Flash TTS kan worden ingezet voor merkgebonden voice-overs en complexe gescripte producties, allemaal beheerd via gestandaardiseerde API-functionaliteiten met ingebouwde herkomstverificatie.
Bronnen
- Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTSMarkTechPost · 23 september 2026
- Gemini 3.8 text-to-speech says helloGoogle · 23 september 2026



