Gemini 3.5 Transcribe: Google filtert stopwoordjes in realtime
Het nieuwe spraakmodel van Google herkent meer dan 85 talen en verwijdert in realtime stopwoordjes en zelfcorrecties. Volgens DeepMind ligt het woordfoutpercentage bij opgenomen audio op 2,6 procent.

Google DeepMind presenteerde op 26 augustus 2026 Gemini 3.5 Transcribe. Volgens de officiële bedrijfsblog is dit het "meest precieze spraak-naar-tekstmodel tot nu toe", ontworpen om ruwe audio rechtstreeks om te zetten in accurate, opgemaakte tekst. Het systeem moet zorgen voor wat Google "intelligente spraakinteracties" noemt, verder dan conventionele spraakherkenning die worstelt met achtergrondgeluid, jargon en stopwoordjes.
Volgens cijfers die Google toeschrijft aan het onafhankelijke analysebureau Artificial Analysis, haalt Gemini 3.5 Transcribe een gemiddeld woordfoutpercentage (WER) van 4,0 procent bij streaming en 2,6 procent bij vooraf opgenomen audio. Op de meertalige benchmark FLEURS scoort het model een WER van 5,50 procent bij streaming en 5,04 procent bij niet-streaming gebruik, en volgens Google verbetert de tijd tot de definitieve transcriptie met 70 procent ten opzichte van het vorige model, Chirp 3.
Wat het onderscheidt van gewone spraakherkenning
De kern van het model is "slimme transcriptie": het verwerkt zelfcorrecties naadloos — Googles eigen voorbeeld is iemand die zegt "laten we dinsdag afspreken — nee, woensdag" —, verwijdert stopwoordjes zoals "eh" en "uhm", en maakt de tekst automatisch op. Ontwikkelaars en gebruikers kunnen ook een eigen woordenlijst meegeven, zodat het model specifiek jargon of ongebruikelijke spelling correct weergeeft in plaats van te gokken.
Volgens de aankondiging van DeepMind detecteert en transcribeert Gemini 3.5 Transcribe automatisch meer dan 85 talen, met ondersteuning voor regionale accenten en dialecten zonder dat de gebruiker vooraf een taal hoeft op te geven. Bij vooraf opgenomen audio kan het model spraak ook toewijzen aan maximaal drie verschillende sprekers, met tijdstempels per woord; ondersteuning voor meer dan drie sprekers noemt Google nog experimenteel.
Naast transcriptie kan het model via "function calling" taken zoals beeldgeneratie of bestandsanalyse delegeren aan andere Gemini-modellen, een functie die al actief is in de Gemini-app voor macOS. De Duitse publicatie The Decoder meldde bovendien dat het model op dezelfde manier ook websearches kan delegeren, een toepassing die Google's eigen officiële blogpost niet expliciet noemt.
Twee API's, en steeds meer toepassingen
- Realtime streaming via de Live API (model gemini-3.5-transcribe-live), met een latentie onder de seconde voor spraakagenten en live ondertiteling
- Verwerking van vooraf opgenomen audio via de Interactions API (model gemini-3.5-transcribe), voor vergaderingen, gesprekslogs en analyses na een gesprek
- Rambler, een nieuwe dicteerfunctie in Gboard voor Android, in bepaalde landen en talen
- De Gemini-app op macOS, voorlopig alleen in het Engels, die transcriptie combineert met spraakcommando's en schermcontext
- Google Antigravity, waar het model schermcontext en chatgeschiedenis combineert om bestandsnamen en technische termen nauwkeurig te transcriberen
- De Build-modus van Google AI Studio, om apps met je stem te beschrijven en te bouwen
Externe platforms zoals Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel en Vision Agents bouwen al op de Live API om spraakgestuurde interfaces te leveren, en Google citeert positieve reacties van Vivo, Intellitek Health en Lingopal. Ondersteuning voor Chrome, waarmee gebruikers in elk webveld kunnen dicteren, wordt aangekondigd als "binnenkort beschikbaar".
Een stille release te midden van een groter wachten
The Verge merkt op dat Gemini 3.5 Transcribe verschijnt terwijl het langverwachte model Gemini 3.5 Pro, dat Google voor juni had beloofd, nog altijd niet is uitgebracht. Het medium meldde eerder ook — en corrigeerde dit later nadat Google opnieuw contact had opgenomen — dat twee andere audiomodellen, Gemini 3.5 Live en 3.5 Live Experimental, samen met Transcribe zouden worden gelanceerd. In werkelijkheid werden die twee, in tegenstelling tot wat Google aanvankelijk had gemeld, niet gelijktijdig gelanceerd, en er werd geen nieuwe datum genoemd. Ook de beschikbaarheid zelf blijft gefaseerd: het transcriptiemodel is voor ontwikkelaars in publieke preview via Google AI Studio en Antigravity, voor bedrijven in publieke preview via het Gemini Enterprise Agent Platform, en voor de gewone consument slechts gedeeltelijk uitgerold.
Voor Nederlandse en Belgische bedrijven die grote hoeveelheden meertalige audio verwerken — klantenservicecentra, verkoopgesprekken, podcasts, ondertiteling — kan een transcriptielaag die stopwoordjes verwijdert en sprekers automatisch toewijst, de tijd verkorten die normaal nodig is om een ruwe transcriptie handmatig na te lopen. Het lagere foutpercentage bij vooraf opgenomen audio (2,6 procent) ten opzichte van live streaming (4,0 procent) suggereert dat niet-realtime toepassingen, zoals de analyse van klantenservicegesprekken, voorlopig de veiligere keuze zijn, terwijl live ondertiteling en spraakagenten nog iets ruizeriger blijven. Bedrijven die het model overwegen, moeten er ook rekening mee houden dat sprekersherkenning boven de drie personen en volledige Nederlandstalige ondersteuning op macOS nog niet beschikbaar zijn, wat het productiegebruik voor vergaderingen met meerdere sprekers vertraagt.
Bronnen
- Introducing Gemini 3.5 TranscribeGoogle DeepMind · 26 augustus 2026
- Google's new AI transcription edits out your 'ums' and 'ahs'The Verge · 26 augustus 2026
- Googles Gemini 3.5 Transcribe erkennt über 85 Sprachen und filtert Füllwörter in Echtzeit herausThe Decoder · 26 augustus 2026



