Gemini 3.8 Live richt zich op voice agents in productie
Google lanceert twee gehoste spraak-naar-spraakmodellen voor productieagents, met asynchrone tools, bijna realtime visuele input en door Google gemelde scores.

Google heeft Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking op 15 september 2026 gepresenteerd als twee native spraak naar spraak modellen voor voice agents in productie. Het onderscheid is vooral operationeel. Gemini 3.8 Live richt zich op schaal en economische efficientie, voor organisaties die veel live gesprekken willen afhandelen tegen voorspelbare kosten. Gemini 3.8 Live Extended Thinking richt zich op complexe taken en redeneren in meerdere stappen, wanneer een agent eerst moet afwegen voordat hij antwoordt, een tool aanroept of van route verandert. Beide modellen zijn beschikbaar via de Gemini Live API en Google AI Studio. Ze worden gehost, zijn geen open weights en kunnen dus niet zelf worden gehost.
Twee gehoste modellen voor live spraak
De aankondiging is relevant omdat voice agents anders falen dan tekstchatbots. In tekst kan een pauze voor het ophalen van gegevens zichtbaar en aanvaardbaar zijn. In een telefoongesprek of vergadering moet het systeem stilte, onderbrekingen, beurtwisseling en toolresultaten verwerken zonder dat het gesprek kapot voelt. Google wijst daarom op asynchrone function calling. Het model kan tools en API s op de achtergrond starten terwijl het gesprek doorgaat, in plaats van de gebruiker bij elke externe actie te laten wachten. Voor support, afspraken, interne helpdesks en spraakprocessen met live systemen is dat een praktisch verschil.
- Gemini 3.8 Live mikt op schaal en kostenefficientie voor voice agents in productie.
- Gemini 3.8 Live Extended Thinking mikt op complexe taken en redeneren in meerdere stappen.
- Beide modellen zijn native spraak naar spraak modellen en zijn sinds 15 september 2026 beschikbaar via Gemini Live API en Google AI Studio.
- Volgens Google laat asynchrone function calling tools en API s op de achtergrond lopen terwijl het gesprek doorgaat.
- De modellen zijn gehoste diensten, geen open weights, waardoor self hosting niet mogelijk is.
Welke live mogelijkheden Google noemt
Google beschrijft de modellen ook als multimodale live systemen, niet alleen als spraakmachines. Ze kunnen visuele input bijna in realtime verwerken, wat telt voor agents die tijdens het spreken naar een scherm, product, document of werkomgeving moeten kijken. Google zegt ook dat de modellen automatisch kunnen detecteren en schakelen tussen 97 talen. Dat is bedoeld voor meertalige gesprekken waarin gebruikers niet netjes in een taal blijven. Verder noemt Google betere precisie voor codes en alfanumerieke gegevens. In productie zijn ordernummers, accountcodes, reserveringsreferenties en korte verificatiestrings vaak precies de punten waar een fout geld kost.
Benchmarks zijn aangekondigde resultaten
Google meldt voor Gemini 3.8 Live Extended Thinking meerdere scores: 82,6 op de Speech to Speech Quality Index, 68,6 procent op tau-Voice, 35,1 procent op Sierra tau-Voice-banking en 97,7 procent op Big Bench Audio. Google zegt ook dat Gemini 3.8 Live tweede staat in Speech Agent Arena. Die cijfers zijn nuttige signalen van wat Google als verbetering presenteert, maar het blijven aangekondigde resultaten, geen brede onafhankelijke validatie voor elke productieomgeving. De kwaliteit van een voice agent hangt ook af van latency, akoestiek, telefonie, onderbrekingen, toolbetrouwbaarheid en menselijk toezicht.
MarkTechPost rapporteert prijzen van 0,005 dollar per minuut audio invoer en 0,018 dollar per minuut audio uitvoer. Volgens dat bericht is de schatting gebaseerd op 3 dollar per miljoen inputtokens en 12 dollar per miljoen outputtokens. Voor inkopers is het minuuttarief niet de hele rekensom. Een productieagent verbruikt ook begroetingen, herhalingen, mislukte beurten, doorschakelingen, afgebroken sessies en monitoringverkeer. De kostenbelofte van Gemini 3.8 Live moet daarom worden gemeten per echt opgeloste taak.
Partners en implementatieroutes
Google noemt Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel en Vision Agents als partners voor realtime infrastructuur. De beschikbaarheid loopt via meerdere routes. De API en Google AI Studio zijn direct beschikbaar; private previews komen in Gemini Enterprise; en Search Live, Gemini Live en bepaalde Workspace ervaringen krijgen toegang afhankelijk van de aanbiedingen. Google zegt verder dat alle geluiden die door zijn AI producten worden gegenereerd het onmerkbare SynthID watermerk dragen. Dat vervangt geen transparantie of auditlogs, maar kan wel in de governance checklist.
Voor productie moeten kopers end to end latency, onderbrekingen, herstel na fouten, werkelijke kosten, traceerbaarheid van tool calls en menselijk toezicht testen. Dat is analyse, geen door Google aangekondigd feit. Voor Nederlandstalige organisaties betekent dit dat een gehoste, spraaknative Gemini lijn nu als productie infrastructuur kan worden beoordeeld. Een goede pilot is geen glad script, maar een gemeten callflow met accenten, ruis, taalwissels, alfanumerieke codes, API storingen, escalatieregels en heldere overdracht aan een medewerker.
Bronnen
- Introducing Gemini 3.8 Live and 3.8 Live Extended ThinkingGoogle · 15 september 2026
- Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice AgentsMarkTechPost · 15 september 2026



