Gemini 3.8 Live apunta a agentes de voz en producción
Google lanza dos modelos alojados de voz a voz para agentes en producción, con herramientas asíncronas, entrada visual casi en tiempo real y cifras atribuidas a Google.

Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking el 15 de septiembre de 2026 como dos modelos nativos de voz a voz para agentes vocales en producción. La separación es ante todo operativa. Gemini 3.8 Live busca escala y eficiencia económica, para empresas que necesitan muchas conversaciones en directo con un coste controlable. Gemini 3.8 Live Extended Thinking apunta a tareas complejas y razonamiento de varios pasos, cuando el agente debe pensar antes de responder, llamar a una herramienta o cambiar de ruta. Ambos están disponibles mediante Gemini Live API y Google AI Studio. Son modelos alojados, no open weights, por lo que no se pueden autoalojar.
Dos modelos alojados para voz en directo
La noticia importa porque un agente vocal falla de forma distinta a un chatbot de texto. En un chat, una pausa para recuperar datos puede ser visible y aceptable. En una llamada o reunión, el sistema debe manejar silencio, interrupciones, turnos de habla y resultados de herramientas sin que la conversación parezca rota. Google destaca la llamada de funciones asíncrona para resolver parte de ese problema. El modelo puede iniciar herramientas y API en segundo plano mientras sigue hablando con la persona, en vez de obligarla a esperar a que termine cada acción externa. Para soporte, reservas, mesas de ayuda internas y flujos de voz con sistemas vivos, esa diferencia es central.
- Gemini 3.8 Live se orienta a escala y eficiencia de coste para agentes vocales en producción.
- Gemini 3.8 Live Extended Thinking se orienta a tareas complejas y razonamiento de varios pasos.
- Ambos modelos son nativos de voz a voz y están disponibles desde el 15 de septiembre de 2026 mediante Gemini Live API y Google AI Studio.
- Google dice que la llamada de funciones asíncrona permite ejecutar herramientas y API en segundo plano mientras continúa la conversación.
- Son servicios alojados, no open weights, así que no hay autoalojamiento.
Qué capacidades en vivo subraya Google
Google presenta los modelos como sistemas multimodales en directo, no solo como motores de voz. Pueden procesar entradas visuales casi en tiempo real, algo relevante para agentes que tienen que observar una pantalla, un producto, un documento o un entorno de trabajo mientras hablan. Google también afirma que detectan y cambian automáticamente entre 97 idiomas, una capacidad pensada para llamadas multilingües donde el usuario no permanece en una sola lengua. La empresa añade una mayor precisión para códigos y datos alfanuméricos. En producción, oír bien un número de pedido, un identificador de cuenta, una referencia de reserva o una cadena corta de verificación puede pesar más que una respuesta elegante.
Los benchmarks son resultados anunciados
Google comunica varios resultados para Gemini 3.8 Live Extended Thinking: 82,6 en Speech to Speech Quality Index, 68,6 % en tau-Voice, 35,1 % en Sierra tau-Voice-banking y 97,7 % en Big Bench Audio. Google también afirma que Gemini 3.8 Live ocupa el segundo puesto en Speech Agent Arena. Estas cifras son señales útiles sobre las mejoras que Google reivindica, pero son resultados anunciados, no una validación independiente general de todos los entornos de producción. La calidad de un agente vocal depende también de latencia, acústica, telefonía, interrupciones, fiabilidad de herramientas y supervisión humana.
MarkTechPost informa de precios de 0,005 dólares por minuto de entrada de audio y 0,018 dólares por minuto de salida de audio. El medio presenta la estimación como basada en 3 dólares por millón de tokens de entrada y 12 dólares por millón de tokens de salida. Para los compradores, el precio por minuto es solo el inicio. Un agente en producción consume saludos, repeticiones, sesiones abandonadas, transferencias, intentos fallidos y tráfico de supervisión. La promesa de eficiencia de Gemini 3.8 Live debe comprobarse en el flujo completo, no en una conversación ideal.
Infraestructura y despliegue
Google cita a Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents como socios de infraestructura en tiempo real. El despliegue tiene varias capas. La API y Google AI Studio están disponibles de inmediato; Gemini Enterprise tendrá previews privadas; y Search Live, Gemini Live y algunas experiencias de Workspace recibirán disponibilidad según las ofertas. Google también dice que todos los sonidos generados por sus productos de IA llevan la marca de agua imperceptible SynthID. No sustituye la transparencia ni los registros de auditoría, pero suma un control a revisar.
Antes de producción, los compradores deben probar latencia de extremo a extremo, interrupciones, recuperación tras errores, coste real, trazabilidad de llamadas a herramientas y supervisión humana. Es análisis, no un hecho anunciado por Google. Para empresas hispanohablantes, el cambio es que una línea Gemini nativa de voz puede evaluarse como infraestructura alojada de producción. El piloto útil debe incluir acentos, ruido, cambios de idioma, códigos deletreados, fallos de API, reglas de escalado y traspaso claro a una persona.
Fuentes
- Introducing Gemini 3.8 Live and 3.8 Live Extended ThinkingGoogle · 15 de septiembre de 2026
- Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice AgentsMarkTechPost · 15 de septiembre de 2026



