DeepMind lanza Gemini 3.8 Live: lidera la voz en IA y recorta el precio a la mitad

Google DeepMind presenta sus nuevos modelos de voz Gemini 3.8 Live y llega al primer puesto en los rankings independientes de conversación en tiempo real, con una rebaja radical en el coste por hora de audio. Los test humanos, en cambio, siguen prefiriendo la generación anterior.
Google DeepMind ha puesto en circulación dos nuevos modelos pensados para hablar: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, disponibles desde el 15 de septiembre. La idea de fondo es que la máquina pueda conversar y, a la vez, resolver tareas complejas sin que el diálogo se corte ni se note una pausa incómoda. Según las pruebas independientes de Artificial Analysis, la versión Extended Thinking se ha colocado en primera posición de su índice de voz a voz (Speech-to-Speech Index) con una nota de 82,6 puntos.
Ese primer puesto deja atrás a rivales directos como GPT-Live-1 Astra, con 81,5 puntos, y Grok Voice Think Fast 2.0 High, con 81,3. La variante estándar de Gemini 3.8 Live se conforma con la quinta plaza del índice, con 76,0 puntos. Ambas novedades superan a la generación anterior, Gemini 3.1 Flash Live High, que se quedaba en 71,5. La distancia es especialmente grande cuando el modelo tiene que ejecutar tareas complicadas: Extended Thinking logra un 68,6% de acierto en la prueba Tau Voice, frente al 37,7% de los modelos más antiguos.
Más allá del ranking, la parte que más puede mover el negocio es el precio. Google ha reducido el coste de entrada de la nueva generación: el Gemini 3.8 Live estándar cuesta 0,84 dólares por hora de audio de entrada, justo la mitad de los 1,75 dólares del modelo anterior, y se convierte en la opción más barata del índice. La versión Extended Thinking se va a 3,50 dólares la hora, por debajo de los 4,47 de GPT-Live-1 Sol y de los 4,80 de Grok Voice Think Fast 2.0 High. Además, el tiempo de espera hasta la primera respuesta de audio ha caído de 2,99 segundos a 1,18 segundos, algo que en una conversación se percibe de inmediato.
Sin embargo, hay un matiz que el titular no cuenta: cuando quienes juzgan son personas y no máquinas, el resultado cambia. En las pruebas a ciegas de Speech Agent Arena, los evaluadores humanos siguen prefiriendo el modelo anterior. Gemini 3.1 Flash Live mantiene el primer puesto, con una puntuación Elo de 1.096; Gemini 3.8 Live queda segundo con 1.083; y Extended Thinking se va hasta los 990 puntos, a pesar de completar el 89,1% de las tareas que se le encomiendan. La conclusión es clara: pensar mejor no equivale a sonar mejor, y la voz natural sigue pesando más que la potencia bruta.
Todo esto ocurre en plena carrera de los grandes tecnológicos por dominar las herramientas de voz en tiempo real, un terreno donde hoy se miden dos cosas a la vez: la capacidad de razonamiento del modelo y lo agradable que resulta escucharlo. Alphabet cerró la sesión anterior cerca de los 344,98 dólares, con una caída del 1,3% tras el anuncio, en un valor que sigue contando con un consenso mayoritariamente favorable entre los analistas que cubren la compañía.
El análisis de Salseo
- El dato que de verdad importa no es el 82,6 del ranking, sino el 0,84 dólares por hora de audio: partir por la mitad el coste del modelo anterior y quedarse como la opción más barata del índice ataca directamente el criterio con el que una empresa elige qué motor de voz pone en su atención al cliente. Los benchmarks dan titulares; el precio por hora gana contratos.
- La brecha entre benchmark y humanos es la señal más interesante: el modelo que mejor piensa (Extended Thinking, 990 de Elo) es el que menos gusta a quien lo escucha, mientras el viejo Gemini 3.1 Flash Live sigue primero con 1.096. En productos de voz, la latencia y la naturalidad mandan sobre la capacidad de razonamiento, y aquí Google compite contra su propia generación anterior.
- A corto plazo esto puede ser un problema de mensaje: Alphabet domina las dos listas, pero con modelos distintos, y eso complica explicar al cliente cuál debe contratar. Además, la caída del 1,3% en bolsa con un lanzamiento objetivamente fuerte sugiere que el mercado ya da por descontado el liderazgo técnico de Google: lo que movería la aguja es ver esto traducido en ingresos de Cloud o en cuota en asistentes de voz.
- La señal concreta que conviene vigilar es doble: si el ranking humano de Speech Agent Arena acaba dándose la vuelta a favor de la nueva generación (sería la confirmación de que el producto está redondo) y si la próxima presentación de resultados menciona adopción real de estos modelos por parte de empresas. Sin eso, seguimos hablando de una medalla técnica, no de negocio.