Google estrena avatares con IA en vivo y calienta el motor para Gemini 4

Alphabet lanza Gemini 3.8 Live con Live Avatar, un modelo que pone cara, voz y gestos a la IA conversacional, mientras su cúpula confirma que Gemini 4 ya está en la fase previa a su lanzamiento.
Google ha puesto en el mercado Gemini 3.8 Live con Live Avatar, un nuevo modelo de inteligencia artificial que da a la conversación con la máquina un personaje visual en tiempo real: no solo escucha y contesta con voz, sino que aparece en pantalla con cara, gestos y movimiento de labios. El movimiento llega apenas un día después de que la compañía presentara dos modelos de texto a voz de la familia Gemini 3.8, otra señal de que Alphabet quiere pisar el acelerador en el terreno de la IA generativa.
La tecnología combina generación de vídeo casi en tiempo real con voz, de modo que una empresa puede crear un personaje digital que se muestra en pantalla y responde mientras alguien le habla. Google asegura que el avatar sincroniza el movimiento de la boca con lo que dice, utiliza expresiones faciales naturales y es capaz de mantener conversaciones en las que usuario y máquina se turnan la palabra sin pausas largas. Eso lo hace atractivo para la atención al cliente, para demostraciones de producto interactivas o para cualquier situación en la que un asistente con cara resulte más natural que un simple texto o una voz sin imagen.
El lanzamiento redondea una semana muy movida en el equipo de IA de Google. El miércoles llegaron Gemini 3.8 Flash TTS, que permite crear voces de personajes a partir de descripciones de texto sencillas, y Gemini 3.8 Flash-Lite TTS, orientado a producir audio más barato para tareas como el doblaje o los agentes de voz. La compañía afirma que estos dos modelos ocupan el primer y el segundo puesto en el índice de calidad global de Hume AI. Por ahora, el nuevo avatar en vivo está disponible a través de Gemini Enterprise, la vía de Google para vender estas herramientas a empresas.
La mirada, sin embargo, ya está puesta en el siguiente salto. El jefe de Google DeepMind, Koray Kavukcuoglu, aseguró esta semana que el modelo estrella, Gemini 4, ha entrado en la fase de posentrenamiento, la etapa en la que se pule cómo responde la IA y se le añaden protecciones de seguridad antes de salir al mercado, y admitió que la intención es publicar una versión temprana cuanto antes. El contexto ayuda a entender las prisas: las acciones de Alphabet llegaron a caer alrededor de un 20% desde sus máximos recientes por el temor de los inversores a retrasos en Gemini 3.5 y al empuje de otras compañías de IA.
El análisis de Salseo
- Poner cara y voz a la IA no es un adorno: ataca justo el punto donde se atasca la adopción en empresas, la sensación de estar hablando con un robot. Si la conversación fluye sin pausas, se abre la puerta a automatizar parte del trabajo de los centros de atención telefónica, un negocio enorme y con márgenes muy ajustados.
- La cascada de lanzamientos (3.8 Live, Flash TTS y Flash-Lite) funciona como relato: Google necesita demostrar que no se ha quedado atrás tras los retrasos de Gemini 3.5 y llena el calendario mientras Gemini 4 madura. Es una forma de sostener la percepción de ritmo frente a rivales como OpenAI, Meta o Anthropic.
- La señal concreta que hay que vigilar es cuándo sale Gemini 4 de verdad y si aterriza en los productos que ya generan ingresos masivos (Búsqueda, Workspace, suscripciones), no solo en la oferta para empresas, que es una venta más lenta y de ciclo largo.
- El matiz que no cuenta el titular: sacar versiones tan seguidas puede confundir al cliente (¿3.5, 3.8 o 4?) y canibalizar los modelos recién presentados. Además, la ventaja en calidad de voz y avatar es de las más fáciles de copiar por la competencia en cuestión de meses.