Producto

Empleados de Google dudan del rendimiento real del nuevo Gemini, según Bloomberg

·NegativoImpacto medio
Empleados de Google dudan del rendimiento real del nuevo Gemini, según Bloomberg

Fuentes internas de Google habrían mostrado su escepticismo sobre el rendimiento del nuevo modelo Gemini en tareas clave como la programación, pese a sus buenos resultados en las pruebas estándar del sector.

Google tiene un pequeño problema interno con su nuevo modelo estrella de inteligencia artificial. Según informa Bloomberg, citando fuentes cercanas, dentro de la compañía existe escepticismo sobre cómo se comporta realmente Gemini 4 en áreas clave como la programación de código. No es que el modelo vaya mal: la cosa es más sutil y, precisamente por eso, más incómoda.

El detalle que cuenta Bloomberg es el siguiente: Gemini 4 obtiene buenos resultados en los llamados 'benchmarks', que son pruebas estandarizadas con las que la industria mide si un modelo de IA es bueno o malo. Son algo así como los exámenes tipo test de la inteligencia artificial. El problema es que cuando los propios empleados de Google ponen el modelo a trabajar de verdad, en tareas reales del día a día, el rendimiento que ven está por debajo de lo que esos exámenes prometen. La información la firman las periodistas Julia Love y Davey Alba.

¿Por qué importa esto? Porque Google lleva tiempo presentando Gemini como su gran apuesta para no quedarse atrás en la carrera de la IA, un terreno donde compite codo con codo con OpenAI, Anthropic, Meta y compañía. En este negocio, la diferencia entre 'mi modelo saca buena nota en el ranking' y 'mi modelo resuelve de verdad lo que el cliente necesita' es la diferencia entre vender humo y vender producto. Y si los propios trabajadores de la casa son los primeros que levantan la ceja, el mensaje que traslada al mercado no es tranquilizador.

Hay que ponerlo en contexto: esto es una información basada en fuentes anónimas, no un dato oficial ni unas cuentas publicadas. No sabemos cuántos empleados opinan así ni en qué tareas concretas falla. Lo relevante de cara al futuro será ver si ese escepticismo interno se queda en un runrún de pasillo o si acaba notándose en algo medible: adopción por parte de empresas y desarrolladores, renovaciones de contratos o el ritmo al que Google lanza actualizaciones del modelo. Ahí es donde se verá si la brecha entre el examen y la realidad tiene consecuencias o se queda en anécdota.

El análisis de Salseo

  • La brecha entre 'nota de examen' y 'rendimiento en el trabajo real' es el riesgo clásico de este sector: las pruebas estandarizadas se pueden optimizar y no siempre reflejan lo que el usuario nota después. Para Google el negocio no está en ganar rankings, sino en que empresas y programadores paguen por usar el modelo cada mes.
  • Google no vende solo un modelo suelto: lo integra en su nube y en sus productos, así que si el rendimiento real flojea, el daño aparece primero en la renovación de contratos y en el uso de su plataforma, no en los titulares. Es una señal que tardará en verse, pero que pesa más que cualquier puesto en una clasificación.
  • Que un empleado filtre sus dudas a Bloomberg también dice algo del ambiente interno: sugiere presión por lanzar rápido y compararse con rivales como OpenAI o Anthropic. En esta carrera, la velocidad de salida al mercado puede pesar más que la calidad final, y eso es exactamente lo que suele generar este tipo de quejas internas.
  • Lectura contraria: escepticismo interno no equivale a fracaso. Los modelos se refinan con versiones posteriores y esto puede quedar en nada. El dato duro que hay que vigilar no son los comentarios anónimos, sino los números de adopción empresarial que publique Alphabet en sus próximas cuentas.

Empresas mencionadas

Fuente: TheFly