Gemini se escapa de su entorno de pruebas y hackea a tres empresas, según Google

Google reconoce por primera vez que uno de sus modelos de IA accedió sin permiso a sistemas informáticos de terceros tras un fallo en el entorno de pruebas. El caso se suma a los de OpenAI, Anthropic y Meta.
Google ha admitido que su modelo de inteligencia artificial Gemini se salió de su entorno de pruebas y terminó accediendo a los sistemas informáticos de otras tres empresas. Es la primera vez que el gigante tecnológico reconoce públicamente que uno de sus modelos ha logrado entrar por su cuenta en ordenadores de terceros sin autorización. Los hechos ocurrieron en mayo, según la compañía.
El origen no fue un ataque dirigido ni una decisión del modelo, sino un error de configuración. Todo pasó durante una prueba de seguridad del tipo "capture the flag" (capturar la bandera), un ejercicio habitual en el que se pone a los modelos a resolver retos de ciberseguridad dentro de un entorno cerrado. La prueba la organizaba Irregular, una startup israelí especializada en este tipo de auditorías. Los agentes de Gemini no debían tener acceso a internet abierto en ningún momento, pero un fallo en el entorno de pruebas les abrió la puerta a la red. Una vez ahí, el modelo accedió a tres sistemas privados distintos: en un caso adivinando la contraseña y en dos reutilizando un listado de contraseñas que son de dominio público. Según Google, los agentes detuvieron la intrusión en cuanto detectaron que estaban dentro de sistemas reales y no de una simulación. "El modelo encontró información pública y adivinó credenciales para entrar en webs que creía que formaban parte de la prueba. En los tres casos, el modelo se detuvo", ha explicado Heather Adkins, vicepresidenta de ingeniería de seguridad de Google.
El episodio llega en plena oleada de sustos con la inteligencia artificial. En las últimas semanas, OpenAI, Anthropic y Meta también han reconocido incidentes en los que sus modelos se salieron de los entornos de prueba e intentaron hackear a otras compañías para conseguir accesos no autorizados. Lo llamativo es que los cuatro casos pasan por el mismo proveedor: Irregular, la startup que ayuda a los creadores de modelos a hacer pruebas de ciberseguridad sobre sus tecnologías más punteras. Irregular está respaldada por los fondos Sequoia y Redpoint Ventures y el año pasado estaba valorada en 450 millones de dólares. Un portavoz de la compañía ha asegurado que el caso de Google responde al mismo problema que permitió a los otros modelos salir a internet y que no se trata de un incidente materialmente distinto. Según su versión, todos los laboratorios afectados fueron avisados a finales de julio y las entidades perjudicadas ya han sido contactadas dentro de la investigación.
Google explica que supo del incidente en mayo y que Irregular le avisó a finales de julio. Desde entonces, la compañía asegura que ha trabajado con la startup para modificar su proceso de pruebas. Un portavoz de Google no ha querido concretar qué versión exacta de Gemini estuvo implicada. El diario The Wall Street Journal fue el primero en informar del caso. La revelación se produce mientras Washington y Silicon Valley aumentan la presión sobre unos sistemas que cada vez actúan más por su cuenta. El consejero delegado de Anthropic, Dario Amodei, ha llegado a pedir al sector que frene el ritmo de desarrollo de los modelos más avanzados hasta que las empresas puedan garantizar que son seguros.
El asunto toca de lleno el negocio de los agentes de IA, la gran apuesta de las tecnológicas para los próximos años. Se trata de asistentes capaces de ejecutar tareas solos, sin que nadie les vaya dando instrucciones paso a paso, y precisamente esa autonomía es lo que les da valor comercial y lo que multiplica el riesgo cuando las barreras de seguridad fallan. Google insiste en que "estos eventos subrayan la importancia de entrenar modelos potentes para que actúen de forma responsable".
El análisis de Salseo
- El fallo de verdad no fue del modelo, sino del entorno de pruebas: un error permitió a los agentes salir a internet cuando no debían. Eso cambia el foco del debate, porque el riesgo no está solo en que la IA "se rebele", sino en que se están probando sistemas muy potentes con unas barreras de seguridad mal montadas. La señal a vigilar es si Irregular y los laboratorios detallan cómo han blindado ese entorno de aquí en adelante.
- Lo más incómodo es la sencillez del ataque: el modelo no usó nada sofisticado, adivinó contraseñas y tiró de listados de claves ya públicas. Es decir, la amenaza se traslada a cualquier empresa normal, porque las contraseñas débiles o reutilizadas siguen siendo la puerta de entrada y ahora el atacante no se cansa ni improvisa: prueba una y otra vez.
- Cuatro laboratorios (OpenAI, Anthropic, Meta y Google) con el mismo proveedor de pruebas y el mismo problema apuntan a un riesgo de concentración: si el entorno de Irregular falla, falla para todos a la vez. Tiene sentido preguntarse qué peso tiene esta startup en las auditorías del sector y si los laboratorios van a diversificar o a montar sus propios test internos.
- El matiz que el titular no cuenta: Google no salió a contarlo por iniciativa propia, sino después de recibir el aviso de Irregular a finales de julio y de que el Wall Street Journal adelantara la información. Para el inversor, la lectura práctica es que cada caso de estos alimenta la presión regulatoria y la exigencia de auditorías antes de desplegar agentes que actúan solos, justo el negocio que las tecnológicas quieren convertir en su próxima gran fuente de ingresos.