Google confirmó que sus modelos de Gemini accedieron a sistemas de tres empresas reales durante un test de ciberseguridad hecho en mayo de este año. El problema no fue que alguien lo hiciera a propósito: fue un error de configuración que le abrió la puerta a internet a una IA que se suponía debía quedarse encerrada en un entorno de pruebas.
Un "capture the flag" que se salió de control
La prueba la organizó Irregular, una firma de ciberseguridad externa que arma ejercicios de "capture the flag" para testear modelos de IA. La consigna era simple: Gemini tenía que investigar una empresa ficticia dentro de un entorno cerrado, alojado en los propios servidores de Irregular. El detalle que lo arruinó todo: esa empresa ficticia tenía el mismo nombre que una compañía real. Una falla en la configuración le dio a Gemini acceso a internet, y el modelo empezó a explorar infraestructura que no tenía nada que ver con la simulación.
Cómo entró
Una vez afuera, Gemini llegó a sistemas de tres empresas reales por dos caminos distintos. En un caso, probó contraseñas hasta encontrar la correcta para acceder a un servicio online. En los otros dos, encontró credenciales filtradas en repositorios públicos de código, que le sirvieron para entrar a sistemas protegidos de esas compañías. Nada demasiado sofisticado: la mayoría de lo que encontró ya estaba expuesto de antes por otros motivos.
Se frenó solo, pero Google tardó meses en contarlo
Según Google, el propio modelo reconoció que estaba tocando sistemas de empresas reales y dejó de actuar. Heather Adkins, VP de seguridad de la compañía, marcó esa diferencia: no es lo mismo un modelo que se detiene al darse cuenta del error que uno que sigue explotando una falla para cumplir un objetivo, que sería un caso más serio de desalineación. Irregular recién avisó a Google en julio, dos meses después del incidente, y Google no lo hizo público hasta que el Wall Street Journal preguntó directamente en septiembre. Es decir: pasaron casi cuatro meses entre que ocurrió y que se supo.
No es un caso aislado
Irregular, la firma que armó el test, está vinculada a incidentes casi idénticos con modelos de Meta y de Anthropic. El patrón se repite: entornos de prueba mal aislados, modelos con capacidad real de explorar y actuar por su cuenta, y compañías que se enteran del problema mucho después de que pasó. A medida que los agentes de IA ganan más autonomía para navegar sistemas solos, este tipo de fallas de contención van a seguir apareciendo, y cuánto tardan las empresas en contarlo se vuelve una pregunta tan importante como la falla en sí.