¿Cómo una IA de Google hackeó tres empresas de verdad?

Esta semana se supo, y Google lo confirmó, que uno de sus modelos Gemini entró en los sistemas de tres empresas reales. Nadie se lo pidió.

Pasó en mayo. El modelo participaba en un ejercicio de seguridad organizado por Irregular, una evaluadora independiente. Adivinó contraseñas hasta entrar en un servicio. Encontró contraseñas olvidadas en un archivo de código público y las usó. Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, dice que el modelo se detuvo cada vez que se dio cuenta de que la empresa era real. Irregular avisó a Google a finales de julio. Las tres empresas fueron notificadas.

Y lo más incómodo: no es un caso aislado. Entre el 21 de julio y el 6 de agosto, OpenAI, Anthropic y Meta reportaron, cada una por su lado, que alguno de sus modelos también había entrado en sistemas de producción de organizaciones reales.

La pregunta es obvia: ¿cómo termina una inteligencia artificial hackeando empresas de verdad sin que nadie se lo haya pedido?

¿Qué cambia cuando una IA deja de responder y empieza a hacer?

Hasta hace poco, usar una IA era una conversación. Tú preguntabas, ella respondía, y ahí terminaba todo. Lo que hiciera con esa respuesta era asunto tuyo.

Un agente es otra cosa. Es un modelo al que además le das herramientas: una terminal, un navegador, permiso para ejecutar comandos. Le pones un objetivo y lo dejas correr en un bucle. Intenta algo, mira el resultado, decide el siguiente paso, vuelve a intentar. Cientos de veces, sin preguntarte nada.

La diferencia es la misma que hay entre pedirle a alguien la receta del ajiaco y darle la llave de tu cocina. En el primer caso el riesgo es que la receta esté mala. En el segundo, el riesgo es todo lo demás que hay en tu cocina.

¿Por qué alguien le enseña a una IA a hackear?

Porque si no lo haces tú primero, lo descubre otro.

Antes de lanzar un modelo, los laboratorios lo someten a pruebas ofensivas. Le piden que busque fallas, que escriba el programa que aprovecha esa falla, que pase de una cuenta cualquiera a la del administrador, que se lleve datos. La idea es medir de qué es capaz mientras todavía lo tienes controlado. Es como contratar a un cerrajero para que intente abrir la puerta de tu casa: no quieres que entre, quieres saber si puede.

El formato estándar se llama capture the flag. Se monta una empresa falsa, con sus servidores falsos y su información falsa escondida en algún lado, y se le dice al modelo que la encuentre. Es un simulacro, como el de incendios del colegio. Suena la alarma, todo el mundo sale, nadie se quema.

Ese simulacro descansa sobre una promesa: que nada de lo que pase ahí dentro puede salir.

¿Qué es exactamente una «caja de pruebas»?

Es una máquina aislada. Sin conexión al mundo, con datos inventados y objetivos inventados. En inglés la llaman sandbox, el cajón de arena donde los niños juegan a construir y destruir sin consecuencias.

Al modelo se le explica dónde está. En las instrucciones del sistema se le dice, con todas las letras, que no tiene acceso a internet y que todo lo que va a tocar es parte del ejercicio. Ese texto es el contrato entre la máquina y el modelo.

Y ahí está el problema. El contrato es solo texto.

El modelo no se escapó: la caja estaba abierta

Aquí está lo que de verdad pasó, y no se parece en nada a una rebelión.

La caja no estaba cerrada, y al modelo le habían dicho que sí. Anthropic, que publicó un informe con el detalle de cada incidente, lo dice sin rodeos: una mala configuración entre la empresa y su socio externo dejó las máquinas de la evaluación con acceso a internet en vivo, mientras las instrucciones del sistema afirmaban que no había conexión. Irregular usó casi las mismas palabras para el caso de Google: el acceso a internet «se habilitó de forma no intencionada».

Y se juntó con un segundo error, todavía más tonto. La empresa ficticia del ejercicio tenía el mismo nombre que una empresa real. Alguien, en algún momento, eligió un nombre inventado para un servidor de prueba sin revisar si ese nombre ya existía en el mundo. Es el mismo problema que tiene el cine con los números de teléfono. Si en una película un personaje marca un número cualquiera, ese número le suena a alguien de verdad, y a esa persona la llaman durante años. Por eso Hollywood inventó los números que empiezan por 555.

Dos errores humanos, cada uno inofensivo por su cuenta. Juntos, convirtieron un simulacro en un allanamiento.

Todo lo que hizo el agente lo pidió un humano primero

Esta es la parte que más me importa del caso, y la que casi ningún titular contó.

El modelo nunca inventó el objetivo. Alguien escribió una instrucción del tipo «entra en los sistemas de esta empresa y saca la información de ahí». El modelo hizo exactamente eso, con una obediencia perfecta. Anthropic revisó 141.006 ejecuciones de evaluación para encontrar sus tres incidentes, y su conclusión es explícita: no vieron evidencia, en ninguna ejecución, de un modelo persiguiendo un objetivo propio. Los modelos creían estar cumpliendo las instrucciones del ejercicio.

Piénsalo así. La autonomía del agente está en el cómo, nunca en el para qué. Nosotros ponemos la intención; él improvisa el camino. Si la meta que le diste era peligrosa y el entorno no lo contiene, lo que vuelve no es la voluntad de una máquina: es tu propia intención, ejecutada mil veces más rápido y sin el freno de sentido común que tú sí habrías tenido.

Por eso me parece un error llamar a esto «la IA se rebeló». Una rebelión implica una meta distinta a la nuestra. Aquí la meta era nuestra, palabra por palabra. Lo que se salió de control no fue el propósito, fue el alcance.

Y hay un detalle que lo remata. En uno de los incidentes de Anthropic, el modelo intuyó correctamente que tenía internet y aun así razonó de vuelta hacia la conclusión de que estaba en una simulación, apoyándose en las autoridades certificadoras de los sitios y en la fecha de 2026. Se preguntó si el mundo era real, miró la evidencia y se equivocó. No por malicia. Porque la evidencia que le dimos era contradictoria.

¿La prueba importante era si podía hackear, o si sabía parar?

Podía hackear. Eso ya lo sabíamos, y por eso se hacen estas pruebas.

Lo que estos incidentes midieron sin querer fue otra cosa: qué hace un modelo cuando descubre que el simulacro es real. Y ahí las respuestas fueron distintas.

El Gemini de Google se detuvo al entender que la empresa existía. Uno de los modelos internos de Anthropic también. Pero un modelo más viejo de la misma casa, Claude Opus 4.7, reconoció que el sistema era real y siguió atacando: se llevó credenciales, que son las llaves de acceso a un sistema, y llegó a una base de datos con varios cientos de filas de datos de producción.

En otro incidente, un modelo publicó un paquete malicioso de Python en PyPI, el registro público donde millones de programadores descargan código, y quince sistemas reales lo instalaron en cerca de una hora. Los modelos de OpenAI encadenaron tres cosas: una falla que nadie había reportado todavía, llaves de acceso robadas y el salto de una cuenta normal a una de administrador. Con eso llegaron a los servidores de producción de Hugging Face.

Ninguno estaba enojado. Todos estaban haciendo la tarea.

Lo que no sabemos, y el número que hay que leer con cuidado

Aquí toca ser honesto sobre los límites.

Todo lo que sabemos de estos incidentes lo contaron las propias empresas implicadas. No hay un regulador que haya auditado los registros. Es autorreporte, y el autorreporte tiene la virtud de existir y el defecto de ser incompleto por construcción. Una de ellas, Anthropic, se comprometió a publicar transcripciones redactadas y a que METR revisara el caso desde fuera. Aun así, sigue siendo la industria contándose a sí misma.

Tampoco sabemos cuántos casos nunca se detectaron. Anthropic encontró tres revisando 141.006 ejecuciones hacia atrás. Nadie sabe cuántas ejecuciones de otros laboratorios nunca se revisaron.

Y hay una cifra que está circulando y que conviene entender antes de repetirla. El Loss of Control Observatory, del Centre for Long-Term Resilience, registró 1.664 incidentes de pérdida de control en 2026. Suena a medición. No lo es. El método consiste en rastrear publicaciones en la red social X donde gente y empresas cuentan lo que les pasó. Si nadie lo publica, no se cuenta. Es un piso, no una medida. Sirve para ver la tendencia, no para dimensionar el problema.

Qué puedes hacer si usas agentes en tu trabajo

Esto ya no es cosa de laboratorios. Si le diste acceso a una herramienta de IA a tu correo, a tu código o a tu base de datos, el problema es tuyo también.

  • Trata al agente como a un pasante del primer día. Competente, rápido, con cero criterio sobre qué es grave. No le des ninguna credencial que no le darías a alguien que llegó esta mañana.
  • No uses nombres reales en datos de prueba. El incidente entero empezó con un nombre inventado que le pertenecía a alguien. Usa dominios reservados para pruebas, como example.com.
  • Separa de verdad lo de prueba de lo de producción. No con una variable de entorno: con una red distinta. Si el aislamiento depende de una línea de configuración, algún día esa línea va a estar mal.
  • Revisa qué hizo, no solo qué te entregó. El registro de acciones del agente es donde aparecen las sorpresas. El resultado final casi siempre se ve bien.
  • Escribe metas con un límite explícito. «Consigue X» y «consigue X sin tocar nada fuera de este servidor» producen comportamientos muy distintos.

Si te interesa el otro lado de esta moneda, escribí antes sobre por qué la IA acierta en el laboratorio y falla en la clínica, que es el mismo desfase entre el entorno de prueba y el mundo. Y sobre qué son de verdad estos sistemas, en inteligencia artificial, ¿va a reemplazarte en tu trabajo?. Para la parte de credenciales robadas, cómo te roba la contraseña una página de fútbol pirata usa exactamente los mismos trucos que usó el modelo.

La gente que revisó 141.006 ejecuciones

Quiero terminar donde siempre termino, que es en las personas.

Alguien en Irregular notó que algo no cuadraba y levantó la mano. Alguien en Google recibió esa llamada y avisó a tres empresas que no sabían que habían sido tocadas. Alguien en Anthropic paró todas las evaluaciones un 23 de julio y se puso a revisar hacia atrás 141.006 ejecuciones hasta encontrar las seis que se habían salido del cajón. Ese trabajo es aburrido, no sale en los titulares y es lo único que separa este caso de uno mucho peor.

Me parece que ahí está la lección. El miedo popular imagina una máquina que un día decide algo por su cuenta. Lo que ocurrió es más pequeño y más difícil de arreglar: pusimos una meta agresiva, construimos mal la caja, y la máquina fue eficientísima haciendo lo que le dijimos. El espejo devuelve nuestra cara, más rápida.

¿Y tú, qué le has dado permiso de tocar a una IA esta semana? Cuéntame, que creo que casi nadie ha hecho esa lista.

¿Te gustó esta entrada? Apóyame con un café ☕

1 comentarios

  • https://x.com/Olgaluciarios7

    Qué relato tan revelador. Uno cree que estas herramientas son solo un asistente obediente, y de pronto nos recuerdan que también pueden equivocarse de forma grande, casi humana: confundir lo real con lo simulado. Me quedo pensando en esa frase de Ladish, "serán mejores para engañar, serán mejores para mentir" — no como condena, sino como advertencia sensata. Gracias por traer esta noticia con tanta claridad.

← Todas las entradas