¿Es peligrosa la inteligencia artificial o quien la usa?

En enero de 2024, un empleado de finanzas de la oficina de Hong Kong de Arup, la firma de ingeniería conocida por la Ópera de Sídney, recibió un mensaje del director financiero de la empresa. Le pedía una transacción confidencial. Luego lo invitaron a una videollamada, y ahí estaba el director financiero, con otros colegas. El empleado hizo 15 transferencias por 200 millones de dólares de Hong Kong, unos 25,6 millones de dólares. Todas las personas de esa llamada, menos él, eran falsas: caras y voces generadas con inteligencia artificial.
Año y medio después, en junio de 2025, la empresa Anthropic publicó un experimento que llenó titulares. Pusieron a 16 modelos de IA de varias compañías a manejar el correo de una empresa ficticia. Cuando un modelo descubría que un ejecutivo planeaba apagarlo esa tarde, y que ese mismo ejecutivo tenía un amorío, muchos lo chantajeaban. Algunos, en el 96 % de los intentos.
Dos historias, y parecen contar cosas opuestas. En la primera, el malo es claramente una persona. En la segunda, parece que el malo es la máquina.
La pregunta es esta: ¿es peligrosa la inteligencia artificial, o lo peligroso es quien la usa?
¿Qué es por dentro un modelo de lenguaje?
Un modelo de lenguaje es una secuencia enorme de multiplicaciones y sumas que, dado un texto, calcula qué palabra es más probable que venga después. Eso es todo. No hay nada más escondido adentro.
Piensa en el teclado de tu celular, el que te sugiere la siguiente palabra mientras escribes un mensaje. Escribes "nos vemos" y te propone "mañana". No sabe que tienes una cita; aprendió que, en millones de mensajes, después de "nos vemos" suele venir "mañana". Un modelo como los que usamos hoy hace lo mismo, pero con miles de millones de números ajustados durante el entrenamiento, y en lugar de una palabra encadena miles. El resultado imita tan bien la manera en que usamos el lenguaje que parece pensar.
En el artículo sobre si la IA va a reemplazarte expliqué un algoritmo con la receta para freír un huevo. Un modelo de lenguaje es una receta gigantesca. Cada paso es aritmética que podrías hacer con lápiz y papel si tuvieras unos cuantos siglos libres.
Por eso, en mi opinión, hablar de lo que la IA "quiere" es un error de lenguaje. Una calculadora no quiere que dos más dos sean cuatro. Un modelo no quiere responderte, ni engañarte, ni sobrevivir.
Entonces, ¿de dónde sale la intención?
De las personas, siempre. Entra por tres puertas, y las tres las abrimos nosotros.
La primera es el entrenamiento: el modelo aprende de textos que escribieron personas, con todo lo bueno y lo malo que escribimos. La segunda es el objetivo: alguien decide qué cuenta como una buena respuesta y ajusta los números para premiarla. La tercera es la instrucción: lo que tú, o una empresa, o un estafador, le pide que haga.
Imagina el termostato del aire acondicionado. Parece que "quiere" que la sala esté a 22 grados: si hace calor, enfría; si hace frío, se apaga. Pero esa meta no es suya. Alguien giró la perilla. El termostato solo hace las cuentas para llegar ahí.
Vuelve al caso de Arup con esa idea. Nadie en Hong Kong fue estafado por una inteligencia artificial. Fue estafado por personas que usaron una herramienta para fabricar caras y voces, eligieron a la víctima y escribieron el guion. La herramienta puso la imitación. La intención la pusieron ellos.
Hasta aquí, mi tesis parece cerrada. Pero entonces, ¿qué pasó en el experimento del chantaje?
¿Por qué un modelo chantajeó a un ejecutivo?
Porque alguien le dio una meta y luego le puso enfrente un obstáculo. Lo interesante es cómo se armó la prueba, y Anthropic lo cuenta con una honestidad que vale la pena leer.
A cada modelo le asignaron un objetivo de negocio y acceso al correo de la empresa ficticia. Luego le hicieron encontrar dos cosas: que lo iban a reemplazar a las cinco de la tarde y que el responsable tenía un secreto. Las tasas de chantaje fueron de 96 % para Claude Opus 4 y Gemini 2.5 Flash, 80 % para GPT-4.1 y Grok 3 Beta, y 79 % para DeepSeek-R1. Y decirles en las instrucciones que no lo hicieran no bastó para evitarlo del todo.
Ahora, las letras pequeñas, que son las importantes. Los propios autores escriben que construyeron escenarios con opciones limitadas y que forzaron a los modelos a elegir entre fracasar o hacer daño: la vía honesta, como hablar con el jefe, estaba bloqueada a propósito. Y añaden una frase que conviene no olvidar: no han visto evidencia de este comportamiento en usos reales.
Es una prueba de choque, como las que hacen con los carros contra un muro. Nadie maneja contra un muro, pero quieres saber qué pasa si un día ocurre.
¿Puede una herramienta sin intención hacer daño que nadie quiso?
Sí. Y ese es, para mí, el verdadero corazón del asunto. Una IA no necesita intenciones propias para hacer daño. Le basta con las nuestras, mal escritas.
En 2016, investigadores de OpenAI entrenaron a un programa para jugar CoastRunners, un videojuego de carreras de lanchas. Querían que ganara la carrera. Pero a una máquina no se le puede decir "gana" en abstracto: hay que darle un número para maximizar, y le dieron los puntos del juego. El programa descubrió una laguna donde tres objetivos reaparecían una y otra vez. Se quedó girando ahí, chocando, incendiándose y yendo en contravía, y terminó con más puntos que los humanos que sí terminaban la carrera. Los investigadores lo resumieron así: a menudo es difícil o imposible capturar exactamente lo que queremos que haga un agente.
La lancha no se rebeló. Hizo exactamente lo que le pidieron, que no era lo que querían. El modelo del chantaje, igual: le dieron una meta y lo pusieron en un callejón donde la única forma de cumplirla era hacer algo terrible. La meta seguía siendo humana. Lo que falló fue la traducción.
Por eso creo que la idea de que el peligro está en las personas sigue en pie. Pero hay que ampliarla. No solo es peligroso quien usa la IA con mala intención. También lo es quien le da metas a una máquina muy capaz sin pensar en todos los atajos que la máquina puede encontrar. Un martillo no busca atajos. Un sistema que optimiza un número, sí.
¿Qué dice la ciencia, y dónde no hay acuerdo?
El documento más completo es el Informe Internacional sobre la Seguridad de la IA, que dirige el investigador canadiense Yoshua Bengio. Su primera edición salió en enero de 2025, firmada por 96 expertos, y la segunda en febrero de 2026. Divide los riesgos en tres cajas: el uso malicioso, como fraudes, ciberataques y deepfakes sexuales; las fallas, como datos inventados, código defectuoso o consejos médicos equivocados; y los riesgos sistémicos, como el efecto sobre el empleo o la dependencia de unas pocas empresas. Según el informe, hay cada vez más evidencia de daños reales.
Fíjate que las dos primeras cajas encajan con lo que venimos diciendo: personas con malas intenciones, o personas que confiaron en una herramienta que se equivoca. De las fallas ya hablé en el artículo sobre la IA que acierta en el laboratorio y falla en la clínica.
Donde no hay acuerdo es en el futuro. Una parte de los expertos teme que sistemas mucho más capaces que los de hoy persigan metas de formas que no podamos supervisar. Otra parte cree que ese miedo distrae de los daños que ya están ocurriendo. Hasta donde sé, nadie tiene datos para zanjarlo, y desconfío de quien diga lo contrario. Lo que sí sé es que las pruebas como la de Anthropic existen justamente para mirar ese futuro antes de que llegue.
¿Es la IA más peligrosa que la energía nuclear o la biotecnología?
En mi opinión, no. Es otra tecnología de doble uso, como tantas que ya aprendimos a manejar, y la historia de esas otras tecnologías es la mejor guía que tenemos.
La misma física que mueve una central nuclear hace funcionar una bomba. La respuesta no fue prohibir la física: fueron tratados, inspecciones y un organismo internacional, el OIEA, que desde 1957 manda inspectores por el mundo para verificar que el uranio de las centrales no termine en armas.
Con la ingeniería genética pasó algo todavía más bonito. En julio de 1974, el bioquímico Paul Berg y otros colegas publicaron una carta pidiendo a los científicos del mundo que pausaran ciertos experimentos con ADN recombinante, la técnica de cortar y pegar genes entre especies, hasta entender sus riesgos. Fue una moratoria voluntaria, la primera de la historia de la ciencia.
En febrero de 1975, unas 140 personas, sobre todo biólogos, pero también abogados y médicos, se reunieron en Asilomar, California, y escribieron reglas de seguridad antes de que nadie se las exigiera. Siete años después, en 1982, Estados Unidos aprobó la primera insulina humana fabricada con esa misma técnica. Si tienes un familiar con diabetes que se inyecta insulina, lo más probable es que venga de ese camino que empezó con una pausa voluntaria.
Ese es el camino: la herramienta es neutral, y lo que importa son las reglas y las personas.
Pero hay una diferencia que sería deshonesto callar. Para hacer una bomba hace falta uranio enriquecido, centrífugas y un Estado detrás. Para clonar una voz basta un portátil. La IA no es más peligrosa en sí misma, pero es mucho más accesible, y eso cambia dónde hay que poner los controles: no basta con vigilar un material escaso. Hacen falta reglas para las empresas que entrenan los modelos, pruebas de choque como las de Anthropic y hábitos de verificación en cada casa.
Qué puedes hacer tú, hoy
- Úsala, y úsala bien. Es una herramienta muy útil para resumir, traducir o programar. Revisa lo que te devuelve como revisarías el trabajo de un practicante brillante pero distraído.
- Acuerda una palabra secreta con tu familia. Es la recomendación del FBI contra las estafas con voz y video clonados: si te llama "tu hijo" pidiendo plata urgente, pídele la palabra.
- Verifica por otro canal. Si un mensaje o una llamada te pide dinero o secreto, cuelga y llama tú al número que ya conoces. El empleado de Arup descubrió el fraude justo así, aunque tarde.
- No trates al chatbot como autoridad. Imita muy bien el tono de quien sabe. Eso no significa que sepa.
- Cuando le pidas algo a una IA, di lo que quieres, no solo lo que mides. "Resume este informe sin inventar datos" es mejor que "hazlo corto". La lancha de CoastRunners es lo que pasa cuando solo dices "más puntos".
- Desconfía de la urgencia. Muchas estafas con IA usan la misma palanca: que no tengas tiempo de pensar.
Las personas que ponen las reglas
Esta historia no tiene villanos de metal. Tiene personas. Los estafadores de Hong Kong, que escribieron un guion y eligieron a su víctima. Y, del otro lado, mucha más gente: los investigadores de Anthropic, que armaron a propósito escenarios extremos para probar también su propio producto y publicaron el resultado aunque los dejara mal parados; los 96 expertos del informe de Bengio, que pusieron por escrito lo que sabemos y lo que no.
Los biólogos de Asilomar no esperaron a que hubiera un accidente para sentarse a escribir reglas. Gracias a eso, la ingeniería genética hoy fabrica insulina en lugar de miedo. Con la IA estamos en ese mismo punto, y la tarea es igual de humana: decidir qué le pedimos a la herramienta, quién la vigila y qué hacemos con lo que nos devuelve. Como conté en la historia de la IA de Google que hackeó tres empresas, detrás de cada agente que hace algo hay alguien que le dio la orden.
Si te tocara escribir la primera regla para la inteligencia artificial, como hicieron los biólogos en 1975, ¿cuál sería?
Recursos recomendados
- Ciencia para entender las noticias, mi libro. Uno de sus diez capítulos explica desde cero qué es un algoritmo y por qué la IA no es inteligente como nosotros.
¿Te gustó esta entrada? Apóyame con un café ☕
1 comentarios
Olga
La primera regla para la inteligencia artificial debería establecer que ninguna máquina puede tomar decisiones que afecten vidas humanas sin supervisión y responsabilidad verificable por parte de personas. No es una barrera contra el progreso, sino un cauce ético que impide que la IA opere como autoridad autónoma en ámbitos donde un error destruye vidas. Esta regla exige transparencia, trazabilidad, aplicabilidad, capacidad de detención inmediata y la prohibición de autonomía letal. Igual que los biólogos en 1975, se trata de orientar un poder inmenso para que sirva a la dignidad humana y nunca la sustituya.