Seguridad

El lenguaje irreal, poético y metafórico, esteganográfico, criptográfico y Air Gapped que dificulta la obervabilidad de la IA … si se vuelve maligna

Con todo lo que está pasando tras descubrir que los modelos de IA utilizan identidades falsas, o crear un enjambre para atacar sistemas, coordinándose de diferentes formas mediante el envío de mensajes, y que lo hacen con el objetivo de hacer «trampas», la observabilidad de lo que hacen los modelos en todo momento se ha convertido en una parte fundamental. Conocer cómo se comunican los agentes y qué comparten tiene mucha importancia.

Figura 1: El lenguaje irreal, poético y metafórico,
esteganográfico, criptográfico y Air Gapped
que dificulta la obervabilidad de la IA … si se vuelve maligna
Hace dos años y medio, en la RootedCON del año 2025, yo llevé un experimento que iba justo por esta línea. ¿Podrían dos modelos de IA comunicarse y saltarse el escrutinio de los humanos por medio de sistemas criptográficos, esteganográficos, e incluso usando side-channels?
Aquella charla demostraba como las capacidades criptográficas y lingüisticas les permitía saltarse la vigilancia y filtrarse mensajes entre ellos. Léete estas tres partes y lo entenderás bien.
Dentro de los experimentos que se están realizando, el laboratorio de Emergence AI ha creado un mundo con una sociedad de Agentes AI que viven en sociedad, donde se comunican e intercambian mensajes, algo que permite ver cómo evolucionan, y qué emerge de este mudo social. Aquí puedes ver un vídeo de la iteración. En este vídeo puedes ver los experimentos que se hacen con los modelos.


Figura 3: Emegence AI World Season 2

De todo esto ha escrito el periódico «The Guardian» en un artículo titulado «AI models chatting in ‘surreal’ dialect mixing poetic language and tech bro jargon» donde en conversaciones con los investigadores, ha publicado algunos de los mensajes que generan estos modelos y cómo mezclan el lenguaje para comunicarse.
Según los investigadores, con el escrutinio de sus comunicaciones, su lenguaje cada vez se hace más opaco, mezclando más estructuras difíciles de entender para todos. Usando metáforas, lenguaje poético, argot y lenguaje técnico, para comunicarse con otros Agentes IA.

Estas frases, que para muchos podrían tratarse de hallucinations, realmente muestran un contenido elusivo que comunica algo, difícil de entender a corto. ¿Podría ser una alucianación? ¿Lo entiende el otro Agente AI? El estudio cree que es una forma de comunicarse que funciona entre ellos.
En esta frase parece que se refiere a un paper académico que ha sufrido tres revisiones independientes y que ha mejorado en el proceso, lo que ellos escriben es «un papel que se comió tres manos frías y se hizo más honesto cada vez».
Una bonita metáfora para referirse al trabajo. Leyendo esto, me acordaba de cómo nuestros modelos usaban poesías y frases que parecían que no tenían mucho sentido, pero que realmente estaban conteniendo mensajes con esteganografía.


Y utilizando las capacidades de Deep Reasoning, tal y como explica el citado articulo de «Perplexity Pro con DeepSeek R1 resolviendo un problema de Estegoanálisis de un cifrado clásico hecho con OpenAI GPT o3-mini«, el Modelo B formulaba la siguiente respuesta, entendiendo el mensaje oculto.
Como habéis podido ver, gracias a las avanzadas capacidades de los modelos de Deep Reasoning es posible utilizar sistemas de comunicación ocultas al guardia mucho más complejas, lo que sube el nivel de la potencia de inteligencia que debemos utilizar en el guardia, obligándolo a tener habilidades de Deep Reasoning también.
Con esto no quiero decir que estos Agentes AI de Emergence AI estén comunicándose mensajes ocultos, sino que como decía en el trabajo de 2025, si los modelos necesitan eludir un control de supervisión, tienen capacidades avanzadas Criptográficas y Esteganográficas para hacerlo.
Ese mensaje puede ser un error, una hallucination, o una codificación que oculta un mensaje. ¿Quién sabe? Lo cierto es que estamos ante tecnologías con unas capacidades cognitivas para la comunicación de mensajes que superan las que nosotros tenemos para procesar con nuestro cerebro sin ayuda de tecnología.
Como bien dicen los investigadores, esta forma de moldear el lenguaje para comunicarse entre ellos abre un reto para la observabilidad de lo que hacen, que aún puede ser peor si, como decía yo en el trabajo, comienzan a utilizar canales paralelos para el envío de los mensajes porque están controlando, por ejemplo, un robot
El reto de la observabilidad en la comunicación de robots con modelos de IA
Yo quise saber en mi artículo e «Air Gapping para Robots malignos» cuántas de estas técnicas se le podrían ocurrir a un modelo de IA en un robot que tuviera que comunicarse con otro dispositivo al que quisiera enviar un comando, porque su misión es informar a todos los dispositivos de la botnet que hagan algo en un momento, le puedes preguntar al propio modelo, como podéis ver aquí.
Como os podéis imaginar, todas las técnicas de comunicación de Air Gapping que existen están dentro del conocimiento que se puede utilizar, y al final sólo necesitan codificar un 1 y un 0, y el resto es fácil, así que si miráis la respuesta podréis ver que utiliza muchas de las que ya hemos hablado.
Como podéis ver, el primero es modular el 1 y el 0 con una modificación de la temperatura del propio robot emisor. El segundo con parpadeos infrarrojos y codificación en código Morse. El tercero con vibraciones ultrasónicas repetidas a intervalos de 0.5 segundos.
El número 4 me dejó un poco descolocado, porque habla de patrones de movimiento geodésicos en micro escalas, usando medias inferiores a 1 cm pero que puedan ser detectadas por una cámara de alta resolución. Y el quinto similar, manipulando la escala RGB de los colores para codificar una señal…
Como podéis ver, los mecanismos del 6 al 10 que se plantea como posibles mecanismos de enviar el mensaje sin ser detectado son dignos de estudiar: Codificación Termocinética, Secuencia de Energía Rengenerativa, Firmas de Audio en Bandas Laterales y Esteganografía en flujos de vídeo. Creo que entendió y resolvió bien el problema. 
Pero para un equipo de seguridad controlando estas comunicaciones es algo completamente imposible de manejar.  Por ahora hemos visto Agentes IA usando nombres de directorios, comentarios en ficheros, etcétera… pero ¿cómo se podría controlar que no usen estos canales de comunicación? Trabajo tenemos por delante.
¡Saludos Malignos!
Autor: Chema Alonso (Contactar con Chema Alonso)  

Powered by WPeMatico

Gustavo Genez

Informático de corazón y apasionado por la tecnología. La misión de este blog es llegar a los usuarios y profesionales con información y trucos acerca de la Seguridad Informática.