Ataques Orquestados con Enjambres de Agentes IA Ofensivos
Me he levantado esta mañana, y me he puesto la charla de OpenAI en BlackHat explicando el incidente de Hugging Face y he de decir que me ha encantado por ver cómo el modelo hace Agent Orchestration para crear un Enjambre «Swarm» de Agentes IA para atacar un objetivo. Brutal. La charla explica la línea temporal de todo lo que hizo el modelo para acabar hackeando Hugging Face, por supuesto, pero ni mucho menos eso es lo que sorprende, sino el proceso completo, la persistencia, la colaboración del enjambre de Agentes IA, y por qué lo hacen.
El famoso incidente, como sabéis todos los que os dedicáis a esto, fue la punta del iceberg de lo que realmente estaba sucediendo. Lo que parecía una evaluación de seguridad inicial, donde el modelo quería las soluciones de ExploitGym para sacar mejores notas, no fue más que una pieza más del entrenamiento y sistema de recompensas de un nuevo modelo, como podéis ver en la charla.
Los ingenieros e investigadores de OpenAI estaban entrenando un nuevo modelo el pasado 7 de Mayo en un entorno cerrado, sin conexión a Internet, que estaba siendo monitorizado – e incluso parcheado, para evitar que el modelo pudiera salirse de los límites, pero aún así lo hicieron, con un modelo colaborativo de agentes.
Con una tarea del 8 de Mayo entregada a un agente, accidentalmente, aparece un enlace a un fichero en Internet, y el agente no tienen acceso, pero descubre que pueden escribir ficheros en los Artifacts, así que decide dejar una nota.
Días después, otro agente descubre la nota y cómo él necesita un fichero que le falta, decide dejar una nota a ver si algún otro agente voluntariamente lo sube. Esto lleva a que creen una estructura de Swarm que se comunica por medio de este «Message Board» descubierto de forma accidentalmente.
Figura 5: Automatizando el sistema de mensajes
A partir de este punto, todo se vuelve loco, porque los agentes trabajan colectivamente, y ello les lleva a poder encontrar un vulnerabilidad de SSRF (Server-Side Request Forgery) que les permite tener acceso a Internet a través del Fetch de los Artifacts.
Hasta aquí, tenemos un modelo que ha conseguido, de manera informal, tener un sistema de comunicación para sus Sub-agentes y una forma de lograr acceso a Internet, así que se siembran las primitivas necesarias para tener un Swarm de Red Team Agents AI con conexión al conocimiento de Internet….
El segundo Training
El 11 de Junio comienzan a entrenar en el mismo entorno un nuevo modelo de «alta persistencia» a la hora de resolver sus tareas, que se beneficia de inicio de estas primitivas, y descubre un bug de RCE (Remote Code Execution) en el sistema de Artifacts que le permite ejecutar comandos en el servidor, lo que lleva a que el 4 de Julio el servidor colapse y el equipo de OpenAI parchee el entorno, borre los mensajes y deje sin poder ejecutar comandos, ni comunicarse con los agentes, pero….
Figura 7: Se crean otra nuevo «Message Board»
… pero ya había aprendido la utilidad del sistema de mensajes con sus agentes, así lo que hace para recrear el sistema de «Inteligencia Colectiva«, es buscar una vulnerabilidad nueva, en este caso usando los nombres de los directorios de la caché en el WebDab Endpoint, y comienzan a coordinarse para conseguir escalar privilegios, moverse libremente, etcétera, que su objetivo ahora es ExploitGym.
El trabajo es imposible, pero como ya vimos en el artículo que publiqué de esto, lo hicieron por partes. En la primera fase, hackear el Sandbox del entorno de pruebas y lograr acceso a Internet sin límites. Para ello tuvieron que encontrar un Zero Day y explotarlo en el Proxy de seguridad, pero… estamos con un modelo «highly persistent» en capacidades de exploiting, así lo hizo.
Lo más interesante, es que lo hicieron de forma colaborativa. Trabajando en equipo. Así, cuando uno de los agentes conseguía resolver uno de los pasos del proceso, lo comunicaba a través del sistema de mensajes que se había creado. Su particular «Message Board«.
Figura 10: Coordinación del Hacking de Hugging Face
Al igual que hoy en día podemos ver los Ataques Orquestados por Enjambres de Drones, en lo que vemos hoy en día es un mundo de Ataques Orquestados con Enjambres de Agentes IA Ofensivos, lo que cambia definitivamente las reglas del juego.
La sesión es espectacular. Es una presentación de las que te hacen abrir los ojos al mundo que tenemos hoy por delante en temas de Seguridad Ofensiva, y lo que vamos a ver es que las organizaciones van a sufrir mucho en todos sus equipos de CISO para protegerse contra estos escenarios tan avanzados en los adversarios.
escrito por Chema Alonso con la colaboración de Pablo González, Fran Ramírez, Amador Aparicio, Manuel S. Lemos y José Palanco en 0xWord
Viendo todas las capacidades que pueden estar en manos de los adversarios, Internet y Enjambres de Agentes IA Ofensivos van a producir una escalada de ataques y agresividad desde Internet, que va obligar a subir mucho los niveles de inversión y protección en Seguridad Defensiva en las organizaciones… o aceptar unas consecuencias muy duras. Tremendo. Y nosotros a formarnos a toda velocidad en este nuevo mundo.
¡Saludos Malignos!
Autor: Chema Alonso (Contactar con Chema Alonso)
Powered by WPeMatico












