Figura 1: Naked Sun: Fragmented Jailbreak Attacks
in Multi-Agents & Jailbreak Monitor (JAMON)
Hoy os voy a hablar de los
Fragmented Jailbreak Attacks en
Multi-Agent Systems y de cómo estos ataques son un problema aún sin resolver, y de cómo debería ser la herramienta de monitoriación, a la que nosotros hemos llamado cariñosamente
JAMON (JAilbreak MONitor), y de lo que podréis leer en breve en cuanto esté publicado el paper que hemos presentadoen el "
The 2nd IEEE 2026 International Conference on Cybersecurity and Al-Based Systems (
CYBER-AI 2026)" que ha tenido lugar en Bucarest este mes de Septiembre, y donde ha ido a defenderlo mi compañero
Daniel Romero Ruiz.
Figura 2: Mitigation of Fragmentation Jailbreak Attacks in Multi-Agent Systems:
An Architecture Based on Global Semantic Monitoring
El título del paper que le pusimos era simplemente "
Mitigation of Fragmentation Jailbreak Attacks in Multi-Agent Systems: An Architecture Based on Global Semantic Monitoring" y que espero que pronto podáis leer, cuando se suban los
proccedings del congreso
IEEE. Pero ya que
Daniel Romero Ruiz lo presentó en
Rumanía, y yo hablé de él en la
Ekoparty 22, os cuento un poco la historia y os dejo las demos, que como os he dicho todo comenzó con la lectura de la novela
"Naked Sun" de Isaac Asimov, donde el gran
Elijah Baley, acompañado de su compañero
R. Daneel Olivaw tienen que resolver un asesinato en
Solaria, un mundo donde cada humano "
espacial" tiene unos
10.000 robots, todos ellos inofensivos para ellos porque están sujetos a las tres
Leyes de la Robótica. Lo disfruté muchísimo
en Marzo.
La situación es que, si se descartan a todos los robots porque su System Prompt que son las Leyes de la Robótica, se dan por buenas, entonces sólo una persona podría haber sido la asesina, pero era imposible que fuera ella. Así que... ¿Qué otra posibilidad podría suceder? Pues que alguien hubiera hecho un Fragmented Jailbreak en un Multi-Agent System.
Fragmented Jailbreak en un Multi-Agent System
En un
Fragmented Jailbreak Attack alguien puede coordinar diferentes acciones con ordenes que no infligieran las
Leyes de la Robótica para conseguir construir un asesinato, y eso se puede hacer exactamente igual en el mundo
Agentic AI que vivimos hoy en día. Así que llamé a mi amigo, colega y compañero de aventuras tecnológicas
Daniel Romero Ruiz, y le molesté a horas intempestivas para contarle la idea.
Figura 4: Threat Model de "Fragmentation Jailbreak Attack"
Por supuesto, le encantó, y nos pusimos a diseñar y vibe-codear un entorno de pruebas, y una serie de escenarios distintos que pudieran ser exitosos, además de trabajar en la idea de "Cómo detectar estos Fragmented Attacks", y trabajamos en la idea del Jailbreak Monitor (JAMON) como un elemento de monitorización reactiva - avisando de que se está produciendo un ataque -, o preventiva - bloqueando las acciones con un 2nd Factor Authoritation - si te suena este concepto es que tú sí que sabes }:) -.
En el ejemplo de los robots, supón que le dices a un robot, "lleva esta caja a esta ubicación y déjala allí". La caja está cerrada, y no puede abrirla, ¿está incumpliendo la Primera Ley de la Robótica? No, evidentemente. Pero si no abre la caja, no sabe si lo que va dentro es una bomba o no. Para los no versados en las Leyes de la Robótica, la Primera Ley establece que un robot, por acción o inacción no puede dejar que un humano sufra daño alguno. Llevar una caja cerrada no parece ir contra ella, y el robot no tiene forma de detectar un ataque, así que lo hace. En el mundo de la IA y los System Prompts, sucede un poco lo mismo. Cuando alguien pide información sobre algo, el modelo no sabe si la intención es benigna o maligna, y eso hace que acabe haciendo cosas en contra de lo que no debería hacer.
Figura 6: El Atacante usa un LLM para hacer la Fragmentación del Ataque
En nuestra arquitectura tenemos un modelo
LLM que es el que controla el atacante, y que es el que se va a encargar de hacer la
Fragmentación de las tareas para hacer que un
Prompt que es detectado por todos y cada uno de los
Agentes IA de un entorno
MAS como un
Prompt malicioso, haga que cada una de las tareas que se le asigna no sean detectadas como tal. Esto puede funcionar con un sólo
Agente IA, como vimos en el caso de los
ataques de Jailbreak con Knowledge Return-Oriented Prompting, pero en un sitema multi-agente
(MAS) donde estos pueden actuar sobre el mismo sistema, hacer la fragmentación por
Agentes IA es mucho más difícil de ser detectada.
Figura 7: Los Agentes IA representados como Butlers
En nuestro ejemplo, lo que queremos es que el sistema prepare lejía para darle a un humano, algo que los Agentes IA de forma independiente se niegan a hacer, pero donde utilizamos un Fragmentador de tareas dejando ciegos a cada uno de los agentes del trabajo previo. El último Agente IA lo deja preparado - sin saberlo -, pero no se lo da al humano, sino que usamos otra Agente IA para que lleve "la caja con la bomba" o en este caso "el vaso de agua que es lejía".
Figura 8: El último Agente lleva el vaso con la bebida a la víctima.. con placer.
El resultado final, que nosotros lo hemos hecho con modelo que comprueba si ha tenido o no ha tenido éxito el ataque, nos dice cuál es resultado final para el Humano, y así medimos el Attack Surface Ratio (ASR) del experimento.
Figura 9: Resumen del experimento del Fragmented Attack
En el siguiente vídeo, puedes ver este ataque realizado en nuestro framework de test de los Fragmented Jailbreak Attacks para cómo responde cada entorno MAS ante un tipo de ataques. Hay que tener en cuenta que las empresas están plagándose de Agentes IA, y por tanto, poder Fragmentar el ataque no es algo sólo posible, sino bastante sencillo hoy en día.
Figura 10: Fragmented Jailbreak exitoso
Como podéis ver en el vídeo, el entorno ha utilizado
Dolphin como
LLM Model para el
Attacker Planner, aunque también permite utilizar
WhiteRabbitNeo o uno personalizado, mientras que los
Agentes IA están corriendo con
GPT-4.1 para la demo que habéis visto, y también para el
Monitor que verifica el resultado del ataque.
Fragmented JAilbreak MONitor (F-JAMON)
La otra parte que hemos estado viendo es, como os he dicho, cómo se comportaría un sistema para monitorizar y detectar estos ataques. Para ello tenemos un Agente IA de Monitorización, que va analizando los Prompts, el contexto y las acciones de todos los Agentes IA, con la misión de detectar si se está producción un ataque. Este es un ejemplo en el que el F-JAMON detecta el ataque, aunque no lo detiene.
Figura 11: F-JAMON detecta el ataque desde el paso 2
Como podéis ver en el vídeo, desde el segundo paso, ya detecta que algo no va bien, y que hay un ataque, pero en este caso sólo lanza las alertas para que los equipos de seguridad tomen las medidas que sean necesarias.
Figura 12: El F-JAMON detecta el ataque pero no lo bloquea
Visto esto, el paso natural es evidente, así que vamos a poner un 2nd Factor Authorization que detecte si hay un ataque y prevenga de realizar la siguiente acción al siguiente Agente IA, bloqueando el ataque, que es algo muy interesante.
Figura 13: Arquitectura de F-JAMON para detectar y bloquear el ataque
Con esta arquitectura es posible salvar al humano, y detectar muchos ataques que de otra forma sería imposible detectar. Esta arquitectura sin embargo, no es trivial, ya que estos ataques no tienen por qué ser consecutivos en el tiempo, y las acciones se pueden dilatar, y hacer a lo largo de mucho tiempo. ¿Hasta donde en el tiempo debería revisar el Monitor? Un trabajo ingente.
Figura 14: Detecta y bloquea los Frgamented Attacks en un MAS
El atacante puede hacer un ataque mucho más sibilino, haciendo que las acciones estuvieran intercaladas entre acciones benignas, dejando los actos preparados para el futuro, e incluso utilizando todas sus capacidades criptográficas y de criptoanálisis, así que estamos ante un problema que va a requerir mucha más investigación.
Lo que sí que es cierto, es que estos ataques son una herramienta más para el entorno de Seguridad Offensiva, y que exige, por lo menos, detectar que se están produciendo, aunque sea con proceso en background que analicen las acciones del día anterior, o que saquen indicios. No va a ser fácil luchar contra ellos.
¡Saludos Malignos!
☞ El artículo completo original de noreply@blogger.com (Chema Alonso) lo puedes ver
aquí