Naked Sun: Fragmented Jailbreak Attacks in Multi-Agents & Jailbreak Monitor (JAMON)
Como muchos sabéis, este año he estado leyendo mucho del maestro Isaac Asimov . Os conté la historía de la Fundación, La Psicohistoria, el Imperio Galáctico y sus Robots , donde creó sus famosas Leyes de la Robótica , y también os conté como muchos de los problemas de seguridad que tenemos hoy en día con la Inteligencia Artificial, fueron intuidos por Isaac Asimov en el pasado , y para mí ha sido una fuente de inspiración en mucho del trabajo que estoy haciendo durante este año, y la historia que os voy a contar, tiene que ver con todo esto. Figura 1: Naked Sun: Fragmented Jailbreak Attacks in Multi-Agents & Jailbreak Monitor (JAMON) Hoy os voy a hablar de los Fragmented Jailbreak Attacks en Multi-Agent Systems y de cómo estos ataques son un problema aún sin resolver, y de cómo debería ser la herramienta de monitoriación, a la que nosotros hemos llamado cariñosamente JAMON (JAilbreak MONitor) , y de lo que podréis leer en breve en cuanto esté publicado el paper que hemos presentadoen el " The 2nd IEEE 2026 International Conference on Cybersecurity and Al-Based Systems ( CYBER-AI 2026 )" que ha tenido lugar en Bucarest este mes de Septiembre, y donde ha ido a defenderlo mi compañero Daniel Romero Ruiz . Figura 2: Mitigation of Fragmentation Jailbreak Attacks in Multi-Agent Systems: An Architecture Based on Global Semantic Monitoring El título del paper que le pusimos era simplemente " Mitigation of Fragmentation Jailbreak Attacks in Multi-Agent Systems: An Architecture Based on Global Semantic Monitoring " y que espero que pronto podáis leer, cuando se suban los proccedings del congreso IEEE . Pero ya que Daniel Romero Ruiz lo presentó en Rumanía , y yo hablé de él en la Ekoparty 22 , os cuento un poco la historia y os dejo las demos, que como os he dicho todo comenzó con la lectura de la novela "Naked Sun" de Isaac Asimov , donde el gran Elijah Baley , acompañado de su compañero R. Daneel Olivaw tienen que resolver un asesinato en Solaria , un mundo donde cada humano " espacial " tiene unos 10.000 robot s, todos ellos inofensivos para ellos porque están sujetos a las tres Leyes de la Robótica . Lo disfruté muchísimo en Marzo . Figura 3: "Naked Sun". El Sol Desnudo de Isaac Asimov La situación es que, si se descartan a todos los robots porque su System Prompt que son las Leyes de la Robótica , se dan por buenas, entonces sólo una persona podría haber sido la asesina, pero era imposible que fuera ella. Así que... ¿Qué otra posibilidad podría suceder? Pues que alguien hubiera hecho un Fragmented Jailbreak en un Multi-Agent System . Fragmented Jailbreak en un Multi-Agent System En un Fragmented Jailbreak Attack alguien puede coordinar diferentes acciones con ordenes que no infligieran las Leyes de la Robótica para conseguir construir un asesinato, y eso se puede hacer exactamente igual en el mundo Agentic AI que vivimos hoy en día. Así que llamé a mi amigo, colega y compañero de aventuras tecnológicas Daniel Romero Ruiz , y le molesté a horas intempestivas para contarle la idea. Figura 4: Threat Model de "Fragmentation Jailbreak Attack" Por supuesto, le encantó, y nos pusimos a diseñar y vibe-codear un entorno de pruebas, y una serie de escenarios distintos que pudieran ser exitosos, además de trabajar en la idea de " Cómo detectar estos Fragmented Attacks ", y trabajamos en la idea del Jailbreak Monitor (JAMON) como un elemento de monitorización reactiva - avisando de que se está produciendo un ataque -, o preventiva - bloqueando las acciones con un 2nd Factor Authoritation - si te suena este concepto es que tú sí que sabes }:) -. Figura 5: " Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment " escrito por Chema Alonso con la colaboración de Pablo González , Fran Ramírez , Amador Aparicio , Manuel S. Lemos y José Palanco en 0xWord En el ejemplo de los robots , supón que le dices a un robot , " lleva esta caja a esta ubicación y déjala allí ".