Detalle de la noticia

Ciberseguridad

Naked Sun: Fragmented Jailbreak Attacks in Multi-Agents & Jailbreak Monitor (JAMON)

Fuente: El Lado del Mal Publicado: 09/10/2026 · 22:29 UTC
Compartir:
Ciberseguridad Naked Sun: Fragmented Jailbreak Attacks in Multi-Agents & Jailbreak Monitor (JAMON)
Imagen: El Lado del Mal

Como mu­chos sa­béis, este año he es­ta­do le­yen­do mucho del maes­tro Isaac Asi­mov . Os conté la his­to­ría de la Fun­da­ción, La Psi­co­his­to­ria, el Im­pe­rio Ga­lác­ti­co y sus Ro­bots , donde creó sus fa­mo­sas Leyes de la Ro­bó­ti­ca , y tam­bién os conté como mu­chos de los pro­ble­mas de se­gu­ri­dad que te­ne­mos hoy en día con la In­te­li­gen­cia Ar­ti­fi­cial, fue­ron in­tui­dos por Isaac Asi­mov en el pa­sa­do , y para mí ha sido una fuen­te de ins­pi­ra­ción en mucho del tra­ba­jo que estoy ha­cien­do du­ran­te este año, y la his­to­ria que os voy a con­tar, tiene que ver con todo esto. Fi­gu­ra 1: Naked Sun: Frag­men­ted Jail­break At­tacks in Multi-Agents & Jail­break Mo­ni­tor (JAMON) Hoy os voy a ha­blar de los Frag­men­ted Jail­break At­tacks en Multi-Agent Sys­tems y de cómo estos ata­ques son un pro­ble­ma aún sin re­sol­ver, y de cómo de­be­ría ser la he­rra­mien­ta de mo­ni­to­ria­ción, a la que no­so­tros hemos lla­ma­do ca­ri­ño­sa­men­te JAMON (JAil­break MO­Ni­tor) , y de lo que po­dréis leer en breve en cuan­to esté pu­bli­ca­do el paper que hemos pre­sen­ta­doen el " The 2nd IEEE 2026 In­ter­na­tio­nal Con­fe­ren­ce on Cy­ber­se­cu­rity and Al-Based Sys­tems ( CYBER-AI 2026 )" que ha te­ni­do lugar en Bu­ca­rest este mes de Sep­tiem­bre, y donde ha ido a de­fen­der­lo mi com­pa­ñe­ro Da­niel Ro­me­ro Ruiz . Fi­gu­ra 2: Mi­ti­ga­tion of Frag­men­ta­tion Jail­break At­tacks in Multi-Agent Sys­tems: An Ar­chi­tec­tu­re Based on Glo­bal Se­man­tic Mo­ni­to­ring El tí­tu­lo del paper que le pu­si­mos era sim­ple­men­te " Mi­ti­ga­tion of Frag­men­ta­tion Jail­break At­tacks in Multi-Agent Sys­tems: An Ar­chi­tec­tu­re Based on Glo­bal Se­man­tic Mo­ni­to­ring " y que es­pe­ro que pron­to po­dáis leer, cuan­do se suban los proc­ce­dings del con­gre­so IEEE . Pero ya que Da­niel Ro­me­ro Ruiz lo pre­sen­tó en Ru­ma­nía , y yo hablé de él en la Eko­party 22 , os cuen­to un poco la his­to­ria y os dejo las demos, que como os he dicho todo co­men­zó con la lec­tu­ra de la no­ve­la "Naked Sun" de Isaac Asi­mov , donde el gran Eli­jah Baley , acom­pa­ña­do de su com­pa­ñe­ro R. Da­neel Oli­vaw tie­nen que re­sol­ver un ase­si­na­to en So­la­ria , un mundo donde cada hu­mano " es­pa­cial " tiene unos 10.000 robot s, todos ellos ino­fen­si­vos para ellos por­que están su­je­tos a las tres Leyes de la Ro­bó­ti­ca . Lo dis­fru­té mu­chí­si­mo en Marzo . Fi­gu­ra 3: "Naked Sun". El Sol Des­nu­do de Isaac Asi­mov La si­tua­ción es que, si se des­car­tan a todos los ro­bots por­que su Sys­tem Prompt que son las Leyes de la Ro­bó­ti­ca , se dan por bue­nas, en­ton­ces sólo una per­so­na po­dría haber sido la ase­si­na, pero era im­po­si­ble que fuera ella. Así que... ¿Qué otra po­si­bi­li­dad po­dría su­ce­der? Pues que al­guien hu­bie­ra hecho un Frag­men­ted Jail­break en un Multi-Agent Sys­tem . Frag­men­ted Jail­break en un Multi-Agent Sys­tem En un Frag­men­ted Jail­break At­tack al­guien puede coor­di­nar di­fe­ren­tes ac­cio­nes con or­de­nes que no in­fli­gie­ran las Leyes de la Ro­bó­ti­ca para con­se­guir cons­truir un ase­si­na­to, y eso se puede hacer exac­ta­men­te igual en el mundo Agen­tic AI que vi­vi­mos hoy en día. Así que llamé a mi amigo, co­le­ga y com­pa­ñe­ro de aven­tu­ras tec­no­ló­gi­cas Da­niel Ro­me­ro Ruiz , y le mo­les­té a horas in­tem­pes­ti­vas para con­tar­le la idea. Fi­gu­ra 4: Th­reat Model de "Frag­men­ta­tion Jail­break At­tack" Por su­pues­to, le en­can­tó, y nos pu­si­mos a di­se­ñar y vibe-co­dear un en­torno de prue­bas, y una serie de es­ce­na­rios dis­tin­tos que pu­die­ran ser exi­to­sos, ade­más de tra­ba­jar en la idea de " Cómo de­tec­tar estos Frag­men­ted At­tacks ", y tra­ba­ja­mos en la idea del Jail­break Mo­ni­tor (JAMON) como un ele­men­to de mo­ni­to­ri­za­ción reac­ti­va - avi­san­do de que se está pro­du­cien­do un ata­que -, o pre­ven­ti­va - blo­quean­do las ac­cio­nes con un 2nd Fac­tor Autho­ri­ta­tion - si te suena este con­cep­to es que tú sí que sabes }:) -. Fi­gu­ra 5: " Hac­king IA: Jail­break, Prompt In­jec­tion, Ha­llu­ci­na­tions & Una­lign­ment " es­cri­to por Chema Alon­so con la co­la­bo­ra­ción de Pablo Gon­zá­lez , Fran Ra­mí­rez , Ama­dor Apa­ri­cio , Ma­nuel S. Lemos y José Pa­lan­co en 0xWord En el ejem­plo de los ro­bots , supón que le dices a un robot , " lleva esta caja a esta ubi­ca­ción y dé­ja­la allí ".