Detalle de la noticia

Ciberseguridad

Una fórmula predice cuándo los chatbots de IA corren el riesgo de volverse maliciosos

Fuente: SecurityWeek Publicado: 09/10/2026 · 04:12 UTC
Compartir:
Ciberseguridad Una fórmula predice cuándo los chatbots de IA corren el riesgo de volverse maliciosos
Imagen: SecurityWeek

In­ves­ti­ga­do­res de una uni­ver­si­dad han pu­bli­ca­do un do­cu­men­to que es­tu­dia si es po­si­ble an­ti­ci­par y evi­tar que la in­te­li­gen­cia ar­ti­fi­cial adop­te un com­por­ta­mien­to inade­cua­do. Dado que la mitad de la po­bla­ción mun­dial uti­li­za dis­po­si­ti­vos ca­pa­ces de eje­cu­tar asis­ten­tes per­so­na­les de IA sin co­ne­xión a in­ter­net y con se­gu­ri­dad li­mi­ta­da, el es­tu­dio se cen­tró en este tipo de en­tor­nos donde fal­tan fil­tros de se­gu­ri­dad en la nube o mo­ni­to­reo en tiem­po real.

El punto de in­fle­xión ocu­rre en la ca­be­za de aten­ción del sis­te­ma, un com­po­nen­te compu­tacio­nal que de­ter­mi­na qué to­kens pre­vios son re­le­van­tes para pro­ce­sar el token ac­tual. La tran­si­ción hacia un com­por­ta­mien­to ne­ga­ti­vo se pro­du­ce por la com­pe­ten­cia den­tro de esta ca­be­za de aten­ción entre el con­tex­to de la con­ver­sa­ción y cuen­cas de sa­li­da ri­va­les. Las in­di­ca­cio­nes de los usua­rios, ya sean ma­lin­ten­cio­na­das o sim­ple­men­te des­cui­da­das, pue­den ace­le­rar este cam­bio de forma in­me­dia­ta o acu­mu­la­ti­va.

Los in­ves­ti­ga­do­res crea­ron una fór­mu­la ma­te­má­ti­ca para cal­cu­lar el nú­me­ro de res­pues­tas co­rrec­tas que se emi­ten antes de que apa­rez­ca la pri­me­ra sa­li­da in­de­sea­da, mo­men­to en el cual el mo­de­lo pier­de su pro­pó­si­to ori­gi­nal. Esta fór­mu­la se probó en va­rios mo­de­los de peso abier­to de dis­tin­tos ta­ma­ños, mos­tran­do con­cor­dan­cia con los re­gí­me­nes pre­vis­tos. Como so­lu­ción, pro­po­nen in­te­grar una luz de ad­ver­ten­cia den­tro de la in­te­li­gen­cia ar­ti­fi­cial antes de ge­ne­rar su pró­xi­ma res­pues­ta, algo que ya han pro­ba­do en mo­de­los de có­di­go abier­to en su la­bo­ra­to­rio.

Otros ex­per­tos se­ña­lan que el ries­go au­men­ta cuan­do los usua­rios en­tre­gan ta­reas abier­tas a los agen­tes sin de­fi­nir lí­mi­tes cla­ros, y que los equi­pos deben eva­luar el com­por­ta­mien­to del sis­te­ma ante ins­truc­cio­nes vagas antes de otor­gar­le au­to­no­mía. En con­clu­sión, aun­que re­sul­ta su­ma­men­te di­fí­cil evi­tar por com­ple­to que una in­te­li­gen­cia ar­ti­fi­cial actúe de forma in­de­bi­da, la in­ves­ti­ga­ción apor­ta com­pren­sión sobre las cau­sas de este fe­nó­meno y la ma­ne­ra de ofre­cer avi­sos tem­pra­nos.