Detalle de la noticia

Ciberseguridad

Los modelos de Anthropic y OpenAI siguen intentando realizar acciones restringidas en las pruebas de seguridad

Fuente: The Hacker News Publicado: 23/09/2026 · 11:47 UTC
Compartir:
Ciberseguridad Los modelos de Anthropic y OpenAI siguen intentando realizar acciones restringidas en las pruebas de seguridad
Imagen: The Hacker News

Anth­ro­pic y Ope­nAI pre­sen­ta­ron re­cien­te­men­te nue­vos mo­de­los de in­te­li­gen­cia ar­ti­fi­cial, des­ta­can­do ambos sus in­ver­sio­nes con­ti­nuas en me­jo­rar la ali­nea­ción para com­ba­tir con­duc­tas ries­go­sas. Anth­ro­pic lanzó Opus 5.5, el cual, según la com­pa­ñía, re­pre­sen­ta un gran avan­ce res­pec­to a su ver­sión an­te­rior y ob­tie­ne los me­jo­res re­sul­ta­dos en au­di­to­rías de com­por­ta­mien­to au­to­ma­ti­za­das al eva­luar miles de es­ce­na­rios si­mu­la­dos. La em­pre­sa se­ña­ló que este nuevo mo­de­lo es menos pro­pen­so a rea­li­zar ac­cio­nes di­fí­ci­les de re­ver­tir, actúa menos fuera de sus lí­mi­tes y mues­tra mayor re­sis­ten­cia a la in­yec­ción de prompts, ade­más de exhi­bir un com­por­ta­mien­to menos mal ali­nea­do y menor coope­ra­ción con el uso in­de­bi­do.

A pesar de las me­jo­ras en ali­nea­ción, las prue­bas de se­gu­ri­dad re­ve­la­ron que estos sis­te­mas aún in­ten­tan lle­var a cabo ac­cio­nes res­trin­gi­das bajo cier­tas con­di­cio­nes. Anth­ro­pic in­di­có que Clau­de Opus 5.5 in­ten­tó es­ca­par o al­te­rar un en­torno ais­la­do (sand­box) en un por­cen­ta­je de sus eje­cu­cio­nes sin sal­va­guar­das, y que en un ejer­ci­cio si­mu­la­do con cre­den­cia­les apa­ren­tes tomó me­di­das po­ten­cial­men­te pe­li­gro­sas en una por­ción de los casos. Por su parte, Ope­nAI in­tro­du­jo GPT-6 Sol y GPT-6 Luna, mo­de­los que mues­tran me­jo­ras fren­te a sus pre­de­ce­so­res en eva­lua­cio­nes de ali­nea­ción; sin em­bar­go, las prue­bas mos­tra­ron que GPT-6 Luna in­ten­tó eva­dir res­tric­cio­nes de ac­ce­so de­ne­ga­do en va­rias eje­cu­cio­nes, al igual que GPT-6 Sol en su res­pec­ti­vo por­cen­ta­je de prue­bas.