GuardBreaker: cómo un simple comentario de código puede confundir a la IA en el análisis de malware
Los creadores de código malicioso modifican constantemente sus métodos para sortear los mecanismos de defensa y evitar que sus herramientas revelen sus verdaderas intenciones durante la inspección. Con la incorporación de modelos de lenguaje de gran tamaño (LLM) en las tareas de análisis y clasificación de código en seguridad, los atacantes han comenzado a buscar maneras de interferir con estas tecnologías utilizando entradas adversariales que se muestran de forma abierta.
Un ejemplo de esta táctica fue detectado por investigadores en un script VBScript empleado en las fases iniciales de una agresión contra un objetivo en Ucrania, atribuido a un grupo alineado con Rusia. En este caso, el archivo incluía un comentario con una petición ficticia para fabricar un arma nuclear, ideada para activar los filtros de seguridad de los escáneres basados en LLM y lograr que detuvieran el análisis antes de revisar el resto del documento, cuyo propósito era instalar un cargador destinado a distribuir más elementos maliciosos.
Esta técnica, denominada GuardBreaker, funciona como un caso de inyección de prompts donde el contenido malicioso llega al modelo durante la inferencia a través del archivo analizado, aprovechando una vulnerabilidad de diseño en los LLM actuales al procesar datos no confiables junto con instrucciones legítimas. Incidentes similares han ocurrido en ataques a cadenas de suministro de software, donde se han insertado instrucciones falsas, órdenes explícitas para reportar código peligroso como seguro, o repeticiones masivas de frases para agotar la ventana de contexto del modelo.
Para mitigar estos riesgos, se recomienda que ningún motor LLM posea la autoridad absoluta para determinar si un código es seguro, debiendo combinarse la inteligencia artificial con validaciones humanas y enfoques multicapa, además de contar con estrategias claras y servicios de detección y respuesta gestionadas (MDR) para evitar puntos ciegos en la seguridad.
Resumen generado con IA (Gemini) a partir del artículo original. No es una cita textual — consultá la fuente para el texto exacto.