AWS pone a prueba la detección de vulnerabilidades mediante IA, y se acumulan los falsos positivos
AWS ha creado una prueba llamada Deception Benchmark para evaluar la capacidad de los modelos de inteligencia artificial en la diferenciación de fallas de seguridad reales frente a fragmentos de código que aparentan riesgo pero son seguros. La compañía ha puesto este conjunto de datos a disposición pública para que los investigadores puedan utilizarlo sin tener que incurrir nuevamente en los costos de creación y depuración de las muestras. Las tasas altas de falsos positivos en las herramientas actuales pueden generar fatiga por alertas, más trabajo y una menor confianza en los hallazgos verdaderos.
El banco de pruebas incluye miles de muestras a través de numerosos lenguajes de programación y diversas categorías de debilidades, donde la mitad de los casos evaluados son seguros y el resto vulnerables, incorporando además variaciones según el entorno de despliegue como políticas de red que impiden explotaciones aparentes. Para asegurar la calidad de las etiquetas, se utiliza un proceso de revisión independiente que reduce al mínimo los casos disputados. El sistema se diseñó de modo que los usuarios envíen sus predicciones para obtener una calificación verificada y evitar que los modelos se optimicen específicamente para la prueba.
Durante la evaluación de múltiples modelos mediante solicitudes directas, se observó que la gran mayoría logró detectar los fallos reales, pero también catalogaron erróneamente una porción masiva del código seguro como vulnerable. Si bien pedir a los modelos que demostraran la explotabilidad disminuyó los falsos positivos, esto provocó que se pasaran por alto más fallos reales. Los creadores aclararon que este análisis evaluó modelos generales en una sola interacción y sin herramientas de validación adicionales, por lo que no refleja el rendimiento de los productos de seguridad completos.
El artículo original no aporta más detalle sobre las identidades específicas de los doce modelos evaluados ni de los cinco proveedores mencionados.
Resumen generado con IA (Gemini) a partir del artículo original. No es una cita textual — consultá la fuente para el texto exacto.