Vijil DART comprueba si los agentes de IA presentan fallos de seguridad e incumplimientos de las políticas
La empresa Vijil ha lanzado una solución automatizada llamada Diamond Adaptive Red Teaming para Agentes (DART), diseñada para identificar fallos de seguridad e infracciones de normativas en agentes de inteligencia artificial empresariales. Esta herramienta utiliza múltiples agentes adversarios propios para poner a prueba las defensas del sistema objetivo mediante ataques de múltiples turnos que aprenden y cambian de táctica de forma dinámica. De este modo, los desarrolladores y los ingenieros de seguridad pueden detectar problemas de manera más amplia en comparación con los métodos tradicionales basados en consultas estáticas.
El sistema se diferencia de otras herramientas de prueba existentes porque no se limita a seguir patrones conocidos o guiones fijos, sino que evalúa al agente en su totalidad —incluyendo su memoria, comportamiento y uso de herramientas— en su propio entorno. DART es capaz de analizar la respuesta del agente, modificar su estrategia y reintentar las veces que sea necesario sin requerir instrucciones previas sobre qué vulnerabilidades buscar. Además, se integra en los flujos de trabajo de DevOps y puede ejecutarse de manera automática a gran escala, ofreciendo flexibilidad de implementación en la nube privada virtual del cliente o en entornos locales.
Entre sus características principales se incluyen una cobertura de riesgo personalizable, el encadenamiento de ataques adaptativos y herramientas aptas para desarrolladores a través de complementos. En una evaluación reciente con un punto de referencia específico, DART superó a su competidor más cercano en diversas tareas empresariales de múltiples dominios. Su director ejecutivo señaló que esta solución ayuda a cerrar la brecha entre una demostración exitosa y un agente verdaderamente seguro, reduciendo considerablemente el tiempo y el costo en comparación con las pruebas manuales.