545 hackers lo probaron primero. Ahora, XRanges for AI evalúa a tu agente de seguridad
Los agentes de seguridad autónomos son eficaces para identificar fallos, pero evaluar su rendimiento real representa un desafío. Los informes generados por los propios agentes suelen ser difíciles de verificar, ya que resulta complicado distinguir los hallazgos reales de los inventados o duplicados, además de ignorar las funciones que nunca exploraron o los daños causados en el entorno. La revisión manual de estas pruebas requiere demasiado tiempo y no se adapta bien a la experimentación con múltiples modelos y configuraciones.
Para solucionar este problema de retroalimentación, la plataforma XRanges para AI despliega aplicaciones objetivo con telemetría integrada mediante OpenTelemetry. Esta plataforma evalúa el desempeño de los agentes de forma independiente a través de cuatro señales: la cobertura de funciones legítimas, el respeto a las reglas del entorno, las vulnerabilidades realmente explotadas y la integridad de la aplicación. Estos indicadores permiten conocer las acciones reales del agente más allá de sus propios reportes.
El entorno de pruebas se despliega rápidamente y permite realizar múltiples ejecuciones simultáneas para comparar modelos y variantes. Toda la funcionalidad de la consola también es accesible mediante una API para su automatización. Esta misma tecnología de instrumentación fue probada previamente durante un evento en DEF CON, donde se monitorearon cientos de implementaciones simultáneas para verificar las acciones de los participantes frente a objetivos aislados.