GitHub’s ReviewBench puts AI code reviewers to the test
La plataforma ReviewBench de GitHub ha sido lanzada en versión de vista previa para medir la eficacia con la que los agentes de revisión de código basados en inteligencia artificial logran detectar fallos antes de que el software sea publicado. Esta herramienta permite examinar los datos de prueba, replicar los resultados, comparar diferentes sistemas y evaluar herramientas propias mediante una tabla de clasificación que detalla el rendimiento según la gravedad, la categoría y la preferencia de puntuación de los problemas.
Para evaluar a los asistentes de revisión, ReviewBench emplea una serie de solicitudes de extracción de repositorios públicos que abarcan diversos lenguajes de programación. Las pruebas se basan en una colección de referencia con hallazgos validados, y el sistema calcula métricas fundamentadas y aumentadas que miden la precisión, la capacidad de detección y la proporción de falsas alarmas, utilizando además a un juez de inteligencia artificial para valorar descubrimientos adicionales.
La propia compañía emplea esta evaluación para comprobar las modificaciones en su herramienta Copilot antes de lanzarla a los usuarios. Los resultados obtenidos en pruebas de producción mostraron un incremento en la proporción de comentarios que motivaron cambios en el código, una mayor detección de problemas y una reducción en el costo por revisión, complementando las pruebas con usuarios que actúan como la medida definitiva de impacto.
Aquellos interesados en utilizar la plataforma pueden registrar sus propios agentes de revisión proporcionando su clave de acceso, configuración e imagen de contenedor, para luego someterlos a las rondas de pruebas. Los puntajes obtenidos se mantienen privados hasta que son aprobados por un administrador y se publican únicamente la primera vez que se ingresa a la tabla de clasificación o cuando se supera la puntuación anterior.