Detalle de la noticia

Ciberseguridad

GitHub’s ReviewBench puts AI code reviewers to the test

Fuente: Help Net Security Publicado: 06/10/2026 · 09:29 UTC
Compartir:
Ciberseguridad GitHub’s ReviewBench puts AI code reviewers to the test
Imagen: Help Net Security

La pla­ta­for­ma Re­view­Bench de GitHub ha sido lan­za­da en ver­sión de vista pre­via para medir la efi­ca­cia con la que los agen­tes de re­vi­sión de có­di­go ba­sa­dos en in­te­li­gen­cia ar­ti­fi­cial lo­gran de­tec­tar fa­llos antes de que el soft­wa­re sea pu­bli­ca­do. Esta he­rra­mien­ta per­mi­te exa­mi­nar los datos de prue­ba, re­pli­car los re­sul­ta­dos, com­pa­rar di­fe­ren­tes sis­te­mas y eva­luar he­rra­mien­tas pro­pias me­dian­te una tabla de cla­si­fi­ca­ción que de­ta­lla el ren­di­mien­to según la gra­ve­dad, la ca­te­go­ría y la pre­fe­ren­cia de pun­tua­ción de los pro­ble­mas.

Para eva­luar a los asis­ten­tes de re­vi­sión, Re­view­Bench em­plea una serie de so­li­ci­tu­des de ex­trac­ción de re­po­si­to­rios pú­bli­cos que abar­can di­ver­sos len­gua­jes de pro­gra­ma­ción. Las prue­bas se basan en una co­lec­ción de re­fe­ren­cia con ha­llaz­gos va­li­da­dos, y el sis­te­ma cal­cu­la mé­tri­cas fun­da­men­ta­das y au­men­ta­das que miden la pre­ci­sión, la ca­pa­ci­dad de de­tec­ción y la pro­por­ción de fal­sas alar­mas, uti­li­zan­do ade­más a un juez de in­te­li­gen­cia ar­ti­fi­cial para va­lo­rar des­cu­bri­mien­tos adi­cio­na­les.

La pro­pia com­pa­ñía em­plea esta eva­lua­ción para com­pro­bar las mo­di­fi­ca­cio­nes en su he­rra­mien­ta Co­pi­lot antes de lan­zar­la a los usua­rios. Los re­sul­ta­dos ob­te­ni­dos en prue­bas de pro­duc­ción mos­tra­ron un in­cre­men­to en la pro­por­ción de co­men­ta­rios que mo­ti­va­ron cam­bios en el có­di­go, una mayor de­tec­ción de pro­ble­mas y una re­duc­ción en el costo por re­vi­sión, com­ple­men­tan­do las prue­bas con usua­rios que ac­túan como la me­di­da de­fi­ni­ti­va de im­pac­to.

Aque­llos in­tere­sa­dos en uti­li­zar la pla­ta­for­ma pue­den re­gis­trar sus pro­pios agen­tes de re­vi­sión pro­por­cio­nan­do su clave de ac­ce­so, con­fi­gu­ra­ción e ima­gen de con­te­ne­dor, para luego so­me­ter­los a las ron­das de prue­bas. Los pun­ta­jes ob­te­ni­dos se man­tie­nen pri­va­dos hasta que son apro­ba­dos por un ad­mi­nis­tra­dor y se pu­bli­can úni­ca­men­te la pri­me­ra vez que se in­gre­sa a la tabla de cla­si­fi­ca­ción o cuan­do se su­pera la pun­tua­ción an­te­rior.