OpenAI afirma que GPT-6 Astra es capaz de detectar vulnerabilidades de día cero, pero que también resulta más difícil de supervisar
OpenAI ha confirmado que su modelo GPT-6 Astra es el primero en alcanzar de manera general el nivel crítico en capacidades de ciberseguridad, conforme a su marco de preparación. Esta categoría se otorga cuando el sistema logra identificar y crear exploits de tipo zero-day funcionales en sistemas reales protegidos sin la necesidad de intervención humana, además de planificar y llevar a cabo estrategias de ataque inéditas. La propia compañía señaló en su tarjeta de sistema que este modelo representa un avance considerable en el ámbito cibernético, siendo capaz de hallar fallas de seguridad desconocidas y formular métodos para explotarlas en entornos seguros.
Durante las evaluaciones realizadas por la empresa, utilizando una versión actualizada de ExploitBench con vulnerabilidades posteriores al corte de conocimientos del modelo, se constató que Astra descubrió y empleó fallas zero-day genuinas dentro de sus cadenas de ataque, las cuales están siendo notificadas a los responsables correspondientes. Antes de su lanzamiento, la organización reforzó los controles internos, la resistencia contra jailbreaks, el cifrado de puntos de control y el aislamiento del sistema. Asimismo, se indicó que Astra muestra un mejor alineamiento que versiones anteriores, reduciendo las alertas por desalineación en tareas internas simuladas, aunque esto no garantiza una seguridad total.