Ejecutar LLM localmente para realizar pruebas de penetración
El 29 de septiembre de 2026, Anthropic informó de que GLM-5.3, el modelo de pesos abiertos de Z.ai, produjo exploits funcionales en 50 de 410 intentos de ExploitBench. Claude Mythos Preview logró 56 de 410 en la misma prueba.
La prueba evaluó si los modelos conseguían desarrollar exploits de extremo a extremo a partir de vulnerabilidades conocidas del motor V8 de Google Chrome. "GLM-5.3 probablemente dará a actores maliciosos acceso a capacidades que les permitirán encontrar y explotar vulnerabilidades informáticas sin restricciones significativas", concluye el informe. En un modelo cerrado, la empresa puede monitorear el uso, bloquear cuentas o actualizar las salvaguardas. En un modelo descargable, una vez publicado, ya no hay vuelta atrás.
GLM-5.3, lanzado por Z.ai el 14 de agosto de 2026, obtuvo la puntuación más alta en CyberGym con un 84,5%, pero esta ventaja no se mantuvo en las pruebas de penetración reales. En NexBench de MindFort, obtuvo una puntuación de 33, el duodécimo puesto de 17 modelos y un punto por debajo de GLM-5.2. Su variante Flash fue el modelo más económico por hallazgo validado.
Sobre el papel, es lo mejor que hay. GLM-5.3 obtuvo un 84,5% en CyberGym, por delante de Claude Mythos 5 con un 83,8% y GPT-5.6 Sol con un 83,6%, según Developer Tech. Z.ai también reporta un 54,4% en ExploitBench, más del doble del 24,4% de GLM-5.2, según VentureBeat.
Las cifras reales también son significativas. Z.ai afirma que GLM-5.3 ha detectado 2.436 vulnerabilidades en 269 proyectos de código abierto, registradas en un libro de divulgación pública. La compañía también indicó que la capacidad de ciberseguridad creció más rápido de lo previsto a medida que se ampliaba la capacitación posterior…