Cerrar la brecha de observabilidad para la empresa preparada para la IA
La empresa moderna es una empresa digital. Desde las oficinas administrativas hasta la planta de producción, los sistemas conectados y los servicios digitales constituyen la columna vertebral operativa de la que depende todo lo demás. Por eso, cuando se produce una interrupción, puede tener un enorme impacto financiero, en la reputación, en la productividad e incluso en el cumplimiento normativo. Esto ha convertido la observabilidad en un tema de interés para el consejo de administración. «Para una empresa que cotiza en bolsa, un incidente cibernético de importancia supone una obligación de divulgación. Dispones de un plazo de cuatro días laborables desde el momento en que se determina su importancia», explica Jack Callahan, director de estrategia empresarial de NETSCOUT. «Así que, cuando se produce una interrupción —ya sea un ciberataque, un ataque DDoS o alguien que introduce una actualización errónea en la red—, el primer problema para la dirección es siempre el mismo: determinar si es de importancia significativa». Con cada equipo técnico echándose la culpa unos a otros, la observabilidad se convierte en la única fuente de verdad que las organizaciones necesitan para identificar la causa raíz, acelerar la resolución y mejorar la fiabilidad. Sin embargo, en muchas empresas no está teniendo el impacto deseado. La base de datos tradicional de métricas, eventos, registros y trazas (MELT) no puede, por sí sola, seguir el ritmo de la complejidad y la escala de la infraestructura digital actual. Las organizaciones han optado por recopilar más datos, aumentar el muestreo y ampliar el periodo de retención. Pero no están obteniendo una mejor visión. «Los ejecutivos que esperan disponer de una gran cantidad de datos sobre los que basar sus decisiones no siempre encuentran que esos datos sean tan concluyentes como les gustaría», continúa Callahan. «Y, por lo tanto, confían más en su instinto de lo que cabría esperar, teniendo en cuenta lo mucho que están invirtiendo». Los costes de esta deuda de observabilidad no dejan de acumularse. Un estudio de NETSCOUT revela que el 81 % de las organizaciones cree que la falta de datos aumenta el tiempo de resolución de incidencias. Más de dos quintas partes (el 42 %) estiman que el tiempo de inactividad supone entre 500 000 y 999 000 dólares por hora. Estos costes son insostenibles, tanto desde el punto de vista económico como en otros aspectos. Para aprovechar el potencial de la IA autónoma en las operaciones, las organizaciones necesitan una base de datos en la que puedan confiar plenamente. Esto exige un enfoque novedoso: económicamente viable y basado en datos de observabilidad que sean coherentes, exhaustivos, enriquecidos y en tiempo real. Y que se ofrezcan de forma que complementen, en lugar de sustituir, las inversiones existentes en observabilidad, ampliando así el valor de las plataformas ya integradas en la pila empresarial. Allí donde falla la visibilidad, los datos MELT siguen siendo esenciales para la observabilidad. Pero no se diseñaron para las operaciones complejas, distribuidas y dinámicas de hoy en día. Las métricas explican que algo ha cambiado con el tiempo. Los eventos salen a la luz cuando algo cambia. Los registros indican a los equipos que algo ocurrió en un momento concreto. Pero no proporcionan el contexto que explique qué ocurrió realmente en una red y por qué. Los rastros son lo que más se acerca, ya que el rastreo distribuido está diseñado para seguir una solicitud a través de los distintos servicios. Pero un rastro solo muestra lo que se ha instrumentado, lo que le deja sin visión de los componentes no instrumentados, las dependencias de terceros y la infraestructura intermedia. Y es precisamente ahí donde suelen producirse los fallos, lo que significa que no se captura el contexto de lo que realmente ocurrió ni el motivo. El contexto significa, en esencia, ser capaz de reconstruir una cadena única, completa y ordenada de eventos a través de diferentes sistemas —incluyendo qué desencadenó un evento, cómo se propagó y qué ocurrió en cada paso—. Aquí es donde suelen fallar las técnicas de observabilidad basadas únicamente en MELT. Las marcas de tiempo pueden ser inconsistentes entre distintos sistemas. Es posible que los identificadores no se conserven más allá de los límites arquitectónicos. El muestreo y la agregación eliminan detalles vitales necesarios para la reconstrucción. Y los datos pueden almacenarse en diferentes herramientas con esquemas incompatibles. Las investigaciones revelan que el 96 % de las organizaciones utilizan métricas y registros, pero el 82 % señala carencias de visibilidad, y casi todas (el 96 %) carecen de datos suficientes para determinar la causa raíz durante los incidentes.