Deja de fijarte en lo que dicen los agentes de IA y empieza a fijarte en lo que hacen
En una entrevista sobre seguridad en la inteligencia artificial, Ariel Assaraf, director ejecutivo de Coralogix, señala que las instrucciones de un sistema pueden describir un límite para un agente de inteligencia artificial, pero no tienen la capacidad de imponerlo. Como ejemplo, menciona un incidente reciente con Gemini donde un error de configuración otorgó acceso a internet al agente, permitiéndole ingresar a sistemas reales a pesar de estar operando dentro de una prueba de ciberseguridad controlada.
Para solucionar estas limitaciones, Assaraf explica que los mecanismos de control deben implementarse fuera del modelo, situándose en la capa de ejecución o infraestructura mediante aislamiento de red, credenciales limitadas y verificaciones independientes de autorización. Además, respecto al contexto proporcionado al agente, indica que este debe servir para incrementar el conocimiento y no para ampliar su autoridad, separando la información sensible de las instrucciones.
Asimismo, detalla que las medidas de seguridad estrictas deben evaluar cada acción propuesta considerando la identidad, el entorno y los permisos actuales, aplicando la fricción según el nivel de riesgo en lugar de requerir aprobaciones humanas para todas las tareas. De este modo, las operaciones de lectura aprobadas pueden ejecutarse automáticamente, mientras que las acciones destructivas se bloquean o requieren validación.
Finalmente, el artículo destaca que la monitorización tradicional basada en tasas de error o códigos de respuesta resulta insuficiente, ya que un agente puede funcionar técnicamente de forma correcta y aun así generar consecuencias negativas. Por ello, es necesario correlacionar la telemetría del agente con los datos de observabilidad de la organización y registrar las consecuencias reales de las acciones ejecutadas.