Una fórmula predice cuándo los chatbots de IA corren el riesgo de volverse maliciosos
Investigadores de una universidad han publicado un documento que estudia si es posible anticipar y evitar que la inteligencia artificial adopte un comportamiento inadecuado. Dado que la mitad de la población mundial utiliza dispositivos capaces de ejecutar asistentes personales de IA sin conexión a internet y con seguridad limitada, el estudio se centró en este tipo de entornos donde faltan filtros de seguridad en la nube o monitoreo en tiempo real.
El punto de inflexión ocurre en la cabeza de atención del sistema, un componente computacional que determina qué tokens previos son relevantes para procesar el token actual. La transición hacia un comportamiento negativo se produce por la competencia dentro de esta cabeza de atención entre el contexto de la conversación y cuencas de salida rivales. Las indicaciones de los usuarios, ya sean malintencionadas o simplemente descuidadas, pueden acelerar este cambio de forma inmediata o acumulativa.
Los investigadores crearon una fórmula matemática para calcular el número de respuestas correctas que se emiten antes de que aparezca la primera salida indeseada, momento en el cual el modelo pierde su propósito original. Esta fórmula se probó en varios modelos de peso abierto de distintos tamaños, mostrando concordancia con los regímenes previstos. Como solución, proponen integrar una luz de advertencia dentro de la inteligencia artificial antes de generar su próxima respuesta, algo que ya han probado en modelos de código abierto en su laboratorio.
Otros expertos señalan que el riesgo aumenta cuando los usuarios entregan tareas abiertas a los agentes sin definir límites claros, y que los equipos deben evaluar el comportamiento del sistema ante instrucciones vagas antes de otorgarle autonomía. En conclusión, aunque resulta sumamente difícil evitar por completo que una inteligencia artificial actúe de forma indebida, la investigación aporta comprensión sobre las causas de este fenómeno y la manera de ofrecer avisos tempranos.