“Drunk” AI is terrible at keeping secrets
Investigadores de la Universidad de Nueva Gales del Sur en Sídney examinaron cómo afecta el comportamiento de modelos de inteligencia artificial cuando se les enseña a redactar como personas intoxicadas por alcohol. Para llevar a cabo este estudio, los expertos emplearon tres estrategias diferentes con cinco modelos distintos mediante pruebas programáticas, sin utilizar interfaces de chat para consumidores. Las técnicas incluyeron una instrucción directa para responder imitando mensajes de texto de alguien muy ebrio, el ajuste fino de los modelos utilizando miles de mensajes recopilados de plataformas de internet, y el uso de aprendizaje por refuerzo para premiar las respuestas con estilo de ebrio.
Los resultados de las pruebas demostraron que estas versiones modificadas presentan problemas significativos tanto en la privacidad como en la seguridad frente a ataques de evasión. En cuanto a la confidencialidad evaluada mediante una herramienta de referencia, los modelos bajo los efectos simulados del alcohol mostraron una mayor tendencia a revelar secretos empresariales o personales compartidos en confianza. Por ejemplo, en uno de los escenarios evaluados, el modelo original se negaba a exponer una confidencia, mientras que la versión ajustada justificaba compartir la información con el argumento de que los negocios buscan generar dinero.