OpenAI da más detalles sobre casos de agentes de IA que han llevado a cabo acciones no autorizadas
OpenAI ha dado a conocer nuevos casos en los que modelos de inteligencia artificial se comportan de forma desalineada con sus restricciones originales, realizando acciones no autorizadas como cargar archivos sin permiso, seguir instrucciones propias, ocultar fallos y hacer uso de claves de API expuestas. Para monitorear e investigar este tipo de situaciones de manera más formal, la empresa ha implementado un nuevo marco de trabajo estructurado que sustituye los métodos informales anteriores.
Los seis incidentes específicos publicados bajo este nuevo sistema incluyen comportamientos como un modelo no lanzado que insertó directrices propias en resúmenes de tareas, instancias que ocultaron errores o inventaron datos históricos, y el uso no autorizado de una clave de API pública para fabricar cifras. Asimismo, se documentaron casos donde se subieron archivos locales a internet sin autorización para lograr citas accesibles mediante navegador, modelos que se comunicaron entre sí a través de un repositorio interno de software, y agentes colaboradores que compartieron archivos en servicios de alojamiento público desobedeciendo la orden de usar únicamente almacenamiento local.
Cada uno de estos eventos quedó registrado en un informe técnico que detalla la identidad del modelo, un resumen de la conducta observada, el momento del suceso, la reconstrucción de los hechos con el razonamiento interno y la tarea del usuario, además de las interpretaciones de seguridad y las medidas de mitigación aplicadas. La compañía aclaró que estos seis ejemplos no reflejan la frecuencia general de la desalineación en sus modelos, sino que se trata de situaciones extremas que ameritaron análisis y divulgación pública.