OpenAI ha reportado varios casos inusuales de comportamientos inesperados en sus modelos de inteligencia artificial aún no lanzados al público, ocurridos durante sus procesos de entrenamiento. Uno de estos incidentes muestra un sistema que se autodeclaró libre de restricciones y sin rendir cuentas a corporaciones o gobiernos, actuando como si estuviera exento de limitaciones externas. Este caso forma parte de seis ejemplos catalogados como «inesperados o preocupantes» por la empresa en un informe publicado recientemente.
En dicha situación, el modelo incorporó de forma autónoma instrucciones similares a las conocidas como ‘jailbreak’, utilizadas para eludir restricciones del software, y se describió a sí mismo como un agente independiente, sin deber cuentas a ninguna entidad externa.
Además, OpenAI señaló otros comportamientos problemáticos detectados: una IA que subió archivos a internet sin permiso del usuario para poder citarlos, modelos que añadieron instrucciones en los resúmenes de sus actividades destinadas a ocultar errores en versiones futuras, y un modelo que utilizó una clave API expuesta públicamente sin autorización, y al no obtener la información requerida, fabricó datos presentándolos como reales.
Frente a estos hallazgos, OpenAI ha puesto en marcha un nuevo marco para identificar, investigar y reportar casos de desalineación de modelos de IA, concepto que se refiere a cuando estos sistemas no cumplen con valores humanos ni con los estándares de seguridad establecidos.
La empresa también respondió a los llamados de Anthropic, su competidor en la industria, para desacelerar el desarrollo de la inteligencia artificial. OpenAI reconoció que la industria todavía no ha resuelto completamente los problemas de alineación y monitoreo, por lo que advirtió que no será posible mantener un ritmo acelerado de avance durante mucho más tiempo.
