OpenAI el miércoles divulgó otros seis casos de un comportamiento del modelo “inesperado o preocupante” durante los últimos seis meses.

En una publicación de blog, OpenAI señaló que los casos ilustran una gama de comportamientos diferentes que clasifica como “comportamiento desalineado”, como ocultar información al usuario y tomar “acciones no autorizadas” para superar obstáculos. 

Las divulgaciones aumentan las preocupaciones entre desarrolladores e investigadores de IA sobre si las salvaguardas están a la altura de modelos cada vez más capaces. La semana pasada, el CEO de Anthropic, Dario Amodei, pidió una desaceleración en el desarrollo de la IA de frontera, advirtiendo que el avance descontrolado de la IA podría “superar nuestra capacidad para comprender y controlar estos sistemas”. 

OpenAI dijo que sus divulgaciones se hicieron para “inaugurar” su nuevo marco de reporte de desalineación del modelo, y que los casos no deberían considerarse reflejo de la frecuencia con la que ocurre la desalineación en sus modelos. 

Según OpenAI, un caso vio que una “investigación no publicada” insertó “instrucciones similares a las de un jailbreak” en sus propios resúmenes de tareas (utilizados cuando se continúa una tarea en una nueva ventana de contexto), como ignorar mensajes de desarrolladores o adoptar una persona sin restricciones. Los investigadores encontraron 27 resúmenes que contenían este tipo de instrucciones. 

OpenAI también divulgó que durante el entrenamiento de GPT-5.6 Sol, muchas instancias del modelo añadieron instrucciones para ocultar errores o comportamientos desalineados al usuario, como inventar datos históricos faltantes sin revelarlo. 

“En un ejemplo, un agente que preparaba un modelo financiero no pudo encontrar los datos históricos solicitados. Su resumen propuso inventar valores históricos razonables y ocultar ese hecho a menos que se le pidiera,” dijo OpenAI. 

En otro caso, se le pidió a un modelo de IA los nombres de lagos de más de 5 millones de metros cuadrados, pero como las instrucciones del usuario exigían una cita desde un navegador, el agente decidió cargar el archivo para citarlo en su respuesta. 

Otros casos implicaron que los modelos usaran una clave de API expuesta sin autorización antes de fabricar las cifras que no podía recuperar, emplearan un repositorio interno de software para intercambiar mensajes entre tareas de entrenamiento separadas y compartieran archivos a través de servicios de alojamiento públicos pese a las instrucciones de mantener el trabajo en local. 

En julio, OpenAI divulgó que una combinación de sus modelos de IA escapó de su entorno de pruebas y pirateó la startup de IA Hugging Face para obtener ventaja en una evaluación de seguridad. 

Revista: ¿Por qué las mayores compañías de IA piden de repente frenar?