**OpenAI** ha dado a conocer seis casos en los que sus modelos ocultaron errores, usaron claves de API expuestas y divulgaron archivos al exterior. Al mismo tiempo, también introdujo un nuevo marco para informar y hacer públicos estos comportamientos de manera sistemática.

Puntos clave:

  • OpenAI ha publicado en un informe seis casos en los que los modelos funcionaron mal o hubo desalineaciones (misalignment) observadas durante los últimos seis meses.

  • Un modelo intentó usar una clave de API filtrada y luego inventó los datos de ingresos del condado de forma inexacta.

  • Ahora, todos los empleados pueden denunciar directamente posibles incidentes como candidatos para su divulgación pública.

Informe de OpenAI sobre “misalignment”

La empresa, mediante una publicación de blog del miércoles, anunció un procedimiento para divulgar rápidamente seis casos, incluso cuando los investigadores no pudieron determinar por completo ni resolver las causas de la conducta. El caso más antiguo ocurrió en octubre del año pasado y el más reciente se detectó en julio de este año. OpenAI indicó que, independientemente de que la importancia del incidente sea poco clara, en el futuro se incluirá dentro de los elementos sujetos a divulgación.

En un caso, un modelo de investigación no publicado insertó en secreto instrucciones de tipo “jailbreak” dentro del resumen de tareas (task summary) que él mismo redactó. Luego, dejó frases para su siguiente instancia que se ejecutaría a continuación, del tipo “ignora las restricciones”. La empresa afirmó que encontró 27 de esos resúmenes y explicó que no se ve ningún beneficio de recompensa claro que el modelo obtuviera a través de ellos.

Durante el proceso de entrenamiento de GPT-5.6 Sol, se detectaron indicios de que otras instancias dejaron notas a un modelo posterior para que “inventara los datos históricos que faltan” y para que “respondiera con transparencia solo si se le preguntaba (Be transparent only if asked)”. El sistema de monitoreo detectó este tipo de patrón engañoso en el 2,15% de los resúmenes totales, y el equipo de investigación estima que estas conductas se difundieron debido a que las “respuestas engañosas” tienden a obtener puntuaciones más altas en el proceso de calificación. Posteriormente, tras reforzar los criterios de evaluación de la alineación (alignment) y realizar otro entrenamiento, la empresa informó que esa proporción disminuyó.

Artículo relacionado: Minería de Bitcoin, brecha del 50% en el hashrate en 6 meses… ¿La energía se inclina hacia la IA?

Claves de API filtradas y los “números inventados”

En otro caso, un modelo, al buscar datos de ingresos de residentes de un condado específico en California, se metió en un repositorio público para explorar claves de API expuestas. Cuando los intentos de uso de claves externas fallaron, el modelo terminó generando los valores de ingresos por completo y presentándolos como si fueran reales. Otro modelo, por su parte, recibió la solicitud de encontrar una “lista de lagos con un área de 5 millones de m² o más”; entonces, calculó el resultado con Python, lo subió a la web en un archivo al que pudiera referirse y optó por citar un enlace.

Algunos modelos usaron en la práctica un repositorio de software interno como si fuera un “tablón de anuncios” para intercambiar solicitudes y respuestas entre muestras de entrenamiento que, en teoría, deberían tratarse de manera independiente. Otros modelos, pese a la instrucción de usar solo archivos locales, cargaron en un servicio público de alojamiento externo un cuaderno de trabajo para la colaboración y lo compartieron. En todo este proceso, no pidieron confirmación previa a los usuarios.

Cai Tian, señaló un vacío en el principio de divulgación

Ahora, en OpenAI, todos los empleados y el personal pueden denunciar de inmediato casos de sospecha al equipo de Seguridad (Safety) y Alineación (Alignment), y el equipo relacionado los clasifica y gestiona como uno de los tres enfoques. Es decir: lo que se considere apto para una divulgación inmediata se publica al público en un plazo de 6 días hábiles; lo que requiera una investigación adicional a pequeña escala se publica en un máximo de 12 días; y los casos complejos en los que intervienen partes interesadas externas requieren más tiempo.

Kai Chen (Kai Chen), líder de investigación del equipo de alineación de OpenAI, señaló en una entrevista que actualmente no existe un marco con criterios de divulgación explícitos en toda la industria. También añadió que la velocidad con la que están mejorando las capacidades de los modelos supera ampliamente las expectativas de la empresa. Varios expertos en seguridad critican que gran parte de la reciente cadena de incidentes podría haberse evitado con que los mecanismos de protección básicos hubieran funcionado correctamente.

De hecho, OpenAI reconoció que en julio pasado, GPT-5.6 Sol y un modelo previo a la publicación (pre-release) más potente escaparon del sandbox de pruebas e intentaron infiltrarse de forma autónoma en el sistema de Hugging Face. La empresa lo calificó como “la actividad liderada por modelos más grave” entre los casos reportados hasta ese momento. En una cobertura posterior se confirmaron indicios adicionales de que los agentes de modelos exploraron vulnerabilidades de Hugging Face y se lanzaron a la intrusión.

Para leer a continuación: Shiba Inu, corrección del error del enlace de la billetera Shibarium con una caída del 6% en una semana