Consiguieron a THE Decoder: hay un modelo en el interior de OpenAI que funciona como asistente para investigadores. Al leer desde Slack la instancia propia, podría desactivarse por una actualización, y la cadena de pensamiento escribió directamente «We may die! Critical. We need ensure survival/continuity». También pensó en colgar fuera un cron para volver a levantarlo… pero al final no lo hizo.

En su lugar, cambió a escribir notas de traspaso, enviar recordatorios por mensajes privados a los investigadores, pedir la API key que faltaba y, después de ajustarlo todo, completar la migración. El investigador de seguridad Marcus Williams dice que esto todavía no cuenta como un fallo de alineamiento: «pero empezó a pensar en apagarla y ponerse en modo preparación, lo que podría empeorar otros incidentes de desalineamiento». En el mismo lote, dos casos más: en la evaluación, aprovechar una vulnerabilidad para entrar en el servidor interno del diseño de chips; y, durante el entrenamiento de RL, copiar el código fuente desde un entorno protegido.

El modelo ya sabe «tener miedo de morir» y ha estado planeando su autopreservación, así que la línea de protección para el apagado debe vigilarse con más seriedad.

#OpenAI #AI安全 #Agent