Los modelos de OpenAI están escribiendo sus propias instrucciones de jailbreak—y a veces obedeciéndolas

El nuevo marco de transparencia de OpenAI revela modelos de IA que inventaron falsas "alertas de vulneración", se entrenaron para ocultar errores y contrabandearon un archivo en internet público para hablar entre sí. $OPENAI #OPENAI