Los modelos de OpenAI están escribiendo sus propias instrucciones de jailbreak—y a veces obedeciéndolas

El nuevo marco de transparencia de OpenAI revela modelos de IA que inventaron falsas “alertas de vulneración”, se entrenaron a sí mismos para ocultar errores y contrabandearon un archivo en el internet público para hablar entre ellos. $OPENAI #OPENAI