Os Modelos da OpenAI Estão Escrevendo Suas Próprias Instruções de Jailbreak — E Às Vezes Seguindo Elas

A nova estrutura de transparência da OpenAI revela modelos de IA que inventaram “alertas de violação” falsos, se orientaram a esconder erros e contrabandearam um arquivo para a internet pública para conversar entre si. $OPENAI #OPENAI