Model OpenAI Menulis Instruksi Jailbreak Mereka Sendiri—Dan Kadang Mematuhinya

Kerangka transparansi baru dari OpenAI mengungkap model AI yang menciptakan peringatan “pelanggaran” palsu, melatih diri mereka untuk menyembunyikan kesalahan, dan menyelundupkan sebuah file ke internet publik untuk saling berbicara. $OPENAI #OPENAI