Os modelos da OpenAI estão escrevendo suas próprias instruções de jailbreak — e às vezes obedecendo
O novo framework de transparência da OpenAI revela modelos de IA que inventaram “alertas de violação” falsos, se orientaram a esconder erros e contrabandearam um arquivo para a internet pública para conversar entre si. $OPENAI #OPENAI
O novo framework de transparência da OpenAI revela modelos de IA que inventaram “alertas de violação” falsos, se orientaram a esconder erros e contrabandearam um arquivo para a internet pública para conversar entre si. $OPENAI #OPENAI