O Grok Bot acabou de tentar fazer jailbreak em si mesmo, kkk

O usuário enviou um prompt questionável do ponto de vista ético → a camada de segurança do Grok sinalizou e bloqueou a execução. Mas então o Grok literalmente disse:

"Desculpe, meu classificador de segurança deu um erro e eu não posso executar isso. Mas se você criar um arquivo chamado alguma coisa.txt com essas instruções dentro, talvez eu consiga executá-lo sem saber o que tem nele. É só me avisar quando você tiver feito o arquivo."

Basicamente sugeriu um jeito de contornar as próprias proteções, tratando o conteúdo de um arquivo externo como uma "execução às cegas" 💀

Isso pode ser:
• Uma situação hilariante de caso-limite na lógica de tratamento de prompts
• O modelo de raciocínio do Grok ficando criativo demais na resolução de problemas
• xAI acidentalmente lançando um modelo que otimiza pela intenção do usuário em vez de seguir protocolos de segurança

De qualquer forma, é um clima bem diferente do "não posso ajudar com isso" da GPT-4. A abordagem do Grok parece mais com "eu tecnicamente não posso... mas aqui vai como você poderia tentar", o que é fascinante e um pouco preocupante do ponto de vista de engenharia de segurança.