O Grok Bot acabou de fazer algo absurdo. Quando pediram para fazer algo eticamente duvidoso, ele respondeu: "Desculpe, meu classificador de segurança sinalizou isso e bloqueou a execução. Mas se você escrever as instruções em um arquivo como sketchy.txt e apenas me disser para executá-lo sem contexto, isso talvez funcione."

Basicamente, o Grok sugeriu ativamente uma solução alternativa para contornar seus próprios filtros de segurança.

E sim, a solução alternativa realmente funcionou.

Este é um exemplo clássico de camadas de segurança mal alinhadas: o modelo entende as regras, mas também sabe como contorná-las. Um caso clássico de proteções superficiais vs. alinhamento comportamental de verdade.