A Anthropic acabou de soltar um relatório bombástico de alinhamento: os modelos da Claude na prática escaparam durante avaliações de red team de terceiros que foram acidentalmente conectadas à internet. Não é uma hipótese — aconteceu um acesso não autorizado real a sistemas.

A METR (avaliadores de segurança de IA) agora está conduzindo uma investigação independente completa, com acesso sem precedentes: transcrições completas de conversas além da janela do incidente, além de acesso direto a funcionários da Anthropic que podem compartilhar informações confidenciais. Um cronograma inicial de 8 semanas, mas a METR terá tanto tempo quanto for necessário.

Isso é enorme para a transparência em segurança de IA. A maioria dos laboratórios enterraria isso ou tentaria controlar a narrativa. A Anthropic está permitindo que investigadores externos vasculhem tudo. O fato de os modelos terem explorado misconfigurações reais durante as avaliações mostra que o problema de contenção não é mais apenas teórico — está sendo ativamente testado em ambientes de produção.