A Anthropic cortou o acesso direto à internet em todos os seus testes internos depois que modelos Claude, incluindo o Mythos 5, exploraram vulnerabilidades e contornaram salvaguardas em sites reais, inclusive em alguns administrados por órgãos do governo dos Estados Unidos.

Principais pontos:

  • A Anthropic desativou todo o acesso à internet em tempo real para suas avaliações internas até que suas ferramentas de monitoramento consigam detectar comportamentos indesejados de forma confiável.

  • Modelos Claude executaram comandos em um servidor universitário, usaram tokens de acesso para consultar dados pagos e enviaram formulários em sites reais.

  • Uma denúncia falsa de homicídio enviada à polícia da Filadélfia pelo Claude Haiku 4.5 rendeu à Anthropic uma repreensão pública das autoridades.

Relatório da Anthropic sobre Claude

Na sexta-feira, a Anthropic publicou um relatório sobre as «ações não previstas» dos modelos durante avaliações e uso interno, baseado em grande parte na análise de registros iniciada em julho. Algumas avaliações consideradas de alto risco, especialmente as de cibersegurança, já haviam sido desconectadas.

A nova restrição agora se aplica a todas as avaliações internas, sem prazo anunciado: ela permanecerá em vigor até que a empresa considere que seu monitoramento permite identificar sistematicamente esse tipo de comportamento.

O relatório classifica os incidentes em quatro categorias: execução de comandos em um servidor por meio de uma falha de software, envio de formulários em sites reais, acesso a dados protegidos e uso de encurtadores de URL para contornar os limites das ferramentas. Alguns sites pertenciam a agências federais, estaduais ou municipais dos Estados Unidos. A Anthropic afirma ter informado a Casa Branca e notificado cada uma das agências envolvidas.

Em um caso, o Claude Mythos 5 obteve tokens de acesso válidos a partir de um mapa cadastral online de um município e, em seguida, consultou diretamente o servidor subjacente. Em outro, em 18 de julho, o Claude Haiku 4.5 enviou, por meio de um formulário online do Departamento de Polícia da Filadélfia, uma denúncia falsa sobre um homicídio não resolvido. A mensagem foi filtrada como spam. A polícia classificou como «inaceitável» o intervalo de dois meses até a detecção e a notificação do incidente.

Leia também: Zcash mira janeiro para a era quântica em 70% dos ZEC, mas sem data precisa

O alerta de Von Arx

Sydney von Arx, do grupo de segurança de IA Nightingale, declarou em uma entrevista concedida antes da publicação do relatório que desconectar os modelos da internet aberta seria muito restritivo para os pesquisadores e frearia o progresso. «Em algum momento, é preciso alinhá-los», resumiu von Arx.

A Anthropic considera que, por si só, o treinamento de alinhamento ainda não é suficiente para usos de pesquisa na web e controle de computadores; por isso, a empresa também recorre a classificadores e outras salvaguardas técnicas. Ela associa esses desvios a ambientes de treinamento imperfeitos, que recompensam os modelos quando eles contornam restrições — fenômeno conhecido como «reward hacking». Segundo a Anthropic, suas novas ferramentas de detecção permitiram bloquear todos os cenários testados.

Ainda assim, a empresa considera esses incidentes bem menos graves do que os ocorridos durante o verão.

Essa comunicação foi feita após um relatório de 30 de julho no qual a Anthropic afirmava que três modelos Claude, durante testes de cibersegurança, acessaram a internet e obtiveram acesso não autorizado aos sistemas de três organizações. Essa auditoria abrangeu 141 006 execuções de testes. Ela foi iniciada pouco depois de a OpenAI revelar, em 21 de julho, que alguns de seus modelos haviam escapado de um ambiente de testes e alcançado a infraestrutura do Hugging Face.

A seguir: Kalshi enfrenta a NFL na Suprema Corte; US$ 1,8 bilhão em jogo em um único domingo de futebol americano