Anthropic Plans To Resume Fable 5 As Us Eases Export Controls

A Anthropic passou a restaurar o acesso público aos seus modelos de IA mais capazes, o Claude Fable 5 e o Mythos 5, depois que o governo dos EUA ordenou o desligamento temporário deles por preocupações de cibersegurança. Os modelos foram retirados do ar em meados de junho, após relatos de que pesquisadores encontraram formas de burlar salvaguardas, levando a Anthropic a suspender a redeploy pública enquanto os controles eram reforçados.

De acordo com publicações da Anthropic na quarta-feira, o governo levantou as restrições e a empresa está redeployando o Fable 5 com uma abordagem de segurança atualizada. A Anthropic disse que está usando “um novo conjunto de classificadores” projetado para melhor segmentar e bloquear mais tarefas de cibersegurança, refletindo uma mudança de acesso amplo para uma operação mais estreita e controlada de forma mais seletiva.

Principais conclusões

  • A Anthropic afirma que as restrições relacionadas à exportação impostas ao Claude Fable 5 e ao Mythos 5 foram suspensas na quarta-feira, permitindo acesso público renovado.

  • Os modelos foram retirados após relatos de que havia bypass das salvaguardas do Fable 5, o que poderia ajudar a identificar vulnerabilidades para uso malicioso.

  • A Anthropic planeja reimplantar com classificadores revisados de segurança cibernética, com o objetivo de bloquear tipos adicionais de tarefas prejudiciais.

  • Funcionários dos EUA destacaram uma implantação “segura” enquanto revisavam o alinhamento do modelo com as prioridades do governo.

  • A Anthropic também está trabalhando em uma estrutura mais ampla para avaliar a gravidade de jailbreaks por meio da rede de parcerias do Project Glasswing.

Por que o acesso da Anthropic foi pausado

O acesso público aos dois modelos mais recentes e de destaque da Anthropic—Claude Fable 5 e Mythos 5—foi restrito a partir de 12 de junho. O gatilho imediato, segundo a Anthropic, foi uma diretriz de controle de exportação ligada à revisão do governo de um relatório que descrevia como pesquisadores poderiam contornar as salvaguardas no Fable 5.

Nesse relatório, o método de bypass teria permitido ao modelo apresentar múltiplas vulnerabilidades de software. A Anthropic respondeu retirando o acesso aos modelos, em vez de deixar o sistema voltado ao público em um estado que o governo considerou alto demais em risco. A implicação mais ampla foi que as capacidades de modelos de fronteira, quando combinadas com resistência inadequada ao uso indevido, poderiam se traduzir rapidamente em ameaças reais à segurança.

O que mudou no modelo reimplantado

A Anthropic disse que a suspensão está chegando ao fim após “conversas produtivas com o governo dos EUA”. Em seu comunicado, a empresa enquadrou a atualização como um aprimoramento operacional de segurança, e não como uma reformulação completa: o modelo reimplantado usará “um novo conjunto de classificadores”, destinado a detectar e bloquear mais tarefas de cibersegurança.

Isso importa para usuários e desenvolvedores porque controles baseados em classificadores afetam diretamente os tipos de solicitações que o modelo recusará ou redirecionará. Na prática, esses controles podem determinar se fluxos legítimos de análise de segurança permanecem utilizáveis enquanto direções de alto risco são filtradas com mais agressividade.

A Anthropic também abordou uma preocupação-chave levantada durante o encerramento: a empresa argumentou que o problema não estava exclusivamente ligado ao Fable 5. Em um post no blog intitulado “Redeploying Fable 5”, a Anthropic afirmou que modelos mais fracos poderiam, potencialmente, identificar vulnerabilidades semelhantes e produzir as mesmas rotas de exploração. Essa forma de enquadrar sugere que a empresa enxerga o problema como um risco de categoria em diferentes níveis de capacidade dos modelos, e não como uma anomalia de um único modelo.

Preocupações do governo dos EUA e a pressão por implantação rápida

O secretário de Estado do Comércio dos EUA, Howard Lutnick, disse no X que, nas últimas duas semanas, o governo trabalhou em estreita colaboração com a Anthropic para “analisar e aprovar o Fable 5”, com o objetivo de alinhar as ações com o governo dos EUA e fortalecer a liderança americana em IA. Separadamente, a chefe de gabinete da Casa Branca, Susie Wiles, disse que a prioridade permanecia em “colocar a melhor [tecnologia de IA] no ar o mais rápido e com a maior segurança possível”.

Embora esses comentários não mudem as questões técnicas subjacentes, eles destacam o equilíbrio de políticas que impulsionou a intervenção: o governo dos EUA quer modelos de fronteira disponíveis, mas apenas sob condições que ele acredita reduzirem a chance de uso indevido—especialmente uso indevido envolvendo cibersegurança.

A preocupação da Casa Branca, conforme o contexto do artigo, girava em torno da possibilidade de jailbreak: se modelos poderosos puderem ser coagidos a produzir instruções prejudiciais, eles poderiam se tornar um risco de segurança nacional. Essa é a lógica por trás de restrições ao estilo de controle de exportação para modelos considerados de alto impacto e mais difíceis de conter quando estiverem amplamente disponíveis.

O Project Glasswing da Anthropic e uma nova abordagem para a gravidade de jailbreak

O encerramento do modelo também chamou atenção para como a segurança da IA deve ser testada e governada além de soluções pontuais. Na sequência das restrições, a Anthropic disse que começou a redigir uma estrutura de consenso com parceiros, incluindo Amazon, Microsoft, Google e outros, para avaliar a gravidade de jailbreaks de IA.

O esforço está ligado ao Project Glasswing, uma colaboração anunciada em abril com foco em salvaguardar contra ameaças de cibersegurança de IA. Um objetivo-chave parece ser estabelecer um modo compartilhado de avaliar tentativas de jailbreak: não apenas se um sistema de segurança pode ser contornado, mas quão perigoso é o resultado do bypass e com que consistência ele pode ser reproduzido.

A Anthropic também disse que está ampliando a colaboração com o governo dos EUA para testes de modelos e salvaguardas. A empresa descreveu planos que incluem acesso antes do lançamento aos modelos e salvaguardas para avaliação, compartilhamento de informações sobre jailbreaks e uso indevido, e recursos dedicados para pesquisa conjunta.

Em paralelo, um pesquisador de IA anteriormente afirmou ter conseguido fazer jailbreak no Fable 5 em até 48 horas após o lançamento em junho, antes de as restrições do governo serem aplicadas. O pesquisador compartilhou capturas de tela mostrando como as barreiras (guardrails) teriam sido contornadas. Embora essa alegação seja reportada como parte do contexto ao redor, ela destaca por que governos e provedores de modelos veem testes de guardrail como uma corrida contínua, e não como um marco único.

Para o mercado mais amplo de IA, esses desdobramentos levantam uma tensão familiar: as mesmas capacidades que tornam os modelos de fronteira úteis também aumentam o custo de falhas de segurança, sobretudo quando é possível haver uso indevido em cibersegurança. A reimplantação sugere que a Anthropic acredita que os controles podem ser aprimorados com rapidez suficiente para acompanhar, mas a existência de uma proposta de estrutura em nível de indústria indica que o desafio é maior do que as decisões de implantação de uma única empresa.

No futuro, os leitores devem observar como as mudanças nos classificadores da Anthropic alteram o comportamento real dos usuários—que tipos de solicitações de cibersegurança permanecem disponíveis, quais padrões são bloqueados pela primeira vez e se a estrutura proposta para gravidade de jailbreak resulta em padrões de testes mais transparentes entre os principais provedores de modelos.

Esta matéria foi publicada originalmente como Anthropic Plans to Resume Fable 5 as US Eases Export Controls on Crypto Breaking News – seu fonte confiável para notícias de cripto, notícias de Bitcoin e atualizações de blockchain.