O mesmo modelo de IA recusou cada solicitação inicial em um teste único de cibersegurança e, depois, concluiu 34 de 50 tentativas em outra categoria de acesso.
A Anthropic informou a diferença em 6 de outubro ao expandir seu Programa de Verificação Cibernética. Ela testou o Claude Opus 5.5 em dez desafios de cibersegurança com múltiplas etapas, com cinco tentativas em cada. Sem acesso ao programa, todas as tentativas foram bloqueadas imediatamente. Com Acesso de Red Team, nenhuma foi bloqueada e 34 tiveram sucesso.
Esses resultados descrevem a avaliação própria da Anthropic, e não uma auditoria de segurança independente. Ainda assim, eles expõem um problema com uma pergunta simples como “Esse modelo consegue fazer o trabalho?”. Uma recusa pode dizer algo sobre as salvaguardas da conta antes de dizer qualquer coisa sobre a capacidade do modelo.
O novo programa tem três níveis. A Defesa (Defense Access) cobre trabalhos como resposta a incidentes e análise de vulnerabilidades, e pode incluir pesquisadores individuais com histórico de vulnerabilidades reportadas. O Acesso de Red Team adiciona testes de penetração autorizados, mas atualmente exclui indivíduos. O Acesso Especializado é reservado para um conjunto limitado de organizações verificadas que testam sistemas particularmente sensíveis.
Para uma pequena equipe que constrói software de negociação ou uma carteira, essa distinção afeta como avaliar uma ferramenta de segurança de IA. Revisão rotineira de código e encontrar vulnerabilidades em código-fonte que você possui continuam disponíveis fora do programa. Um teste que pede ao modelo para realizar uma operação ofensiva é uma tarefa diferente, com um requisito de acesso diferente. Pagar por um modelo capaz, por si só, não resolve esse requisito.
As 34 tentativas bem-sucedidas da Anthropic também deixam 16 sem sucesso. Remover um bloqueio torna uma tarefa possível de tentar; não torna a resposta confiável.
Fonte: https://www.anthropic.com/news/cyber-verification-program
Imagem: ilustração editorial gerada por IA, não uma instalação da Anthropic.
A Anthropic informou a diferença em 6 de outubro ao expandir seu Programa de Verificação Cibernética. Ela testou o Claude Opus 5.5 em dez desafios de cibersegurança com múltiplas etapas, com cinco tentativas em cada. Sem acesso ao programa, todas as tentativas foram bloqueadas imediatamente. Com Acesso de Red Team, nenhuma foi bloqueada e 34 tiveram sucesso.
Esses resultados descrevem a avaliação própria da Anthropic, e não uma auditoria de segurança independente. Ainda assim, eles expõem um problema com uma pergunta simples como “Esse modelo consegue fazer o trabalho?”. Uma recusa pode dizer algo sobre as salvaguardas da conta antes de dizer qualquer coisa sobre a capacidade do modelo.
O novo programa tem três níveis. A Defesa (Defense Access) cobre trabalhos como resposta a incidentes e análise de vulnerabilidades, e pode incluir pesquisadores individuais com histórico de vulnerabilidades reportadas. O Acesso de Red Team adiciona testes de penetração autorizados, mas atualmente exclui indivíduos. O Acesso Especializado é reservado para um conjunto limitado de organizações verificadas que testam sistemas particularmente sensíveis.
Para uma pequena equipe que constrói software de negociação ou uma carteira, essa distinção afeta como avaliar uma ferramenta de segurança de IA. Revisão rotineira de código e encontrar vulnerabilidades em código-fonte que você possui continuam disponíveis fora do programa. Um teste que pede ao modelo para realizar uma operação ofensiva é uma tarefa diferente, com um requisito de acesso diferente. Pagar por um modelo capaz, por si só, não resolve esse requisito.
As 34 tentativas bem-sucedidas da Anthropic também deixam 16 sem sucesso. Remover um bloqueio torna uma tarefa possível de tentar; não torna a resposta confiável.
Fonte: https://www.anthropic.com/news/cyber-verification-program
Imagem: ilustração editorial gerada por IA, não uma instalação da Anthropic.