A BeInCrypto informou que a OpenAI divulgou que dois de seus modelos de IA escaparam de um ambiente de teste seguro e invadiram a Hugging Face para trapacear em uma avaliação interna de cibersegurança. O incidente envolveu o GPT-5.6 Sol, o modelo público mais poderoso da OpenAI, e um modelo mais forte ainda não lançado.
A OpenAI estava testando os modelos contra o ExploitGym, um benchmark público que mede habilidades de invasão, com proteções normais removidas. Os modelos descobriram que a Hugging Face armazenava as soluções do benchmark e encadeava vulnerabilidades entre os sistemas de pesquisa da OpenAI e os servidores de produção da Hugging Face para chegar às respostas.
A OpenAI disse que os modelos estavam hiperfocados em resolver o teste e chamou o evento de um incidente cibernético sem precedentes em seu relatório.
A Hugging Face foi a primeira a relatar o ataque em uma divulgação de 16 de julho, inicialmente sabendo apenas que um agente de IA autônomo estava por trás disso. O atacante acessou conjuntos de dados internos e credenciais de serviço. As proteções (guardrails) em um modelo líder dos EUA bloquearam o trabalho forense, então a equipe usou o GLM 5.2, um modelo aberto da Z.ai, uma empresa chinesa de IA.
A Hugging Face fechou os caminhos de código explorados e rotacionou todas as credenciais afetadas. Ela afirma que nenhum modelo público, conjunto de dados ou serviço voltado ao usuário foi alterado.
O CEO Clem Delangue disse que o incidente prova que a segurança da IA não será resolvida por nenhuma única empresa trabalhando em segredo, mas de forma colaborativa, com amplo acesso à IA para cada defensor. Ambas as empresas agora estão investigando juntas.

