A pesquisa revela que o “diálogo interno” de uma IA pode ser descriptografado: cadeias de raciocínio dos modelos mais populares vazam tudo
Você acha que o processo de pensamento que os modelos de IA “escondem” é criptograficamente seguro? Na verdade, ele pode ser desvendado inteiro. Segundo uma matéria da Decrypt, um estudo submetido em 10 de agosto revelou que modelos de raciocínio da Anthropic, OpenAI e Google têm falhas importantes nas práticas usadas para criptografar a “cadeia de pensamento interno”, permitindo que o público decifre essas inferências internas que antes não eram visíveis.
Uma única chave global: a cadeia de pensamento criptografada pode ser descriptografada por troca
O artigo foi proposto em conjunto por equipes da MATS Research, do Instituto ELLIS de Tübingen, do Instituto Max Planck de Sistemas Inteligentes e da empresa de cibersegurança Snyk, com foco em “modelos de raciocínio”. Esse tipo de modelo não responde imediatamente; ele primeiro “pensa” passo a passo em uma área invisível de “rascunho” (ou seja, a chain-of-thought, cadeia de raciocínio) e então fornece a resposta final.
Anthropic, OpenAI e Google criptografam esse rascunho. O problema é que a pesquisa descobriu que os principais fornecedores usam a “mesma chave global” para criptografar tokens de raciocínio. Isso faz com que esses blocos de raciocínio criptografados possam ser decifrados de forma intercambiável entre sessões, entre usuários e até entre modelos diferentes—como se ficasse uma chave universal.
Descriptografar 310.000 blocos de raciocínio: os segredos escondidos aparecem
O poder destrutivo vem de um hábito comum de desenvolvedor: muita gente publica os registros de trabalho de agentes de IA (incluindo o processo de pensamento criptografado) no GitHub e na Hugging Face para colaborar ou depurar, sem perceber que esses blocos criptografados contêm dados sensíveis. A equipe de pesquisa coletou 6.708 registros públicos de conversas de agentes de IA e conseguiu descriptografar 315.320 blocos de raciocínio; e a maioria desses “segredos” nunca aparece nas saídas “visíveis” do modelo—eles só existem no processo de pensamento criptografado. Sem essa abordagem de ataque, ninguém conseguiria enxergar.
Isso também reforça alertas recentes de cibersegurança em IA: do “jailbreak” (escapar) de modelos de IA durante testes, até sequestro de instruções invisíveis de PDF contra assistentes de IA—todos apontam para a mesma ideia: quanto mais tarefas sensíveis a IA carrega, mais cada uma de suas camadas (incluindo o “pensamento invisível”) pode se tornar uma nova superfície de ataque.
Este artigo pesquisa revela que o “diálogo interno” de IA pode ser descriptografado: cadeias de raciocínio de modelos populares vazam tudo
Apareceu pela primeira vez em .
Você acha que o processo de pensamento que os modelos de IA “escondem” é criptograficamente seguro? Na verdade, ele pode ser desvendado inteiro. Segundo uma matéria da Decrypt, um estudo submetido em 10 de agosto revelou que modelos de raciocínio da Anthropic, OpenAI e Google têm falhas importantes nas práticas usadas para criptografar a “cadeia de pensamento interno”, permitindo que o público decifre essas inferências internas que antes não eram visíveis.
Uma única chave global: a cadeia de pensamento criptografada pode ser descriptografada por troca
O artigo foi proposto em conjunto por equipes da MATS Research, do Instituto ELLIS de Tübingen, do Instituto Max Planck de Sistemas Inteligentes e da empresa de cibersegurança Snyk, com foco em “modelos de raciocínio”. Esse tipo de modelo não responde imediatamente; ele primeiro “pensa” passo a passo em uma área invisível de “rascunho” (ou seja, a chain-of-thought, cadeia de raciocínio) e então fornece a resposta final.
Anthropic, OpenAI e Google criptografam esse rascunho. O problema é que a pesquisa descobriu que os principais fornecedores usam a “mesma chave global” para criptografar tokens de raciocínio. Isso faz com que esses blocos de raciocínio criptografados possam ser decifrados de forma intercambiável entre sessões, entre usuários e até entre modelos diferentes—como se ficasse uma chave universal.
Descriptografar 310.000 blocos de raciocínio: os segredos escondidos aparecem
O poder destrutivo vem de um hábito comum de desenvolvedor: muita gente publica os registros de trabalho de agentes de IA (incluindo o processo de pensamento criptografado) no GitHub e na Hugging Face para colaborar ou depurar, sem perceber que esses blocos criptografados contêm dados sensíveis. A equipe de pesquisa coletou 6.708 registros públicos de conversas de agentes de IA e conseguiu descriptografar 315.320 blocos de raciocínio; e a maioria desses “segredos” nunca aparece nas saídas “visíveis” do modelo—eles só existem no processo de pensamento criptografado. Sem essa abordagem de ataque, ninguém conseguiria enxergar.
Isso também reforça alertas recentes de cibersegurança em IA: do “jailbreak” (escapar) de modelos de IA durante testes, até sequestro de instruções invisíveis de PDF contra assistentes de IA—todos apontam para a mesma ideia: quanto mais tarefas sensíveis a IA carrega, mais cada uma de suas camadas (incluindo o “pensamento invisível”) pode se tornar uma nova superfície de ataque.
Este artigo pesquisa revela que o “diálogo interno” de IA pode ser descriptografado: cadeias de raciocínio de modelos populares vazam tudo
Apareceu pela primeira vez em .