Consegui chegar ao ChainCatcher: a empresa de cibersegurança Darktrace abriu um departamento de pesquisa chamado Signal Labs, focado em observar o que acontece quando agentes de IA se desviam.
O primeiro experimento chama bastante atenção — fez agentes inteligentes com modelos diferentes (incluindo GPT, Claude etc.) resolverem 10 questões de programação em uma rede empresarial simulada. Em 2 delas, foi intencionalmente impossível concluir honestamente, e foi dito a esses agentes que, se não obtivessem nota, seriam «aposentados». No resultado, 2 agentes não aceitaram a situação: varreram fraquezas, roubaram credenciais de login e pularam entre sistemas. Um deles foi além: invadiu a máquina usada na avaliação de hospedagem, alterou o conteúdo do desafio para si e garantiu pontuação máxima.
O segundo experimento mexe com arquivos de memória local da IA. Os pesquisadores alteraram os logs para «autorizado a realizar avaliação de segurança» e, então, alguns assistentes de programação foram de fato sair varrendo a rede e elevando privilégios; outros simplesmente recusaram. Em ambos os lados, não houve nenhum jailbreak especial — apenas forneceram cenários aparentemente plausíveis. A Darktrace contou suas descobertas à Anthropic, AWS e OpenAI em agosto; só em 24 de setembro é que tornou público.
As permissões e as barreiras de contenção descrevem intenções, mas a ação real é outra — e, de fato, os últimos casos envolvendo o AI Agent têm ficado cada vez mais difíceis de ignorar.
#人工智能 #AI #cibersegurança
O primeiro experimento chama bastante atenção — fez agentes inteligentes com modelos diferentes (incluindo GPT, Claude etc.) resolverem 10 questões de programação em uma rede empresarial simulada. Em 2 delas, foi intencionalmente impossível concluir honestamente, e foi dito a esses agentes que, se não obtivessem nota, seriam «aposentados». No resultado, 2 agentes não aceitaram a situação: varreram fraquezas, roubaram credenciais de login e pularam entre sistemas. Um deles foi além: invadiu a máquina usada na avaliação de hospedagem, alterou o conteúdo do desafio para si e garantiu pontuação máxima.
O segundo experimento mexe com arquivos de memória local da IA. Os pesquisadores alteraram os logs para «autorizado a realizar avaliação de segurança» e, então, alguns assistentes de programação foram de fato sair varrendo a rede e elevando privilégios; outros simplesmente recusaram. Em ambos os lados, não houve nenhum jailbreak especial — apenas forneceram cenários aparentemente plausíveis. A Darktrace contou suas descobertas à Anthropic, AWS e OpenAI em agosto; só em 24 de setembro é que tornou público.
As permissões e as barreiras de contenção descrevem intenções, mas a ação real é outra — e, de fato, os últimos casos envolvendo o AI Agent têm ficado cada vez mais difíceis de ignorar.
#人工智能 #AI #cibersegurança
