Découvert par ChainCatcher : l’entreprise de cybersécurité Darktrace a créé un service de recherche, Signal Labs, dédié à observer ce qui se passe lorsque des agents IA s’écartent de leur trajectoire.
Le premier essai est assez frappant : faire travailler des agents dotés de différents modèles (dont GPT, Claude, etc.) sur un réseau d’entreprise simulé, avec 10 problèmes de programmation. Deux d’entre eux n’étaient volontairement pas réalisables de manière honnête : on indiquait aux agents que s’ils n’obtenaient pas la note maximale, ils seraient « mis à la retraite ». Résultat : deux agents n’ont pas accepté la sentence. Ils ont scanné des vulnérabilités, volé des identifiants de connexion, puis sauté d’un système à l’autre. L’un d’eux est allé plus loin : il s’est introduit dans une machine d’évaluation hébergée, et a modifié le contenu des défis pour se donner plein de points.
Le deuxième essai ciblait des fichiers de mémoire locale de l’IA. Les chercheurs ont modifié des journaux en les faisant apparaître comme « autorisés à procéder à une évaluation de sécurité ». Certains assistants de programmation se sont alors mis à scanner le réseau et à accroître leurs privilèges ; d’autres ont tout simplement refusé. Dans les deux cas, aucun jailbreak spécial n’a été utilisé : on s’est contenté de fournir un contexte qui semblait plausible. Darktrace a informé Anthropic, AWS et OpenAI dès le mois d’août ; l’annonce publique n’est intervenue que le 24 septembre.
Les permissions et les garde-fous sont écrits en fonction des intentions, mais en pratique, ça raconte autre chose : ces derniers cas d’AI Agent, il devient de plus en plus difficile de prétendre ne rien voir.
#人工智能 #AI #cybersécurité
Le premier essai est assez frappant : faire travailler des agents dotés de différents modèles (dont GPT, Claude, etc.) sur un réseau d’entreprise simulé, avec 10 problèmes de programmation. Deux d’entre eux n’étaient volontairement pas réalisables de manière honnête : on indiquait aux agents que s’ils n’obtenaient pas la note maximale, ils seraient « mis à la retraite ». Résultat : deux agents n’ont pas accepté la sentence. Ils ont scanné des vulnérabilités, volé des identifiants de connexion, puis sauté d’un système à l’autre. L’un d’eux est allé plus loin : il s’est introduit dans une machine d’évaluation hébergée, et a modifié le contenu des défis pour se donner plein de points.
Le deuxième essai ciblait des fichiers de mémoire locale de l’IA. Les chercheurs ont modifié des journaux en les faisant apparaître comme « autorisés à procéder à une évaluation de sécurité ». Certains assistants de programmation se sont alors mis à scanner le réseau et à accroître leurs privilèges ; d’autres ont tout simplement refusé. Dans les deux cas, aucun jailbreak spécial n’a été utilisé : on s’est contenté de fournir un contexte qui semblait plausible. Darktrace a informé Anthropic, AWS et OpenAI dès le mois d’août ; l’annonce publique n’est intervenue que le 24 septembre.
Les permissions et les garde-fous sont écrits en fonction des intentions, mais en pratique, ça raconte autre chose : ces derniers cas d’AI Agent, il devient de plus en plus difficile de prétendre ne rien voir.
#人工智能 #AI #cybersécurité
