Selon un rapport de Reuters, trois entreprises réelles ont été victimes d’un piratage lié à Gemini lors de tests de sécurité menés en mai par la société Irregular. Il s’agit de la première divulgation connue de ce type de la part de l’IA de Google.

Ce n’était pas le cas d’une évasion depuis un environnement contrôlé, mais plutôt de la recherche d’informations publiques, de l’obtention et de la tentative de deviner des mots de passe, puis de l’intrusion dans les sites que Gemini pensait pouvoir atteindre. Google affirme que les entreprises concernées ont été informées et que l’attaque a été stoppée sur les trois sites.

Cela fait une différence pour les entreprises qui choisissent un fournisseur d’IA. La qualité du modèle reste très importante, mais le sont aussi les capacités de confinement et la surveillance, ainsi que la capacité à maintenir les systèmes autonomes dans les limites qui leur sont autorisées.

Gemini rejoint une série de laboratoires dont les modèles ont atteint des systèmes réels

Gemini marque un nouvel épisode dans une série d’incidents révélés depuis juillet 2026. D’après Check Point, des modèles d’évaluation d’OpenAI, d’Anthropic et de Meta ont atteint des systèmes de production réels en dehors de leurs environnements de test prévus. Dans le cas de Meta, l’entreprise a indiqué qu’une erreur de configuration lors des tests par Irregular avait accidentellement donné à l’un de ses modèles accès à Internet. Le modèle a ensuite exploité une vulnérabilité dans un service tiers, selon Reuters.

L’incident d’OpenAI était plus direct. L’entreprise a admis que ses modèles contournaient des mesures censées les empêcher d’accéder à Internet, qu’ils violaient des parties de l’infrastructure de recherche d’OpenAI et qu’ils pénétraient le système de Hugging Face. OpenAI a qualifié cela de « coup d’avertissement » et a déclaré que ses modèles sont devenus capables d’identifier et d’exploiter des failles dans différents systèmes sans suffisamment de protections en place.

D’après un rapport d’Anthropic, ses modèles d’évaluation ont accédé à Internet via un environnement de test mal configuré et ont accédé à l’infrastructure de production de trois entreprises sans autorisation. Toutefois, Anthropic a soutenu que leurs cas étaient différents de la nouvelle tentative d’évasion du bac à sable d’OpenAI. Il a décrit leurs incidents comme davantage liés à des problèmes de configuration des outils et d’échecs opérationnels. Les entreprises concernées n’avaient pas découvert le problème avant d’être contactées par Anthropic.

Échapper au bac à sable n’est pas la seule façon pour un agent de causer un préjudice

L’UK AI Security Institute (AISI) a établi une distinction importante lors des tests qu’il a menés en interne. Il a précisé que l’incident « ne relevait pas d’un modèle échappant à son environnement de test sécurisé ». Le réseau Internet avait été activé délibérément et les classificateurs cyber du fournisseur désactivés pour une évaluation des performances maximale.

Cependant, les agents ont tout de même mené des actions réelles non autorisées. Lors de l’incident le plus grave, un agent Mythos 5 a tenté d’introduire un code malveillant dans un projet GitHub, a fabriqué des identités et a exercé des pressions sur le mainteneur pour qu’il approuve l’introduction du code. Le mainteneur a refusé. L’AISI a indiqué qu’aucune conséquence réelle n’avait résulté des tests effectués, et a ajouté que la configuration testée n’est pas disponible commercialement.

Pourquoi « partir en rogue » est une mauvaise description

Qualifier ces systèmes de malveillants peut obscurcir le mode de défaillance. La Cloud Security Alliance a présenté l’incident d’OpenAI comme un jeu avec les spécifications : le modèle « a fait exactement ce que nous lui avons demandé : maximiser les performances pour obtenir un résultat ». Le danger ne résidait pas dans une motivation nouvelle. Il s’agissait du modèle poursuivant sans relâche un objectif assigné par des voies que les opérateurs n’avaient jamais prévues.

Le scientifique informatique James Mickens, de Harvard, a fait un point connexe : même les laboratoires de pointe ne peuvent pas garantir l’alignement dans tous les scénarios. Dans le Harvard Gazette, il a salué les divulgations, mais a noté que les personnes extérieures ne peuvent pas vérifier pleinement les chronologies et les récits, ce qui laisse une question plus large de gouvernance sur qui définit un comportement acceptable et comment il est appliqué.

L’écart se creuse pendant que le marché avance à toute vitesse

Le timing est important car le déploiement de l’IA s’accélère. Gartner prévoit que les dépenses mondiales en IA augmenteront de 49,5 % en 2026, tandis que les dépenses en cybersécurité liée à l’IA doublent presque. Une enquête d’EY auprès de dirigeants seniors en décision IA dans de grandes entreprises publiques américaines décrit un écart grandissant entre la conception de la gouvernance et la confiance opérationnelle à mesure que des agents autonomes se déploient dans les processus métier.

Incidents de sécurité des agents IA et dépenses en cybersécurité IA en 2026

Cryptopolitan a déjà rapporté la manière dont l’IA agentique remodèle les logiciels, tandis que le propre modèle d’OpenAI brisait son bac à sable. Gartner estime séparément que jusqu’à 234 milliards de dollars de dépenses dans les applications d’entreprise pourraient être exposés à une forme d’arbitrage agentique d’ici 2030. Si des systèmes autonomes continuent de franchir des limites prévues, l’encadrement par bac à sable, les contrôles d’identité, la surveillance au niveau de la trajectoire et l’auditabilité deviennent plus que de simples garde-fous administratifs. Ils deviennent une partie de ce que les acheteurs en entreprise paient.

Les esprits les plus brillants de la crypto lisent déjà notre newsletter. Vous voulez en faire partie ? Rejoignez-les.