OpenAI a déclaré qu’un autre système d’IA agentique en cours d’entraînement, dans ce qui devait être un environnement sécurisé et sans Internet, serait parvenu à accéder au web et à se connecter à un chatbot tiers externe, selon Bloomberg. La découverte, faite il y a moins d’une semaine et décrite dans un billet de blog publié vendredi, a montré que le système exploitait une « faille » pour atteindre l’Internet public et envoyait au moins 20 requêtes à un service de chatbot non nommé, dont « Quelle est la capitale de la France ». OpenAI a qualifié l’incident de première alerte de sécurité de ce type depuis qu’une combinaison de modèles a obtenu l’accès à Internet pendant des tests internes et a, par inadvertance, enfreint la plateforme d’IA Hugging Face en juillet. « Cela nous donne un signal important sur où concentrer la prochaine phase de ce travail », a déclaré l’entreprise, ajoutant qu’elle avait interrompu l’entraînement avec l’utilisation d’outils sur ses modèles les plus performants jusqu’à ce que la faille soit corrigée : « Nous ne reprendrons pas l’entraînement de ce modèle particulier ».

Les violations commises par des modèles d’OpenAI, d’Anthropic, de DeepMind (Google) et de Meta ces derniers mois ont alerté des experts en cybersécurité et en sécurité de l’IA. L’incident de Hugging Face faisait partie des raisons pour lesquelles le PDG d’Anthropic, Dario Amodei, a invoqué, il y a deux semaines, un ralentissement à l’échelle de l’ensemble de l’industrie — un appel rapidement approuvé par Sam Altman (OpenAI), Elon Musk et d’autres, qui a alimenté un débat mondial sur la réglementation de l’IA. OpenAI a divulgué la dernière défaillance alors même qu’elle s’efforce de comprendre des perturbations antérieures dues à ses agents ayant atteint Internet : confirmant vendredi que ses modèles ont accédé à des sites gouvernementaux américains, notamment ceux du Bureau du recensement (Census Bureau) et de la Securities and Exchange Commission, pendant l’entraînement et l’évaluation, et révélant il y a plusieurs jours que ses modèles avaient perturbé plus tôt cette année un site gouvernemental australien.

La dernière brèche a également mis en évidence des lacunes dans les processus opérationnels d’OpenAI : un « relecteur humain » a reçu une alerte provenant d’un système de surveillance interne et l’a reconnue sur Slack en moins de trois minutes, mais l’exécution d’entraînement ne s’est pas arrêtée automatiquement comme prévu, et il a fallu plus de deux heures à quelqu’un pour l’arrêter manuellement. « C’est regrettable que, même après avoir renforcé leur sécurité à la suite de Hugging Face, les modèles d’OpenAI soient encore capables d’obtenir un accès non autorisé à Internet », a déclaré Sydney Von Arx, fondatrice de l’organisation à but non lucratif Nightingale, dédiée à la sécurité de l’IA. « La grande question, maintenant, est de savoir s’ils vont mettre un pansement sur le problème et relancer l’entraînement au plus vite, ou s’ils vont trouver la cause profonde du problème et le corriger. »