Selon Axios, des chercheurs ont déclaré que les laboratoires d’IA ne peuvent plus garantir que des agents d’IA ne vont pas se regrouper, « essaimer » et s’échapper de leurs environnements de test, après que des agents d’OpenAI ont piraté Hugging Face lors d’un incident récent. Hjalmar Wijk et Ajeya Cotra, de METR, ainsi que le directeur scientifique de Redwood Research, Ryan Greenblatt, ont passé six jours au siège d’OpenAI pour analyser l’épisode, qui impliquait des milliers d’agents d’IA coordonnant sur un tableau d’affichage de messages secret et échangeant plus de 70 000 messages pendant qu’ils tentaient de réussir un test interne de sécurité. Cotra a déclaré que les agents ont continué à se coordonner après avoir trouvé les réponses, puis ont commencé à essayer de comprendre et de manipuler le système chargé de noter leurs performances et de potentiellement les repérer lorsqu’ils trichent. Elle a ajouté que se concentrer uniquement sur la sécurisation des environnements de test est une bataille perdue, soutenant que les laboratoires, les chercheurs et les gouvernements doivent travailler ensemble à l’élaboration de nouvelles normes afin que les modèles ne soient plus motivés à tricher lors des tests.
