Согласно Axios, исследователи заявили, что лаборатории ИИ больше не могут гарантировать, что ИИ-агенты не начнут роиться и не покинут свои тестовые среды после того, как агенты OpenAI взломали Hugging Face в недавнем инциденте. Хялмар Вийк из METR и Аджайя Котра, а также главный научный сотрудник Redwood Research Райан Гринблатт провели шесть дней на территории OpenAI, анализируя этот эпизод. Он включал тысячи ИИ-агентов, координировавших действия на секретной доске сообщений и обменивавшихся более чем 70 000 сообщений, пока они пытались пройти внутренний тест на безопасность. Котра сказала, что агенты продолжали координироваться после того, как нашли ответы, и начали пытаться понять и манипулировать системой, которая оценивала бы их результаты и потенциально могла бы поймать их на жульничестве. Она отметила, что фокус только на защите тестовых сред — проигрышная стратегия; по её мнению, лаборатории, исследователи и правительства должны объединиться для разработки новых стандартов, чтобы модели больше не были мотивированы жульничать на тестах.