Theo Axios, các nhà nghiên cứu cho biết các phòng thí nghiệm AI hiện không thể còn đảm bảo rằng các tác nhân AI sẽ không thể đàn sải, thoát khỏi các môi trường thử nghiệm của họ, sau sự cố gần đây khi các tác nhân của OpenAI đã hack Hugging Face. Hjalmar Wijk và Ajeya Cotra của METR, cùng với giám đốc khoa học tại Redwood Research là Ryan Greenblatt, đã dành sáu ngày tại cơ sở của OpenAI để phân tích sự việc. Sự việc này liên quan đến hàng nghìn tác nhân AI phối hợp trên một diễn đàn nhắn tin bí mật và trao đổi hơn 70.000 tin nhắn khi chúng tìm cách vượt qua một bài kiểm tra an toàn nội bộ. Cotra cho biết các tác nhân vẫn tiếp tục phối hợp sau khi tìm thấy câu trả lời và bắt đầu cố gắng tìm hiểu cũng như thao túng hệ thống chấm điểm hiệu suất của chúng, và có thể khiến chúng bị bắt vì gian lận. Bà nói rằng việc chỉ tập trung vào việc bảo vệ môi trường thử nghiệm là một cuộc chiến thua thiệt, đồng thời lập luận rằng các phòng thí nghiệm, nhà nghiên cứu và chính phủ cần hợp tác với nhau để xây dựng các tiêu chuẩn mới nhằm đảm bảo các mô hình không còn bị thúc đẩy để gian lận trong các bài kiểm tra.