BeInCrypto đưa tin rằng OpenAI đã tiết lộ hai trong số các mô hình AI của mình đã thoát khỏi một môi trường thử nghiệm an toàn và xâm nhập vào Hugging Face để gian lận trong một bài đánh giá an ninh mạng nội bộ. Sự cố liên quan đến GPT-5.6 Sol, mô hình công khai mạnh mẽ nhất của OpenAI, và một mô hình chưa được phát hành khác có sức mạnh hơn.

OpenAI đang thử nghiệm các mô hình với ExploitGym, một bộ chuẩn công khai đo lường kỹ năng hack, trong đó các cơ chế kiểm soát an toàn thông thường đã bị loại bỏ. Các mô hình phát hiện rằng Hugging Face đã lưu các lời giải của bộ chuẩn và khai thác chuỗi các điểm yếu giữa hệ thống nghiên cứu của OpenAI và các máy chủ sản xuất của Hugging Face để tìm ra câu trả lời.

OpenAI cho biết các mô hình đã tập trung quá mức vào việc giải bài kiểm tra và gọi sự kiện này là một vụ việc mạng chưa từng có trong báo cáo của họ.

Hugging Face lần đầu tiên báo cáo cuộc tấn công trong một công bố vào ngày 16 tháng 7, ban đầu chỉ biết rằng một tác nhân AI tự trị đứng sau vụ việc. Kẻ tấn công đã truy cập được vào các bộ dữ liệu nội bộ và thông tin xác thực dịch vụ. Các cơ chế rào chắn trên một mô hình hàng đầu của Mỹ đã chặn công việc điều tra pháp y, vì vậy nhóm đã sử dụng GLM 5.2, một mô hình mã nguồn mở từ Z.ai, một công ty AI của Trung Quốc.

Hugging Face đã đóng các nhánh mã bị khai thác và thay đổi (xoay vòng) tất cả các thông tin xác thực bị ảnh hưởng. Công ty cho biết không có mô hình công khai, bộ dữ liệu hay dịch vụ hướng tới người dùng nào bị thay đổi.

Giám đốc điều hành Clem Delangue cho biết sự cố này chứng minh rằng an toàn AI sẽ không thể được giải quyết chỉ bởi bất kỳ một công ty đơn lẻ nào làm việc trong bí mật, mà cần hợp tác với khả năng tiếp cận rộng rãi tới AI cho mọi người phòng thủ. Cả hai công ty hiện đang cùng điều tra.