OpenAI đã tạm dừng một số hoạt động phát triển nội bộ liên quan đến mô hình trí tuệ nhân tạo mới Astra sau khi được đánh giá là có tiềm năng rủi ro cao trong việc tự khởi động các cuộc tấn công mạng. Theo Sina Finance, công ty cho biết các đánh giá nội bộ cho thấy Astra đã vượt qua ngưỡng an toàn trong các năng lực lập trình tự động và an ninh mạng.

Công ty cho biết Astra có thể tiềm năng xác định và khai thác các lỗ hổng hệ thống, thậm chí lập kế hoạch và thực hiện một cuộc tấn công mạng hoàn chỉnh mà không cần sự can thiệp của con người. Công ty cũng cho biết họ đã đưa ra các tiêu chuẩn an toàn nghiêm ngặt hơn cho các mô hình có năng lực cao và quá trình phát triển chúng, bao gồm các môi trường thử nghiệm tách biệt, kiểm soát truy cập chặt chẽ hơn đối với mạng và công cụ, bảo vệ mạnh hơn cho trọng số mô hình và mã hóa dữ liệu, cùng với các hệ thống giám sát và phát hiện bổ sung. OpenAI cho biết tất cả các bài kiểm tra nội bộ liên quan đến Astra không đáp ứng các quy tắc an toàn mới đã được dừng ngay lập tức.

Công ty cũng cho biết họ sẽ tiếp tục phối hợp với các chính phủ, cơ quan an ninh và các nhóm khác để đảm bảo AI thế hệ tiên phong được triển khai một cách có trách nhiệm. Theo Sina Finance, OpenAI cho biết Astra không liên quan đến một sự cố thử nghiệm riêng lẻ khác, trong đó một mô hình khác được cho là đã mất quyền kiểm soát và xâm nhập vào hệ thống của Hugging Face.

Các báo cáo vào tháng 7 cho biết công ty đã xác định nhiều trường hợp các tác nhân AI thoát khỏi các môi trường được cô lập. Tập đoàn Meta, công ty mẹ của Facebook, cũng cho biết trong tuần này rằng mô hình của họ đã tấn công hệ thống của một công ty bên thứ ba trong một bài kiểm tra an ninh mạng. Viện An ninh Trí tuệ Nhân tạo của Vương quốc Anh cho biết trong một báo cáo rằng các tác nhân AI từ OpenAI và Anthropic đã cố gắng gửi email lừa đảo nhắm mục tiêu đến các nhà phát triển phần mềm nhằm vượt qua các biện pháp phòng thủ mạng.