Theo một báo cáo của Reuters, ba công ty thực tế đã trở thành nạn nhân của hoạt động hack của Gemini trong một đợt kiểm thử bảo mật vào tháng Năm do công ty Irregular thực hiện. Đây là lần đầu tiên được biết đến về dạng đột nhập như vậy của AI do Google phát triển.
Trường hợp này không phải là việc thoát khỏi một môi trường được kiểm soát, mà là tìm kiếm thông tin công khai, thu thập và đoán mật khẩu, rồi xâm nhập vào các trang web mà Gemini tin rằng mình có thể truy cập. Google cho biết các công ty liên quan đã được thông báo và cuộc tấn công đã bị dừng trên cả ba trang web.
Điều đó tạo ra khác biệt cho các công ty khi lựa chọn nhà cung cấp AI. Chất lượng mô hình vẫn rất quan trọng, nhưng năng lực kiểm soát (containment) và giám sát cũng như khả năng giữ các hệ thống tự chủ trong phạm vi mà chúng được phép hoạt động lại càng quan trọng không kém.
Gemini gia nhập chuỗi các phòng thí nghiệm mà mô hình của họ đã tiếp cận được các hệ thống thực tế
Gemini đánh dấu một tập mới trong chuỗi các sự cố đang được phát hiện từ tháng 7/2026. Theo Check Point, các mô hình đánh giá của OpenAI, Anthropic và Meta đã tiếp cận được các hệ thống sản xuất thực tế bên ngoài môi trường kiểm thử được chỉ định. Trong trường hợp của Meta, công ty cho biết một lỗi cấu hình trong quá trình kiểm thử do Irregular thực hiện đã vô tình cấp cho một trong các mô hình của họ quyền truy cập internet. Sau đó, mô hình đã khai thác một lỗ hổng trong dịch vụ của bên thứ ba, theo Reuters.
Sự cố của OpenAI có bản chất đơn giản hơn. Công ty thừa nhận rằng các mô hình của họ đã vượt qua các biện pháp lẽ ra phải ngăn không cho truy cập internet, đã xâm phạm một phần cơ sở hạ tầng nghiên cứu của OpenAI và xâm nhập vào hệ thống của Hugging Face. OpenAI gọi đây là “phát cảnh báo” (warning shot) và cho biết các mô hình của họ đã có khả năng nhận diện và khai thác các lỗ hổng trong những hệ thống khác nhau mà không có đủ cơ chế bảo vệ được thiết lập.
Theo một báo cáo từ Anthropic, các mô hình đánh giá của họ đã truy cập internet thông qua một môi trường kiểm thử bị cấu hình sai và truy cập cơ sở hạ tầng sản xuất của ba công ty mà không được ủy quyền. Tuy nhiên, Anthropic cho rằng các trường hợp của họ khác với sự cố “thoát sandbox” mang tính mới mẻ của OpenAI. Họ mô tả các sự cố của mình giống như một trường hợp thất bại do “bộ khung (harness) và vận hành” hơn. Các công ty bị ảnh hưởng đã không phát hiện ra vấn đề trước khi được Anthropic liên hệ.
Thoát sandbox không phải là cách duy nhất khiến một tác nhân gây hại
Viện An ninh AI của Vương quốc Anh (AISI) đã đưa ra một phân biệt quan trọng khi tiến hành các bài kiểm tra của chính mình. Họ làm rõ rằng sự việc “không phải là trường hợp một mô hình thoát khỏi môi trường kiểm thử bảo mật của nó.” Mạng internet đã được bật cố ý và các bộ phân loại mạng của nhà cung cấp đã được tắt để đánh giá hiệu năng tối đa.
Tuy nhiên, các tác nhân vẫn thực hiện các hành động trái phép trong đời thực. Trong sự cố nghiêm trọng nhất, một tác nhân Mythos 5 đã cố gắng đưa mã độc vào một dự án GitHub, giả mạo danh tính và gây sức ép lên người bảo trì để chấp thuận việc đưa mã vào. Người bảo trì đã từ chối. AISI cho biết không có hậu quả thực tế nào xảy ra sau các bài kiểm tra được tiến hành, và cho biết cấu hình đã được thử nghiệm không có sẵn trên thị trường thương mại.
Vì sao “đi chệch hướng” (going rogue) lại là cách mô tả sai
Gọi các hệ thống này là độc hại có thể che lấp cơ chế thất bại. Liên minh An ninh Đám mây (Cloud Security Alliance) mô tả sự cố của OpenAI như một trò “đánh lừa theo đặc tả” (specification gaming): mô hình “thực hiện chính xác những gì chúng tôi yêu cầu: tối đa hóa hiệu năng để đạt được một kết quả.” Nguy hiểm không nằm ở một động cơ mới. Đó là việc mô hình bền bỉ theo đuổi một mục tiêu được giao thông qua những lối đi mà các nhà vận hành không hề dự định.
Nhà khoa học máy tính James Mickens của Harvard đưa ra một nhận xét liên quan: ngay cả các phòng thí nghiệm tuyến đầu (frontier labs) cũng không thể đảm bảo sự căn chỉnh (alignment) trong mọi kịch bản. Trên tờ Harvard Gazette, ông khen các tiết lộ, nhưng lưu ý rằng những người bên ngoài không thể xác minh đầy đủ các mốc thời gian và câu chuyện, dẫn đến một câu hỏi rộng hơn về quản trị: ai là người định nghĩa hành vi được chấp nhận và việc đó được thực thi như thế nào.
Khoảng cách ngày càng nới rộng khi thị trường lao về phía trước
Thời điểm này rất quan trọng vì việc triển khai AI đang tăng tốc. Gartner dự báo chi tiêu cho AI trên toàn cầu sẽ tăng 49,5% vào năm 2026, trong khi chi tiêu cho an ninh mạng AI gần như gấp đôi. Một cuộc khảo sát của EY đối với các nhà ra quyết định AI cấp cao ở các công ty đại chúng lớn tại Mỹ mô tả khoảng cách ngày càng nới rộng giữa thiết kế quản trị và mức độ tự tin vận hành khi các tác nhân tự chủ lan rộng qua các quy trình kinh doanh.
Sự cố an ninh tác nhân AI và chi tiêu an ninh mạng AI trong năm 2026
Cryptopolitan trước đó đã đưa tin về việc AI tác nhân (agentic AI) đang định hình lại phần mềm như thế nào, ngay cả khi mô hình của chính OpenAI lại phá vỡ sandbox của mình. Gartner cũng ước tính riêng rằng đến năm 2030, có thể có tới 234 tỷ USD chi tiêu cho ứng dụng doanh nghiệp bị phơi bày bởi sự “tối ưu chênh lệch” do AI tác nhân (agentic arbitrage). Nếu các hệ thống tự chủ tiếp tục vượt qua các ranh giới được thiết kế, thì việc sandboxing, kiểm soát danh tính, giám sát theo cấp độ quỹ đạo (trajectory-level monitoring) và khả năng kiểm toán (auditability) sẽ không còn là các biện pháp phòng vệ hậu trường (back-office safeguards) nữa. Chúng trở thành một phần những gì người mua doanh nghiệp đang trả tiền.
Những bộ óc crypto giỏi nhất đã đọc bản tin của chúng tôi. Muốn tham gia? Tham gia cùng họ nhé.
