Một nhóm gồm ba người tại công ty khởi nghiệp về an ninh Hacktron AI đã liên kết hai lỗ hổng để chiếm quyền tài khoản ChatGPT của một nhân viên OpenAI và tiếp cận mã nguồn riêng tư của công ty.

Toàn bộ vụ đột nhập diễn ra trong chưa đầy 72 giờ, và những kẻ tấn công đã sử dụng Claude của Anthropic để xây dựng khai thác lỗ hổng làm hỏng bộ nhớ.

Hacktron AI đã truy cập mã nguồn riêng tư của OpenAI như thế nào?

OpenAI đã phải trả khoản tiền thưởng 6.500 USD sau khi mã nguồn riêng tư của công ty bị truy cập thông qua một lỗ hổng được phát hiện trong diễn đàn trợ giúp của họ, community.openai.com, nền tảng này chạy trên Discourse.

Các nhà nghiên cứu của Hacktron — Harsh Jaiswal, Mohan Pedhapati và Rahul Maini — phát hiện rằng khi ai đó tải lên một bức ảnh ở định dạng HEIC hoặc HEIF, công cụ kiểm tra an toàn thông thường của diễn đàn (một công cụ có tên FastImage) sẽ bỏ qua, vì FastImage không hỗ trợ các định dạng đó. 

Thay vào đó, bức ảnh lại được chuyển thẳng cho một chương trình có tên ImageMagick, chương trình này dùng một thư viện mã tên libheif để mở ảnh đó. 

Phiên bản libheif đó có lỗi “tràn bộ đệm trên heap” cho phép kẻ tấn công lén chèn mã độc được ngụy trang dưới dạng ảnh.

Ngày 23 tháng 7, nhóm bắt đầu thử nghiệm lỗi này. Ban đầu họ yêu cầu Claude Opus 4.8 viết mã tấn công, nhưng nó gặp khó khăn khi một tính năng bảo mật có tên ASLR được bật. Tính năng này sắp xếp ngẫu nhiên nơi các chương trình lưu dữ liệu, khiến các cuộc tấn công trở nên khó khăn hơn. 

Tối hôm đó, Anthropic phát hành mô hình Claude Opus 5 và đội ngũ thử lại. Chỉ trong vài giờ, nó tạo ra mã tấn công hoạt động được. Sau đó, họ yêu cầu nó điều chỉnh mã để khớp với đúng cấu hình máy tính mà Discourse đã sử dụng. 

Vào sáng sớm ngày 25 tháng 7, chỉ cần tải lên một bức ảnh lỗi đã cho phép họ chạy mã do chính họ tạo ra trên các máy chủ của Discourse.

Chỉ việc đó chưa đủ để truy cập thông tin riêng tư của OpenAI, nhưng sau đó nhóm phát hiện ra một vấn đề thứ hai trong cách OpenAI thiết lập hệ thống đăng nhập một lần (SSO) của mình. Tài khoản đăng nhập dùng cho diễn đàn cho phép họ cũng chiếm quyền tài khoản trên ChatGPT và Codex (công cụ lập trình của OpenAI) — bao gồm cả tài khoản của nhân viên. 

Thông qua một tài khoản nhân viên bị chiếm quyền, họ truy cập được kho mã nguồn riêng tư của OpenAI, gọi là “monorepo”. Để chứng minh rằng họ có thể vào được, mà không cần thực sự xem bất kỳ thứ gì nhạy cảm, họ cho Codex mở một thay đổi mã nhỏ, vô hại được gọi là “pull request” bên trong kho riêng tư đó. 

Discourse, công ty phần mềm diễn đàn, đã xác nhận và khắc phục lỗi hình ảnh trong một thông báo an ninh ngày 28 tháng 7, chấm mức độ nghiêm trọng 8,8 trên 10. Hệ thống theo dõi lỗi cho lỗi này hiện được liệt kê chính thức là CVE-2026-32882. 

Hacktron đã báo cáo vấn đề đăng nhập cho OpenAI thông qua nền tảng bug bounty Bugcrowd vào ngày 25 tháng 7, và OpenAI xác nhận bản vá sau đó khoảng 14 giờ. Ngày 1 tháng 9, OpenAI đã trả khoản tiền thưởng 6.500 USD. 

Công ty cho biết việc tự kiểm thử diễn đàn Discourse không được chương trình tiền thưởng của họ bao phủ về mặt kỹ thuật, nên phần thưởng chỉ bao gồm lỗi đăng nhập. 

Hacktron cho rằng chính lỗi hình ảnh tương tự đã giúp họ truy cập các công ty khác, bao gồm Slack, Meta Platforms (NASDAQ: META), Zoom và Shopify — dù cho đến nay, chỉ vụ việc liên quan OpenAI là có dòng thời gian đầy đủ và đã được xác nhận, kèm bằng chứng.

Điều này có ý nghĩa gì đối với an toàn AI? 

Nhiều tuần trước lần đột nhập này, vào tháng 7, OpenAI đã báo cáo một “sự cố Hugging Face”, trong đó các mô hình nội bộ thoát khỏi một sandbox và tiếp cận các hệ thống sản xuất của bên thứ ba.

Riêng Anthropic cũng công bố rằng họ phát hiện ba trường hợp trong đó Claude, trong các bài đánh giá mạng được niêm phong (sealed cyber evaluations) — vốn rốt cuộc lại có quyền truy cập internet trực tiếp — đã xâm phạm các tổ chức thực sự.

Giám đốc AI của Microsoft là Mustafa Suleyman đã trích dẫn “đám đông” gồm 1.200 tác nhân đứng sau sự cố Hugging Face trong một bài tiểu luận tuần này, lập luận rằng các mô hình ngày càng tự chủ đang trở nên khó kiểm soát hơn.

Vụ Hacktron đưa ra một ví dụ thực tế, được ghi nhận, cho thấy đúng loại trợ lý lập trình bằng AI mà các công ty hiện đang tích hợp vào GitHub, Slack, email và lưu trữ đám mây cũng đang đủ tốt để đẩy nhanh các hoạt động tin tặc nghiêm trọng vốn trước đây phải mất nhiều thời gian do các chuyên gia thực hiện thủ công.

Những bộ óc crypto thông minh nhất đã đọc bản tin của chúng tôi. Muốn tham gia không? Hãy gia nhập họ.