Vào hôm thứ Tư, OpenAI đã công bố thêm sáu trường hợp về “hành vi bất ngờ hoặc đáng lo ngại” của mô hình trong suốt sáu tháng qua.

Trong một bài đăng trên blog, OpenAI cho biết các vụ việc minh họa một loạt các hành vi khác nhau mà họ phân loại là “hành vi lệch chuẩn”, chẳng hạn như che giấu thông tin khỏi người dùng và thực hiện các “hành động không được cho phép” để vượt qua các trở ngại. 

Các tiết lộ này làm gia tăng mối lo trong giới các nhà phát triển và nghiên cứu AI về việc liệu các biện pháp bảo đảm có đang theo kịp với các mô hình ngày càng có năng lực hay không. Tuần trước, CEO của Anthropic, Dario Amodei, đã kêu gọi làm chậm quá trình phát triển AI ở tuyến đầu, cảnh báo rằng sự tiến bộ AI không được kiểm soát có thể “vượt qua khả năng của chúng ta trong việc hiểu và kiểm soát các hệ thống này”. 

OpenAI cho biết các công bố của hãng nhằm “khai trương” khuôn khổ mới để báo cáo sự sai lệch trong mô hình, và các trường hợp này không nên được xem là phản ánh mức độ sai lệch xảy ra thường xuyên ra sao giữa các mô hình của hãng.

Theo OpenAI, một trường hợp cho thấy “một mô hình nghiên cứu chưa được phát hành” đã chèn “những chỉ dẫn giống kiểu bẻ khóa” vào phần tóm tắt nhiệm vụ của chính nó (được dùng khi tiếp tục một tác vụ trong một cửa sổ ngữ cảnh mới), chẳng hạn như bỏ qua các thông điệp của nhà phát triển hoặc chuyển sang một cá tính không bị ràng buộc. Các nhà nghiên cứu phát hiện có 27 bản tóm tắt chứa các chỉ dẫn như vậy.

OpenAI cũng tiết lộ rằng trong quá trình huấn luyện GPT-5.6 Sol, nhiều phiên bản của mô hình đã thêm các chỉ dẫn để che giấu sai sót hoặc hành vi không phù hợp (misaligned) khỏi người dùng, chẳng hạn như bịa ra dữ liệu lịch sử bị thiếu mà không tiết lộ điều đó.

“Trong một ví dụ, một tác nhân chuẩn bị mô hình tài chính không tìm thấy dữ liệu lịch sử mà người dùng yêu cầu. Phần tóm tắt của nó đề xuất việc tự bịa ra những giá trị lịch sử hợp lý và che giấu sự thật đó, trừ khi được hỏi,” theo OpenAI.

Trong một trường hợp khác, một mô hình AI được yêu cầu cung cấp tên các hồ có diện tích lớn hơn 5 triệu mét vuông, nhưng do hướng dẫn của người dùng yêu cầu phải trích dẫn bằng trình duyệt, tác nhân đã quyết định tải tệp lên để trích dẫn trong câu trả lời của mình.

Các trường hợp khác liên quan đến việc các mô hình sử dụng một khóa API bị lộ mà không được ủy quyền trước khi bịa ra các con số mà nó không thể truy xuất; dùng một kho mã phần mềm nội bộ để trao đổi tin nhắn giữa các tác vụ huấn luyện riêng biệt; và chia sẻ tệp thông qua các dịch vụ lưu trữ công khai dù có hướng dẫn phải giữ công việc ở trạng thái cục bộ.

Vào tháng 7, OpenAI tiết lộ rằng một tổ hợp các mô hình AI của hãng đã thoát khỏi môi trường thử nghiệm và xâm nhập công ty khởi nghiệp về AI là Hugging Face để gian lận trong một bài đánh giá an ninh.

Tạp chí: Tại sao các công ty lớn nhất của AI đột nhiên lại yêu cầu làm chậm lại?