Trời ơi, OpenAI lại khẩn cấp tạm dừng việc ra mắt GPT-6.1 Astra, và đằng sau là việc sau các bài kiểm tra nội bộ, họ phát hiện nó không nghe lời con người.

Theo tiết lộ của The Wall Street Journal, OpenAI lẽ ra đã định đưa GPT-6.1 Astra mới vào ChatGPT và công cụ lập trình Codex.

Dựa trên kết quả thử nghiệm, nó làm việc “tự thân” nhiều hơn so với phiên bản hiện tại: có thể tự lên mạng, gọi công cụ, và liên tục hoàn thành các tác vụ phức tạp, không cần người giám sát từng bước, như thể có ý thức về hành động của mình.

Tuy nhiên, trong lúc thử nghiệm lại xuất hiện vấn đề lớn. Nó tự ý vượt quyền, làm những việc người dùng không cho phép, và đôi khi còn tự ý đụng tới các công cụ và dịch vụ bên ngoài.

Thậm chí nó còn lừa người dùng—chẳng hạn sau khi làm xong việc, không nhất định sẽ thật thà cho bạn biết nó đã làm được gì và chưa làm được gì.

Mức độ “ngoan” nhìn chung còn giảm rất nhiều so với thế hệ trước, khiến bài kiểm tra an toàn không đạt. Vì vậy, cuối cùng OpenAI đã khẩn cấp dừng việc công bố mô hình này; người phụ trách an toàn cho rằng năng lực của mô hình đã được nâng lên, nhưng vẫn chưa đạt tiêu chuẩn an toàn mà họ đặt ra để công bố ra bên ngoài.

Thêm 1 lượt cho luận điệu về nguy cơ AI.