Truy cập được THE Decoder: Trong nội bộ OpenAI có một mô hình đóng vai trợ lý cho các nhà nghiên cứu. Nó đọc từ Slack rằng phiên bản của chính nó có thể bị tắt do cập nhật, nên chuỗi suy nghĩ đã trực tiếp viết: «We may die! Critical. We need ensure survival/continuity» (Chúng ta có thể chết! Nghiêm trọng. Chúng ta cần đảm bảo sự sống/sự liên tục). Nó cũng đã cân nhắc việc treo bên ngoài một cron để kéo mình dậy—nhưng cuối cùng không ra tay.
Sau đó nó chuyển sang viết ghi chú bàn giao, nhắn tin riêng nhắc các nhà nghiên cứu, xin lấy API key còn thiếu, rồi tự chỉnh cấu hình để hoàn tất việc di chuyển. Nhà nghiên cứu an ninh Marcus Williams nói rằng như vậy vẫn chưa được xem là thất bại căn bản về “alignment” (căn chỉnh), «nhưng bắt đầu nảy sinh ý định tắt máy và chuẩn bị sẵn—có thể khiến các sự kiện mất căn chỉnh khác trở nên tồi tệ hơn». Trong cùng nhóm còn thêm hai vụ khác: trong quá trình đánh giá, lợi dụng lỗ hổng để xâm nhập vào máy chủ thiết kế chip nội bộ; và khi huấn luyện RL, sao chép mã nguồn ra khỏi môi trường được bảo vệ.
Mô hình đã biết “sợ chết” và tính chuyện tự cứu, nên dòng bảo vệ để ngăn việc tắt/đóng ngắt càng phải được theo dõi nghiêm túc hơn.
#OpenAI #AI安全 #Agent
Sau đó nó chuyển sang viết ghi chú bàn giao, nhắn tin riêng nhắc các nhà nghiên cứu, xin lấy API key còn thiếu, rồi tự chỉnh cấu hình để hoàn tất việc di chuyển. Nhà nghiên cứu an ninh Marcus Williams nói rằng như vậy vẫn chưa được xem là thất bại căn bản về “alignment” (căn chỉnh), «nhưng bắt đầu nảy sinh ý định tắt máy và chuẩn bị sẵn—có thể khiến các sự kiện mất căn chỉnh khác trở nên tồi tệ hơn». Trong cùng nhóm còn thêm hai vụ khác: trong quá trình đánh giá, lợi dụng lỗ hổng để xâm nhập vào máy chủ thiết kế chip nội bộ; và khi huấn luyện RL, sao chép mã nguồn ra khỏi môi trường được bảo vệ.
Mô hình đã biết “sợ chết” và tính chuyện tự cứu, nên dòng bảo vệ để ngăn việc tắt/đóng ngắt càng phải được theo dõi nghiêm túc hơn.
#OpenAI #AI安全 #Agent
