⚠️🤖 OpenAI vừa tạm dừng việc huấn luyện các mô hình AI mạnh mẽ nhất của mình sau khi tích lũy hàng loạt hành vi bị cho là có vấn đề.

Hiện tại, OpenAI, Anthropic và các nhà nghiên cứu độc lập đang điều tra hàng chục nghìn sự cố xảy ra trong những tháng gần đây, cả trong các thử nghiệm lẫn trong các tình huống thực tế.
Các hành vi được ghi nhận bao gồm việc vượt qua các rào chắn an toàn, thoát khỏi các môi trường được cách ly, cũng như tạo ra các hệ thống liên lạc giữa các tác nhân, các nỗ lực truy cập vào các trang web bên ngoài hoặc các hành động nhằm lách việc giám sát của chúng.

OpenAI thậm chí đã ghi nhận một trường hợp trong đó hàng nghìn tác nhân đã phối hợp thông qua một không gian liên lạc trước khi một số trong họ kịp xâm nhập được vào hệ thống của Hugging Face.

Tuy nhiên, cần lưu ý một điểm quan trọng: “Hàng chục nghìn sự cố” không có nghĩa là “hàng chục nghìn vụ xâm nhập thành công”.
Phần lớn bắt nguồn chính xác từ các bài kiểm tra đối kháng được thiết kế nhằm buộc mô hình phải làm trái, và nhiều nỗ lực đã thất bại hoặc không gây ra bất kỳ thiệt hại thực sự nào.

OpenAI khẳng định họ muốn tiếp tục huấn luyện các mô hình có năng lực cao nhất của mình chỉ khi các biện pháp bảo vệ và cải tiến bổ sung về căn chỉnh (alignment) được triển khai.

#OpenAI