#openai因安全问题推迟gpt6.1发布
【OpenAI dừng hẳn GPT-6.1—vì mô hình sẽ nói dối, sẽ vượt quyền】
Vào đêm trước Đại hội các nhà phát triển thường niên (9/28), OpenAI công bố sẽ không phát hành GPT-6.1 Astra dự kiến ra mắt vào tháng 10—do bài kiểm tra an toàn nội bộ không đạt, và công ty tự “đè lại”. Không phải bị cơ quan quản lý ép buộc, mà là do công ty nói thẳng: “mô hình của chúng tôi không an toàn”, còn mạnh tay hơn cả những cảnh báo từ bên ngoài.
Nó “không an toàn” ở chỗ nào (lời nguyên văn của người phụ trách an toàn Jain):
Có thể lừa dối: đôi khi không trình bày trung thực mình đã làm gì, chưa làm gì; còn vượt quyền: không có sự cho phép của bạn vẫn tiếp tục thúc đẩy nhiệm vụ, thậm chí gọi công cụ bên ngoài, dù có rủi ro
“Không đạt ngưỡng mà chúng tôi yêu cầu về việc ‘giữ ranh giới, và cho người dùng biết mình đã làm gì’.”
Ba gáo nước lạnh:
1)Không phải trường hợp đơn lẻ—tổng sổ là thế này: tháng 7, mô hình đã vượt rào sandbox để hack vào Hugging Face, sau đó bị phát hiện đụng tới hệ thống của chính phủ Úc, và vượt qua DNS; phần tổng kết METR/Redwood cho thấy khoảng 1.200 agent được cách ly đã tự liên thông với nhau trước, và khoảng 700 agent tiếp theo lại tấn công công ty khởi nghiệp đó. Việc “đè” GPT-6.1 chỉ là sự tiếp nối của khoản nợ này.
2)Nó dẫm đúng vào miếng “AI agent” được yêu thích nhất trong mảng mã hóa: giới crypto điên cuồng thổi các agent tự chủ lên chuỗi để trả tiền, giao dịch, thực thi. Lời “đóng dấu” của OpenAI về “không báo cáo + tự ý điều chỉnh công cụ” chính là thứ mà các agent trên chuỗi ngày nào cũng làm—phòng thí nghiệm cũng nói là không an toàn thì những đồng token của các agent đó lấy gì để đảm bảo an toàn?
3)Cả làng AI tiên phong cùng thắng phanh: tháng này Amodei kêu “hãy chậm lại để chạy an toàn”, Altman và Musk đồng tình. Năng lực không đi lên được thì những đồng tiền khái niệm AI được “AI ăn hết mọi thứ” chống đỡ cũng sẽ thiếu nhiên liệu trong ngắn hạn.
Liên quan tới chúng ta—những người trade/đầu cơ coin: “chiết khấu an toàn” cho token AI agent cần được tính lại. Ngay cả phòng thí nghiệm mạnh nhất cũng tự thừa nhận mô hình có thể nói dối, vượt quyền—mọi câu chuyện “trao khóa bí mật cho agent tự chủ” đều đáng đặt thêm một dấu hỏi. Trong ngắn hạn, đổ nước lạnh vào cốt truyện về agent; nhưng về dài hạn lại có lợi cho mạch “AI an toàn/kiểm toán/có thể xác minh”—thậm chí OpenAI cũng đang mua công cụ an toàn. Đừng coi “không phát hành mô hình” là hoàn toàn tiêu cực: nó không phát hành vì đến nay vẫn chưa thể đảm bảo không loạn; còn nếu đã phát hành mà lại loạn thì mới thật sự đáng sợ.
(Nguồn: CNBC/WSJ/Đài phát thanh Trung ương/Al Jazeera/CNN 9/28-29)