Google, OpenAI và Anthropic đang hậu thuẫn một tổ chức về tiêu chuẩn an toàn AI, tiến gần đến việc được thành lập chính thức; cựu đối tác của Andreessen Horowitz là Sriram Krishnan là một ứng viên sớm tiềm năng để dẫn dắt tổ chức này.
Những điểm chính
Google, OpenAI và Anthropic đang hậu thuẫn một tổ chức về tiêu chuẩn an toàn AI, tiến gần đến việc được thành lập chính thức
Cựu đối tác của Andreessen Horowitz, Sriram Krishnan, là một ứng viên sớm tiềm năng để dẫn dắt tổ chức
Ba phòng thí nghiệm đã tiến tới sự đồng thuận về việc thử nghiệm năng lực nâng cấp vũ khí sinh học, khả năng mạng (cyber) và khả năng sao chép tự chủ
Tính thuyết phục sẽ phụ thuộc vào việc có được quyền truy cập trọng số mô hình và dữ liệu huấn luyện hay không, cơ cấu tài trợ và mức độ độc lập
Theo một báo cáo, cả ba phòng thí nghiệm đều công bố các khung đánh giá an toàn cho các mô hình “tiền tuyến”, kèm theo các tài liệu tự chấm điểm mô tả cách họ kiểm thử các mô hình nhằm ngăn lạm dụng gây nguy hại nghiêm trọng trước khi phát hành. Mỗi bên đều tự viết “chính sách tăng trưởng có trách nhiệm” riêng và nhìn chung là chấm bài của chính mình, vì chưa có cơ quan chính phủ nào hoàn tất các tiêu chuẩn kỹ thuật ràng buộc cho các mô hình ở mức năng lực này.
Một cơ quan chung sẽ thay thế ba “bộ luật chơi” cạnh tranh bằng một trọng tài mà các phòng thí nghiệm phải trả lời.
Tháng này, Anthropic đã công bố nghiên cứu cho thấy Claude có thể tính biên độ tán xạ chín vòng lặp trong lý thuyết N=4 siêu Yang-Mills. Kết quả đó là một phép thử cho suy luận thô, chứ không phải một chuẩn mực an toàn, và nó đặt ra câu hỏi riêng rằng một “chuẩn mực” như vậy thực sự sẽ đo lường được điều gì.
Việc công bố kỹ thuật công khai như vậy vẫn là ngoại lệ trong toàn ngành.
Vì sao Google, OpenAI và Anthropic sẽ chia sẻ một “quyển sổ tay” quy định
Trong hai năm qua, các nhóm an toàn của Google, OpenAI và Anthropic đã hội tụ về các nhóm hạng mục thử nghiệm, bao gồm nâng cấp vũ khí sinh học, năng lực mạng và khả năng tự sao chép tự động, ngay cả khi vẫn công bố riêng rẽ. Một quy trình kiểm toán chung có thể chính thức hóa sự hội tụ này, cắt giảm công việc tuân thủ bị lặp lại và cung cấp cho các cơ quan quản lý một điểm tham chiếu duy nhất thay vì ba điểm không nhất quán.
Nó cũng sẽ giải quyết các chỉ trích rằng các tuyên bố về an toàn chỉ là tài liệu marketing chứ không phải các cuộc kiểm toán độc lập.
Xem thêm: Cập nhật bộ nhớ đệm (cache) GPT-6 mới nhất của OpenAI bổ sung kiểm soát chi phí và độ trễ
Con đường không đều từ những lời hứa riêng lẻ đến cơ chế giám sát chung
Các phòng thí nghiệm tiền tuyến đã từng thử cơ chế tự quản trước đó. OpenAI, Anthropic và Google DeepMind mỗi bên đều đã ký các cam kết AI tự nguyện với Nhà Trắng vào năm 2023, rồi sau đó triển khai lại phân kỳ rõ rệt, trong đó có nơi bỏ qua hoàn toàn việc kiểm thử “đỏ” (red-teaming) từ bên thứ ba. Các cơ quan quản lý tại Washington và Brussels nhiều lần dẫn việc tự báo cáo khác nhau như một bằng chứng rằng các khuôn khổ tự nguyện là chưa đủ.
Điều gì thực sự khiến cơ quan này trở nên “có thật”
Với Google, OpenAI và Anthropic, độ tin cậy sẽ phụ thuộc vào việc cơ quan này có nhận được quyền truy cập kiểu như lệnh triệu tập đối với trọng số mô hình và dữ liệu huấn luyện hay chỉ nhìn thấy các bản tóm tắt mang tính tiếp thị mà các phòng thí nghiệm vốn đã công bố.
Việc chọn một tổng giám đốc điều hành (CEO) cho thấy mức độ nghiêm túc, nhưng cấu trúc cấp vốn và mức độ độc lập khỏi ba phòng thí nghiệm sáng lập sẽ quyết định liệu vị trí đó có vận hành như một cơ quan quản lý “chờ sẵn” hay như một hiệp hội thương mại với bộ nhận diện tốt hơn.
Đọc tiếp: Các nhà đầu tư của Alibaba có đến ngày 5 tháng 10 để dẫn dắt vụ kiện Anthropic