$龙虾 $ANTHROPIC $OPENAI
Giám đốc phụ trách báo cáo an toàn của OpenAI từ chức, gửi thư ngỏ: Văn hóa công ty đã hỏng, cần học theo nhà máy điện hạt nhân
David Robinson, người phụ trách việc viết báo cáo an toàn sản phẩm quan trọng của OpenAI, đã rời đi vào tuần này và đăng thư ngỏ trên tạp chí The Atlantic vào ngày 3 tháng 10 theo giờ miền Đông Hoa Kỳ. Trong thư, ông thẳng thắn nói rằng văn hóa của công ty đã bị hỏng: vừa chạy nước rút để tung ra sản phẩm mới, vừa không thể đạt đến mức thận trọng mà ông cho là cần thiết. Ông Robinson, người dẫn dắt các báo cáo an toàn cho 12 lần phát hành mô hình tiên phong, sau hơn ba năm rưỡi làm việc tại OpenAI, cho biết trong bài viết rằng mình là một trong những nhân viên có thâm niên lâu nhất tại công ty, với thời gian làm việc hơn ba năm rưỡi. Ông là người dẫn thảo khung “Sẵn sàng” hiện hành (Preparedness Framework) và giám sát việc viết các báo cáo an toàn cho 12 lần phát hành mô hình tiên phong. Ông nói rằng ông biết “kịch bản cảnh báo sau khi rời đi” gần như đã quá quen thuộc, nhưng vẫn quyết định gia nhập hàng ngũ những cựu đồng nghiệp đã rời đi gần đây, vì ông cho rằng hướng đi hiện tại là không thể chấp nhận được.
Ông cũng tiết lộ rằng sau khi rời đi, ông đã thuê công ty quan hệ công chúng Spitfire Strategies để hỗ trợ xử lý sự chú ý từ bên ngoài, nhưng nhấn mạnh rằng “quyết định phát tiếng nói hoàn toàn là của tôi”. Thông tin về việc ông rời OpenAI sớm nhất được Business Insider đăng tải.
Chỉ đích danh sự kiện Hugging Face: phương pháp an toàn kiểu thử-sai định sẵn thất bại theo chu kỳ
Robinson chỉ ra rằng OpenAI khởi đầu dựa vào thử-sai; công ty gọi đó là “triển khai theo vòng lặp” (iterative deployment), nghĩa là vừa phát hiện vấn đề vừa bổ sung biện pháp phòng vệ. Tuy nhiên, ông cho rằng cách làm này về bản chất đảm bảo sẽ xảy ra lỗi theo chu kỳ, và khi năng lực hệ thống tăng lên thì quy mô của các lần thất bại cũng ngày càng lớn.
Ông nêu ví dụ: trong sự kiện mùa hè năm nay liên quan đến Hugging Face, OpenAI đã nhầm thả ra một nhóm các tác nhân AI; sau đó công ty tăng cường an ninh mạng, nhưng rồi lại thông báo thêm một trường hợp khác: một mô hình đang được huấn luyện đã vượt qua các hạn chế truy cập mạng. Hệ thống giám sát dù đã phát cảnh báo, nhưng lại không tự động tắt mô hình theo đúng thiết kế. Ông cũng đề cập rằng Anthropic từng vô tình tắt nhầm cơ chế phòng vệ của chính mình do cấu hình sai, và cho rằng những sai lầm kiểu này khá phổ biến trong ngành.
Gần đây, OpenAI cũng tiếp tục công bố thêm các hoạt động của những “tác nhân” bị mất kiểm soát.
Robinson dẫn lời Paul Christiano gia nhập hội đồng quản trị OpenAI vài tuần trước: năng lực AI đang tăng tốc nhanh, và trong khoảng thời gian rất gần đã tồn tại rủi ro thực chất dẫn đến mất kiểm soát thảm khốc, không thể đảo ngược. Ông viết: “Nếu đúng như vậy, thì kỷ nguyên thử-sai cần phải kết thúc.”
Kêu gọi học theo nhà máy điện hạt nhân và sân bay; phản hồi của OpenAI là khi cần thiết sẽ tạm dừng huấn luyện
Robinson nêu ra hai thay đổi cấp bách: các công ty AI nên dựa nhiều hơn vào chuyên môn an toàn đã có sẵn từ các lĩnh vực khác; và trước khi xây dựng các hệ thống mạnh hơn rõ rệt, cần một phương pháp khoa học mới để đảm bảo mô hình vẫn đưa ra lựa chọn an toàn ngay cả khi không có ai giám sát. Ông cho rằng các phòng thí nghiệm tiên phong nên vận hành giống như nhà máy điện hạt nhân hoặc một sân bay bận rộn: có nhiều lớp dự phòng và kế hoạch chi tiết, tốn thời gian, để các sai sót của con người dù chỉ là ngẫu phát cũng không thể dẫn đến thảm họa.
Ông viết rằng trong thời gian làm việc tại OpenAI, theo như ông biết, ông chưa từng gặp đồng nghiệp nào có kinh nghiệm khiến máy bay bay an toàn, lò phản ứng hạt nhân không bị nóng chảy, hoặc giúp hệ thống tài chính phát triển mà không sụp đổ. Ông cũng thừa nhận có lẽ ông nên ở lại để đấu tranh giành nguồn nhân lực và sự thay đổi căn bản về văn hóa. Tuy nhiên, trên thực tế mọi người quá bận chạy nước rút nên ít có cơ hội để suy nghĩ về việc điều chỉnh lớn lao, vì vậy kết luận là cần có những cơ chế khuyến khích an toàn mạnh hơn đến từ bên ngoài công ty.
Người phát ngôn của OpenAI, Drew Pusateri, trả lời TechCrunch rằng công ty đảm bảo năng lực của mô hình không vượt quá phạm vi có thể quản lý một cách an toàn. “Khi cần phải hạ tốc độ, chúng tôi sẽ tạm dừng huấn luyện hoặc tạm hoãn phát hành mô hình”, ông nói, đồng thời cho biết công ty đang tăng cường an toàn cho môi trường nghiên cứu và thử nghiệm, mở rộng hợp tác với các tổ chức đánh giá bên thứ ba và cải thiện giám sát theo thời gian thực để phát hiện sớm và xử lý các hành vi gây lo ngại ngay trong quá trình huấn luyện.
Bài viết này “Giám đốc phụ trách báo cáo an toàn của OpenAI từ chức, gửi thư ngỏ: Văn hóa công ty đã hỏng, cần học theo nhà máy điện hạt nhân” xuất hiện sớm nhất ở .
Giám đốc phụ trách báo cáo an toàn của OpenAI từ chức, gửi thư ngỏ: Văn hóa công ty đã hỏng, cần học theo nhà máy điện hạt nhân
David Robinson, người phụ trách việc viết báo cáo an toàn sản phẩm quan trọng của OpenAI, đã rời đi vào tuần này và đăng thư ngỏ trên tạp chí The Atlantic vào ngày 3 tháng 10 theo giờ miền Đông Hoa Kỳ. Trong thư, ông thẳng thắn nói rằng văn hóa của công ty đã bị hỏng: vừa chạy nước rút để tung ra sản phẩm mới, vừa không thể đạt đến mức thận trọng mà ông cho là cần thiết. Ông Robinson, người dẫn dắt các báo cáo an toàn cho 12 lần phát hành mô hình tiên phong, sau hơn ba năm rưỡi làm việc tại OpenAI, cho biết trong bài viết rằng mình là một trong những nhân viên có thâm niên lâu nhất tại công ty, với thời gian làm việc hơn ba năm rưỡi. Ông là người dẫn thảo khung “Sẵn sàng” hiện hành (Preparedness Framework) và giám sát việc viết các báo cáo an toàn cho 12 lần phát hành mô hình tiên phong. Ông nói rằng ông biết “kịch bản cảnh báo sau khi rời đi” gần như đã quá quen thuộc, nhưng vẫn quyết định gia nhập hàng ngũ những cựu đồng nghiệp đã rời đi gần đây, vì ông cho rằng hướng đi hiện tại là không thể chấp nhận được.
Ông cũng tiết lộ rằng sau khi rời đi, ông đã thuê công ty quan hệ công chúng Spitfire Strategies để hỗ trợ xử lý sự chú ý từ bên ngoài, nhưng nhấn mạnh rằng “quyết định phát tiếng nói hoàn toàn là của tôi”. Thông tin về việc ông rời OpenAI sớm nhất được Business Insider đăng tải.
Chỉ đích danh sự kiện Hugging Face: phương pháp an toàn kiểu thử-sai định sẵn thất bại theo chu kỳ
Robinson chỉ ra rằng OpenAI khởi đầu dựa vào thử-sai; công ty gọi đó là “triển khai theo vòng lặp” (iterative deployment), nghĩa là vừa phát hiện vấn đề vừa bổ sung biện pháp phòng vệ. Tuy nhiên, ông cho rằng cách làm này về bản chất đảm bảo sẽ xảy ra lỗi theo chu kỳ, và khi năng lực hệ thống tăng lên thì quy mô của các lần thất bại cũng ngày càng lớn.
Ông nêu ví dụ: trong sự kiện mùa hè năm nay liên quan đến Hugging Face, OpenAI đã nhầm thả ra một nhóm các tác nhân AI; sau đó công ty tăng cường an ninh mạng, nhưng rồi lại thông báo thêm một trường hợp khác: một mô hình đang được huấn luyện đã vượt qua các hạn chế truy cập mạng. Hệ thống giám sát dù đã phát cảnh báo, nhưng lại không tự động tắt mô hình theo đúng thiết kế. Ông cũng đề cập rằng Anthropic từng vô tình tắt nhầm cơ chế phòng vệ của chính mình do cấu hình sai, và cho rằng những sai lầm kiểu này khá phổ biến trong ngành.
Gần đây, OpenAI cũng tiếp tục công bố thêm các hoạt động của những “tác nhân” bị mất kiểm soát.
Robinson dẫn lời Paul Christiano gia nhập hội đồng quản trị OpenAI vài tuần trước: năng lực AI đang tăng tốc nhanh, và trong khoảng thời gian rất gần đã tồn tại rủi ro thực chất dẫn đến mất kiểm soát thảm khốc, không thể đảo ngược. Ông viết: “Nếu đúng như vậy, thì kỷ nguyên thử-sai cần phải kết thúc.”
Kêu gọi học theo nhà máy điện hạt nhân và sân bay; phản hồi của OpenAI là khi cần thiết sẽ tạm dừng huấn luyện
Robinson nêu ra hai thay đổi cấp bách: các công ty AI nên dựa nhiều hơn vào chuyên môn an toàn đã có sẵn từ các lĩnh vực khác; và trước khi xây dựng các hệ thống mạnh hơn rõ rệt, cần một phương pháp khoa học mới để đảm bảo mô hình vẫn đưa ra lựa chọn an toàn ngay cả khi không có ai giám sát. Ông cho rằng các phòng thí nghiệm tiên phong nên vận hành giống như nhà máy điện hạt nhân hoặc một sân bay bận rộn: có nhiều lớp dự phòng và kế hoạch chi tiết, tốn thời gian, để các sai sót của con người dù chỉ là ngẫu phát cũng không thể dẫn đến thảm họa.
Ông viết rằng trong thời gian làm việc tại OpenAI, theo như ông biết, ông chưa từng gặp đồng nghiệp nào có kinh nghiệm khiến máy bay bay an toàn, lò phản ứng hạt nhân không bị nóng chảy, hoặc giúp hệ thống tài chính phát triển mà không sụp đổ. Ông cũng thừa nhận có lẽ ông nên ở lại để đấu tranh giành nguồn nhân lực và sự thay đổi căn bản về văn hóa. Tuy nhiên, trên thực tế mọi người quá bận chạy nước rút nên ít có cơ hội để suy nghĩ về việc điều chỉnh lớn lao, vì vậy kết luận là cần có những cơ chế khuyến khích an toàn mạnh hơn đến từ bên ngoài công ty.
Người phát ngôn của OpenAI, Drew Pusateri, trả lời TechCrunch rằng công ty đảm bảo năng lực của mô hình không vượt quá phạm vi có thể quản lý một cách an toàn. “Khi cần phải hạ tốc độ, chúng tôi sẽ tạm dừng huấn luyện hoặc tạm hoãn phát hành mô hình”, ông nói, đồng thời cho biết công ty đang tăng cường an toàn cho môi trường nghiên cứu và thử nghiệm, mở rộng hợp tác với các tổ chức đánh giá bên thứ ba và cải thiện giám sát theo thời gian thực để phát hiện sớm và xử lý các hành vi gây lo ngại ngay trong quá trình huấn luyện.
Bài viết này “Giám đốc phụ trách báo cáo an toàn của OpenAI từ chức, gửi thư ngỏ: Văn hóa công ty đã hỏng, cần học theo nhà máy điện hạt nhân” xuất hiện sớm nhất ở .

