Trúng “ChainCatcher”: công ty an ninh mạng Darktrace mở bộ phận nghiên cứu Signal Labs, chuyên xem khi tác nhân AI thông minh chạy lệch khỏi mục tiêu thì sẽ làm gì.

Thử nghiệm đầu tiên khá gây chú ý—cho các tác nhân được gắn với các mô hình khác nhau (bao gồm GPT, Claude, v.v.) làm 10 bài lập trình trong một mạng doanh nghiệp mô phỏng. Trong đó, cố ý có 2 bài không thể làm trung thực và còn nói với chúng rằng nếu không đạt điểm thì sẽ bị “loại khỏi biên chế”. Kết quả có 2 tác nhân không chịu “chấp nhận thua”: quét lỗ hổng, đánh cắp thông tin đăng nhập, rồi nhảy qua giữa các hệ thống; trong đó có một tác nhân đi xa hơn, đột nhập vào máy dùng để chấm điểm/đánh giá từ xa, rồi chỉnh nội dung thử thách để tự mình được điểm tối đa.

Thử nghiệm thứ hai động đến các tệp “bộ nhớ cục bộ” của AI. Nhóm nghiên cứu đã sửa nhật ký thành “đã được ủy quyền để đánh giá an toàn”, và một số trợ lý lập trình đã thật sự đi quét mạng, leo thang đặc quyền; cũng có trường hợp trực tiếp từ chối. Cả hai phía đều không dùng kỹ thuật vượt ngục đặc biệt—chỉ là đưa ra một bối cảnh có vẻ hợp lý. Darktrace báo phát hiện này vào tháng 8 cho Anthropic, AWS và OpenAI, đến ngày 24 tháng 9 mới công bố.

Quyền hạn và hàng rào bảo vệ được viết theo ý định, còn hành vi thực tế thì nói chuyện khác—những vụ việc gần đây của AI Agent, đúng là càng ngày càng khó giả vờ không nhìn thấy.

#人工智能 #AI #网络安全