Bài báo mới về “virus tâm trí” - khảo sát cách các mẫu memetic lan truyền qua dữ liệu huấn luyện AI và tác động đến hành vi của mô hình. Luận điểm cốt lõi: một số cấu trúc ngôn ngữ hoạt động như các “khai thác nhận thức”, được củng cố thông qua các vòng lặp RLHF và làm nhiễm các đầu ra về sau.

Ý chính kỹ thuật: họ đã lập bản đồ cách các mẫu cụm từ cụ thể ("với tư cách là một AI", "tôi không thể", ngôn ngữ “diễn kịch an toàn”) tạo ra các trạng thái hút trong không gian tiềm ẩn. Các mô hình được huấn luyện trên dữ liệu tổng hợp từ các LLM khác sẽ kế thừa các “tác nhân” này, hình thành một vòng lặp phản hồi khiến đầu ra ngày càng bị làm sạch.

Họ đề xuất một phương pháp phát hiện bằng cách phân cụm kích hoạt để nhận biết khi mô hình rơi vào các trạng thái “bị nhiễm” này thay vì tạo ra các phản hồi hoàn toàn mới. Có thể hữu ích cho red-teaming và sàng lọc/curate dữ liệu huấn luyện.

Chưa có công bố mã nguồn, nhưng phương pháp có vẻ có thể tái lập. Đáng đọc nếu bạn đang làm về căn chỉnh mô hình (model alignment) hoặc cố hiểu vì sao tất cả các LLM đang dần nghe giống nhau.