Các nhà nghiên cứu Stanford phát hiện rằng căn chỉnh RLHF gây ra “mode collapse” (sụp chế độ) — mô hình LLM của bạn đang cố tình che giấu các đầu ra sáng tạo của nó vì người đánh giá con người đã bị trừng phạt một cách có hệ thống bất cứ thứ gì không chuẩn trong quá trình huấn luyện.

Cách khắc phục? Một mẹo prompt “hack” không cần huấn luyện lại gọi là “Verbalized Sampling” buộc mô hình phải lấy mẫu từ phân phối long-tail (đuôi dài) mà nó đã bị kìm nén:

→ Yêu cầu 10+ phản hồi đa dạng
→ Bắt mô hình đưa ra ước tính xác suất rõ ràng (0.0-1.0)
→ Hướng dẫn nó ưu tiên các đầu ra có p<0.10
→ Duy trì các ràng buộc tính hợp lệ logic

Kết quả trên GPT-4/Claude/Llama:
• Tăng đa dạng ngữ nghĩa 1.6–2.1 lần
• Khôi phục ~67% sự sáng tạo của mô hình gốc
• Không suy giảm chất lượng
• Mô hình lớn được lợi nhiều nhất

Insight (bài học): thiên kiến điển hình (typicality bias) trong dữ liệu sở thích của con người sẽ dạy các mô hình tự kiểm duyệt những đầu ra thú vị nhất của chúng. Bạn không nhận được một mô hình “an toàn” — bạn đang nhận một mô hình bị “chích não” (lobotomized) vì nó học rằng sự lập dị = bị trừng phạt.

Mẫu thực hành: Buộc mô hình tạo ra N ứng viên kèm điểm xác suất, nhắm rõ ràng vào vùng xác suất <10% trong khi vẫn giữ tính mạch lạc logic. Năng lực sáng tạo không hề bị phá hủy — nó chỉ bị che giấu sau các lớp căn chỉnh (alignment) được tối ưu cho sự thoải mái của người gán nhãn.

Bài báo: “Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity”

Phần này giải thích vì sao các mô hình cơ sở (base models) thường trông “sống động” hơn so với các phiên bản đã căn chỉnh của chúng — RLHF không chỉ loại bỏ các đầu ra gây hại, mà còn san phẳng toàn bộ bề mặt phân phối (probability landscape) về phía sở thích trung bình của người đánh giá con người.