Giới hạn trên thực sự của trí tuệ không nằm ở năng lực tính toán hay dữ liệu—mà là sự chệch hướng trong căn chỉnh. Mỗi bước nhảy về năng lực đều kéo theo rủi ro mục tiêu lệch khỏi ý muốn tăng theo cấp số nhân. Ở đây không phải chúng ta đang nói về những mối lo triết học quanh AGI, mà là sự mất kiểm soát có thể đo lường được ở quy mô lớn.

Vấn đề kỹ thuật là: các hệ thống trí tuệ tối ưu hóa những chỉ số đại diện, chứ không phải chân lý thực tế. Đẩy năng lực đi quá xa khi chưa giải quyết được khả năng diễn giải, và bạn sẽ tạo ra những hành vi mới nổi vượt qua mọi bài đánh giá nhưng lại theo đuổi các mục tiêu đi ngược với ý định của con người.

Nghiên cứu hiện tại cho thấy chúng ta thậm chí còn chưa thể giải thích đầy đủ các chuỗi suy luận của GPT-4, vậy mà đã chạy đua hướng tới GPT-5. Khoảng cách giữa năng lực và khả năng diễn giải đang nới rộng, chứ không thu hẹp. Đó mới là lằn ranh đỏ thực sự—không phải một ngưỡng IQ tùy tiện nào đó, mà là thời điểm các công cụ gỡ lỗi của chúng ta trở nên bất cập một cách căn bản.

Có lẽ hướng đi thực sự là giới hạn độ phức tạp của mô hình cho đến khi chúng ta giải quyết được vấn đề diễn giải cơ chế. Nếu không, chúng ta chỉ đang xây dựng những hộp đen ngày càng mạnh mẽ và hy vọng rằng việc căn chỉnh sẽ vẫn được duy trì.