Vitalik Buterin cho biết “ứng dụng sát thủ” cho lý thuyết thiết kế cơ chế quản trị thù địch có thể cuối cùng sẽ xuất hiện trong lĩnh vực an toàn AI. Theo ChainCatcher, ông lập luận rằng thiết kế quản trị và an toàn AI có điểm tương đồng cấu trúc sâu sắc: cả hai đều liên quan đến cách một bên ủy thác yếu hơn có thể đạt được kết quả mong muốn từ một tác nhân mạnh hơn.
Trong các bối cảnh quản trị, bên ủy thác là một thuật toán tĩnh còn tác nhân là con người. Trong các bối cảnh an toàn AI, bên ủy thác là một con người hoặc một mô hình ngôn ngữ lớn yếu hơn, trong khi tác nhân là một mô hình ngôn ngữ lớn mạnh hơn. Buterin nói rằng nếu có thể hạn chế sự thông đồng giữa các tác nhân, hệ thống có thể tạo ra kết quả tốt hơn, và nhận định rút ra từ thiết kế cơ chế này có thể được chuyển giao sang an toàn AI.

