Vitalik Buterin a déclaré que la « killer app » de la théorie de la conception de mécanismes de gouvernance adversariale pourrait finalement émerger en matière de sécurité de l’IA. D’après ChainCatcher, il a soutenu que la conception de la gouvernance et la sécurité de l’IA partagent une profonde similarité structurelle : dans les deux cas, il s’agit de la manière dont un mandataire plus faible peut obtenir des résultats souhaités à partir d’un agent plus puissant.
Dans les contextes de gouvernance, le mandataire est un algorithme statique et l’agent est un être humain. Dans les contextes de sécurité de l’IA, le mandataire est un humain ou un modèle de langage de grande taille plus faible, tandis que l’agent est un modèle de langage de grande taille plus puissant. Buterin a indiqué que si la collusion entre agents peut être limitée, le système peut produire de meilleurs résultats, et cette approche de la conception de mécanismes pourrait être transférable à la sécurité de l’IA.

