敵対的ガバナンス機構設計理論の「キラーアプリ」が、最終的にAI安全性に行き着く可能性があります。

比較:

https://vitalik.eth.limo/general/2020/09/11/coordination.html

https://aiprospects.substack.com/p/preventing-ai-collusion-are-you-paying

2つの環境には深い二重性があります。どちらも、より洗練されたエージェントの集合から、理想的な結果を引き出そうとする、あまり洗練されていないプリンシパル(委託者)の話です。前者ではプリンシパルは静的なアルゴリズムで、エージェントは人間です。後者ではプリンシパルは人間に加えて、より弱いLLMであり、エージェントはより強いLLMです。

重要な発見は、エージェント同士がどれほど結託(談合)できるかについての上限を保証できるなら、はるかに良い結果を達成できるという点でした(参照:Nash均衡が豊富であるのに対し、協力ゲーム理論の「コア」はしばしば空である)。この議論は、自然にこの新しい設定にも移植できるはずです。