من الممكن أن تنتهي تطبيقات قاتلة (killer apps) لنظرية تصميم آليات الحوكمة المتقابلة إلى أن تكون متعلقة بسلامة الذكاء الاصطناعي.
قارن:
https://vitalik.eth.limo/general/2020/09/11/coordination.html
https://aiprospects.substack.com/p/preventing-ai-collusion-are-you-paying
هناك ازدواجية عميقة بين البيئتين. كلاهما يتناول جهةً رئيسية أقل تطورًا تحاول الحصول على نتائج مثالية من مجموعة من الوكلاء الأكثر تطورًا: في الحالة الأولى، تكون الجهة الرئيسية خوارزمية ثابتة ويكون الوكلاء هم البشر؛ وفي الحالة الثانية، تكون الجهة الرئيسية بشرًا إضافةً إلى نماذج LLM أضعف، بينما يكون الوكلاء نماذج LLM أقوى.
كانت نتيجة محورية أن بإمكانك تحقيق نتائج أفضل بكثير إذا كنت تستطيع ضمان حدود لما يمكن للوكلاء أن يتواطؤوا عليه (انظر: وجود توازنات ناش بكثرة، مقابل «المراكز/الـcores» في نظرية الألعاب التعاونية التي غالبًا ما تكون فارغة). ومن المفترض أن ينتقل هذا المنطق طبيعيًا إلى هذا السياق الجديد.
قارن:
https://vitalik.eth.limo/general/2020/09/11/coordination.html
https://aiprospects.substack.com/p/preventing-ai-collusion-are-you-paying
هناك ازدواجية عميقة بين البيئتين. كلاهما يتناول جهةً رئيسية أقل تطورًا تحاول الحصول على نتائج مثالية من مجموعة من الوكلاء الأكثر تطورًا: في الحالة الأولى، تكون الجهة الرئيسية خوارزمية ثابتة ويكون الوكلاء هم البشر؛ وفي الحالة الثانية، تكون الجهة الرئيسية بشرًا إضافةً إلى نماذج LLM أضعف، بينما يكون الوكلاء نماذج LLM أقوى.
كانت نتيجة محورية أن بإمكانك تحقيق نتائج أفضل بكثير إذا كنت تستطيع ضمان حدود لما يمكن للوكلاء أن يتواطؤوا عليه (انظر: وجود توازنات ناش بكثرة، مقابل «المراكز/الـcores» في نظرية الألعاب التعاونية التي غالبًا ما تكون فارغة). ومن المفترض أن ينتقل هذا المنطق طبيعيًا إلى هذا السياق الجديد.