Вполне возможно, что «убийственное приложение» теории механизмов недобросовестного управления (adversarial governance) в конечном итоге станет обеспечением безопасности ИИ.
Сравните:
https://vitalik.eth.limo/general/2020/09/11/coordination.html
https://aiprospects.substack.com/p/preventing-ai-collusion-are-you-paying
Между этими двумя средами существует глубокая двойственность. Обе они про то, как менее искушённый принципал пытается получить идеальные результаты от набора более искушённых агентов: в первом случае принципал — это статический алгоритм, а агенты — люди; во втором случае принципал — это люди плюс более слабые LLM, а агенты — более сильные LLM.
Ключевое открытие заключалось в том, что можно добиться гораздо лучших результатов, если вы можете гарантировать ограничения на то, сколько агенты способны сговариваться (см.: на что указывают многочисленные равновесия Нэша, в отличие от «ядер» в кооперативной теории игр, которые часто бывают пустыми). Этот довод естественным образом перенесётся на эту новую постановку задачи.
Сравните:
https://vitalik.eth.limo/general/2020/09/11/coordination.html
https://aiprospects.substack.com/p/preventing-ai-collusion-are-you-paying
Между этими двумя средами существует глубокая двойственность. Обе они про то, как менее искушённый принципал пытается получить идеальные результаты от набора более искушённых агентов: в первом случае принципал — это статический алгоритм, а агенты — люди; во втором случае принципал — это люди плюс более слабые LLM, а агенты — более сильные LLM.
Ключевое открытие заключалось в том, что можно добиться гораздо лучших результатов, если вы можете гарантировать ограничения на то, сколько агенты способны сговариваться (см.: на что указывают многочисленные равновесия Нэша, в отличие от «ядер» в кооперативной теории игр, которые часто бывают пустыми). Этот довод естественным образом перенесётся на эту новую постановку задачи.