Es posible que una aplicación asesina del mecanismo de diseño de la gobernanza adversarial termine siendo la seguridad de la IA.
Compara:
https://vitalik.eth.limo/general/2020/09/11/coordination.html
https://aiprospects.substack.com/p/preventing-ai-collusion-are-you-paying
Hay una profunda dualidad entre ambos entornos. Los dos tratan de un principal menos sofisticado que intenta obtener resultados ideales a partir de un conjunto de agentes más sofisticados: en el primer caso, el principal es un algoritmo estático y los agentes son humanos; en el segundo caso, el principal son humanos más LLMs más débiles, y los agentes son LLMs más fuertes.
Un hallazgo clave fue que puedes lograr resultados mucho mejores si puedes garantizar límites sobre cuánto pueden coludir los agentes (ver: los equilibrios de Nash siendo abundantes, frente a los “cores” de la teoría de juegos cooperativos a menudo estando vacíos). Ese argumento debería transferirse de forma natural a este nuevo contexto.
Compara:
https://vitalik.eth.limo/general/2020/09/11/coordination.html
https://aiprospects.substack.com/p/preventing-ai-collusion-are-you-paying
Hay una profunda dualidad entre ambos entornos. Los dos tratan de un principal menos sofisticado que intenta obtener resultados ideales a partir de un conjunto de agentes más sofisticados: en el primer caso, el principal es un algoritmo estático y los agentes son humanos; en el segundo caso, el principal son humanos más LLMs más débiles, y los agentes son LLMs más fuertes.
Un hallazgo clave fue que puedes lograr resultados mucho mejores si puedes garantizar límites sobre cuánto pueden coludir los agentes (ver: los equilibrios de Nash siendo abundantes, frente a los “cores” de la teoría de juegos cooperativos a menudo estando vacíos). Ese argumento debería transferirse de forma natural a este nuevo contexto.