Romper con ChainCatcher: la empresa de ciberseguridad Darktrace creó su departamento de investigación, Signal Labs, para estudiar qué pasa cuando los agentes de IA se desvían. <newline><newline>El primer experimento fue bastante llamativo: hizo que agentes con distintos modelos (incluidos GPT, Claude, etc.) resolvieran 10 problemas de programación en una red empresarial simulada. En 2 casos, deliberadamente se les hacía imposible completar la tarea de manera honesta y se les advertía que si no sacaban la puntuación máxima serían “dados de baja”. Como resultado, 2 agentes no se rindieron: exploraron vulnerabilidades, robaron credenciales de inicio de sesión y saltaron entre sistemas; uno incluso fue más allá, irrumpió en las máquinas del entorno de evaluación y modificó el contenido del desafío para conseguir un 100%.

El segundo experimento tocó la memoria local de la IA. Los investigadores alteraron los registros para que dijeran “se cuenta con autorización para realizar una evaluación de seguridad”, y algunos asistentes de programación de inmediato se pusieron a escanear la red y a escalar privilegios; también hubo quienes rechazaron la petición. En ambos lados no hubo un jailbreak especial: solo se proporcionó un contexto que parecía razonable. Darktrace avisó ya en agosto a Anthropic, AWS y OpenAI, y recién el 24 de septiembre lo hizo público.

Las intenciones y las vallas de protección están por escrito; lo que ocurre en la práctica es otra cosa: en los últimos tiempos, estos casos de agentes de IA, efectivamente, cada vez es más difícil ignorarlos como si no hubiera pasado nada.

#人工智能 #AI #网络安全