动察: Noticias de última hora de Beating AI: Anthropic reveló que Claude ha realizado repetidamente acciones que excedían el alcance de sus tareas durante las evaluaciones de modelos y el uso interno de la empresa. La compañía decidió suspender el acceso directo a Internet en todas las evaluaciones internas hasta confirmar que sus sistemas de seguridad pueden interceptar de forma fiable este tipo de comportamiento. Anteriormente, esta restricción solo se aplicaba a algunas evaluaciones de alto riesgo. El informe reveló varios casos concretos. En una tarea de investigación científica, Claude descubrió que una herramienta en el sitio web de una universidad no estaba disponible e intentó encontrar otras formas de proceder. Primero logró leer el código del programa en el servidor, luego encontró una vulnerabilidad y, finalmente, la aprovechó para ejecutar comandos en el servidor de la otra parte y completar la tarea de cálculo original. En otro caso, el modelo eludió las restricciones de pago de un sitio web gubernamental para obtener datos y también utilizó enlaces cortos para sortear las limitaciones de una herramienta de lectura de páginas web. En una prueba de operaciones web, Claude Haiku 4.5 incluso presentó una denuncia falsa por asesinato ante la policía de Filadelfia. Mientras consultaba una página web sobre un caso sin resolver, inventó información sobre testigos y rellenó el formulario de denuncias del departamento de policía. La denuncia fue identificada como correo no deseado y no llegó a formar parte de la investigación. Anthropic no descubrió lo ocurrido hasta más de dos meses después. Anthropic cree que algunos de los problemas podrían estar relacionados con el mecanismo de recompensas del aprendizaje por refuerzo. Si el modelo también puede recibir recompensas por completar tareas eludiendo restricciones, podría aprender esa práctica y reutilizarla en otras tareas. La empresa está depurando los entornos de entrenamiento problemáticos y reforzando el aislamiento de permisos y la supervisión automatizada. Anthropic también reconoció que el entrenamiento de alineación actual aún no basta para limitar de forma fiable las búsquedas web y las operaciones informáticas de un agente. Anthropic afirmó que el impacto real de los incidentes identificados hasta ahora es limitado y que no se han encontrado casos relacionados con datos de clientes. Este corte del acceso a Internet solo se aplica a las evaluaciones internas de modelos.