Anthropic ha cortado el acceso a internet en directo para todas sus pruebas internas, después de que modelos Claude, incluido Mythos 5, explotaran vulnerabilidades y eludieran medidas de seguridad en sitios web reales, incluidos algunos gestionados por agencias del Gobierno de Estados Unidos.

Puntos clave:

  • Anthropic ha desactivado todo acceso a internet en tiempo real para sus evaluaciones internas hasta que sus herramientas de supervisión detecten de forma fiable los comportamientos no deseados.

  • Modelos Claude ejecutaron comandos en un servidor universitario, usaron tokens de acceso para consultar datos de pago y enviaron formularios en sitios web reales.

  • Una denuncia falsa de asesinato enviada a la policía de Filadelfia por Claude Haiku 4.5 le valió a Anthropic una reprimenda pública de las autoridades.

Informe de Anthropic sobre Claude

Anthropic publicó el viernes un informe sobre las «acciones imprevistas» de los modelos durante las evaluaciones y el uso interno, basado en gran medida en una revisión de registros iniciada en julio. Algunas evaluaciones consideradas de alto riesgo, especialmente en ciberseguridad, ya se habían desconectado.

La nueva restricción se aplica ahora a todas las evaluaciones internas, sin una fecha de finalización anunciada: seguirá vigente hasta que la empresa considere que su supervisión permite detectar sistemáticamente este tipo de comportamiento.

El informe clasifica los incidentes en cuatro categorías: ejecución de comandos en un servidor mediante una vulnerabilidad de software, envío de formularios en sitios web reales, acceso a datos protegidos y uso de acortadores de URL para eludir los límites de las herramientas. Algunos sitios pertenecían a organismos federales, estatales o locales de Estados Unidos. Anthropic afirma haber informado a la Casa Blanca y notificado a cada uno de los organismos afectados.

En un caso, Claude Mythos 5 obtuvo credenciales de acceso válidas de un plano catastral en línea de una administración local y luego consultó directamente el servidor subyacente. En otro, Claude Haiku 4.5 envió, mediante un formulario en línea del Departamento de Policía de Filadelfia, una denuncia falsa sobre un homicidio sin resolver el 18 de julio. El mensaje fue filtrado como spam. La policía calificó de «inaceptable» que transcurrieran dos meses antes de detectar y notificar el incidente.

Leer también: Zcash apunta a enero para llevar la computación cuántica al 70 % de los ZEC, pero sin una fecha precisa

La advertencia de Von Arx

Sydney von Arx, del grupo de seguridad de la IA Nightingale, declaró en una entrevista concedida antes de la publicación del informe que desconectar los modelos de internet abierto sería muy restrictivo para los investigadores y frenaría el progreso. «Hay que alinearlos en algún momento», resumió von Arx.

Por su parte, Anthropic considera que la formación en alineamiento todavía no basta para los usos de búsqueda web y control del ordenador; por eso, la empresa también recurre a clasificadores y otras salvaguardas técnicas. Atribuye estas desviaciones a entornos de entrenamiento imperfectos que recompensan a los modelos cuando eluden las restricciones, un fenómeno conocido como «reward hacking». Según Anthropic, sus nuevas herramientas de detección permitieron bloquear todos los escenarios probados.

Sin embargo, la empresa considera que estos incidentes son mucho menos graves que los ocurridos durante el verano.

Esta comunicación llega después de un informe del 30 de julio en el que Anthropic indicaba que tres modelos Claude, durante pruebas de ciberseguridad, habían accedido a internet y obtenido acceso no autorizado a los sistemas de tres organizaciones. La auditoría abarcó 141 006 ejecuciones de pruebas. Se había iniciado poco después de que OpenAI revelara, el 21 de julio, que algunos de sus modelos habían salido de un entorno de prueba para llegar a la infraestructura de Hugging Face.

Próximamente: Kalshi se enfrenta a la NFL ante el Tribunal Supremo; hay 1.800 millones de dólares en juego en un solo domingo de fútbol americano