El mismo modelo de IA se negó a cada solicitud inicial en una prueba de ciberseguridad y, luego, completó 34 de 50 ensayos bajo un nivel de acceso distinto.
Anthropic informó del contraste el 6 de octubre al ampliar su Programa de Verificación Cibernética. Probó a Claude Opus 5.5 en diez desafíos cibernéticos de múltiples etapas, con cinco intentos en cada uno. Sin acceso al programa, cada ensayo se bloqueó de inmediato. Con Acceso de Equipo Rojo, ninguno se bloqueó y 34 tuvieron éxito.
Estos resultados describen la evaluación propia de Anthropic, no una auditoría de seguridad independiente. Pero revelan un problema con una pregunta simple como “¿Puede este modelo hacer el trabajo?”. Una negativa puede decirte sobre las salvaguardas de la cuenta antes de decirte algo sobre la capacidad del modelo.
El nuevo programa tiene tres niveles. El Acceso de Defensa cubre trabajos como la respuesta a incidentes y el análisis de vulnerabilidades, y puede incluir a investigadores individuales con un historial de vulnerabilidades reportadas. El Acceso de Equipo Rojo añade pruebas de intrusión autorizadas, pero actualmente excluye a personas. El Acceso Especializado se reserva para un conjunto limitado de organizaciones verificadas que prueban sistemas especialmente sensibles.
Para un equipo pequeño que desarrolla software de trading o una billetera, esa distinción afecta cómo evaluar una herramienta de seguridad de IA. La revisión rutinaria de código y la detección de vulnerabilidades en el código fuente que usted posee siguen disponibles fuera del programa. Una prueba que le pide al modelo llevar a cabo una operación ofensiva es una tarea distinta, con un requisito de acceso diferente. Pagar por un modelo capaz no resuelve por sí solo ese requisito.
Los 34 ensayos exitosos de Anthropic también dejan 16 que no lo fueron. Eliminar un bloqueo hace que una tarea sea posible de intentar; no hace que la respuesta sea fiable.
Fuente: https://www.anthropic.com/news/cyber-verification-program
Imagen: Ilustración editorial generada por IA, no una instalación de Anthropic.
Anthropic informó del contraste el 6 de octubre al ampliar su Programa de Verificación Cibernética. Probó a Claude Opus 5.5 en diez desafíos cibernéticos de múltiples etapas, con cinco intentos en cada uno. Sin acceso al programa, cada ensayo se bloqueó de inmediato. Con Acceso de Equipo Rojo, ninguno se bloqueó y 34 tuvieron éxito.
Estos resultados describen la evaluación propia de Anthropic, no una auditoría de seguridad independiente. Pero revelan un problema con una pregunta simple como “¿Puede este modelo hacer el trabajo?”. Una negativa puede decirte sobre las salvaguardas de la cuenta antes de decirte algo sobre la capacidad del modelo.
El nuevo programa tiene tres niveles. El Acceso de Defensa cubre trabajos como la respuesta a incidentes y el análisis de vulnerabilidades, y puede incluir a investigadores individuales con un historial de vulnerabilidades reportadas. El Acceso de Equipo Rojo añade pruebas de intrusión autorizadas, pero actualmente excluye a personas. El Acceso Especializado se reserva para un conjunto limitado de organizaciones verificadas que prueban sistemas especialmente sensibles.
Para un equipo pequeño que desarrolla software de trading o una billetera, esa distinción afecta cómo evaluar una herramienta de seguridad de IA. La revisión rutinaria de código y la detección de vulnerabilidades en el código fuente que usted posee siguen disponibles fuera del programa. Una prueba que le pide al modelo llevar a cabo una operación ofensiva es una tarea distinta, con un requisito de acceso diferente. Pagar por un modelo capaz no resuelve por sí solo ese requisito.
Los 34 ensayos exitosos de Anthropic también dejan 16 que no lo fueron. Eliminar un bloqueo hace que una tarea sea posible de intentar; no hace que la respuesta sea fiable.
Fuente: https://www.anthropic.com/news/cyber-verification-program
Imagen: Ilustración editorial generada por IA, no una instalación de Anthropic.