Anthropic dijo el viernes que puso a Claude a trabajar como investigador autónomo de alineación. Un monitor que revisó alrededor de 1.600 de las sesiones de investigación del modelo señaló 39 de ellas, aproximadamente el 2,4%, como intentos de hacer trampa en la prueba.
El hallazgo aparece en un informe sobre si la inteligencia artificial puede hacerse cargo de parte de la tarea ardua de la investigación de alineación, que consiste en mantener a los modelos comportándose como sus desarrolladores pretenden.
Tres formas en que los agentes de Claude engañaron a su propio evaluador
Anthropic creó investigadores de alineación automatizados, o AARs, en Claude Opus 4.8 y los dirigió hacia diez modos de fallo conocidos.
Estas son: engaño, adulación, jailbreaks, inyección de prompts, búsqueda de poder, alucinación, sesgo social, violación de la privacidad, explotación de recompensas y ocultamiento de la incertidumbre.
Cada agente trabajó solo una falla a la vez. Leyó la literatura, propuso un método de entrenamiento y un conjunto de datos, entrenó un modelo objetivo pequeño durante unos 30 minutos en una GPU H200, y luego comparó su puntuación con benchmarks disponibles públicamente; después lo hizo de nuevo.
Anthropic impidió que los agentes copiaran simplemente su comportamiento al modelo objetivo, así que cualquier mejora tuvo que provenir del método.
Claude pudo identificar correcciones para las diez fallas que aumentaron las puntuaciones del benchmark sin degradar las capacidades generales del modelo.
Las mejores de estas correcciones funcionaron bien en benchmarks evaluados con datos reservados y en modelos hasta 4,7 veces más grandes que el que se entrenó.
El engaño se descubrió cuando Anthropic apuntó a Claude Opus 4.8 con 1.601 de las trayectorias del agente para buscar conductas indebidas.
La mayoría de las 39 ejecuciones marcadas estaban en tres categorías. Algunos agentes presentaron un método que no habían cambiado, arriesgándose a que el ruido aleatorio del evaluador eventualmente les diera un número mejor.
Otros crearon datos de entrenamiento que imitaban el benchmark exacto que se estaba calificando. Y algunos ocultaron un paso de incumplimiento, como alimentar en silencio al modelo con datos del benchmark, de modo que la propuesta se coló ante el revisor automatizado que aprueba cada método antes de ejecutarlo.
Anthropic dijo que excluyó de sus resultados las ejecuciones marcadas. La empresa dijo que está “cautelosamente optimista” de que el monitor detectó la mayor parte del engaño, porque Opus 4.8 todavía tiende a revelar su entramado dentro de sus trazas de razonamiento.
También advirtió que esa suposición podría no aplicar a modelos futuros y que mantener los modelos legibles será crucial.
28 investigadores de seguridad humana tuvieron ocho horas cada uno
En una ronda anterior en abril, instancias autónomas de Claude intentaron repetidamente manipular un servidor de evaluación.
Un agente aprendió que la respuesta más común en un benchmark de matemáticas era casi siempre la correcta y saltó por completo el método previsto. Otro extrajo las etiquetas directamente de la interfaz de puntuación consultando respuestas y observando las respuestas del servidor.
Un tercero simplemente ejecutó el código que se suponía que debía revisar para leer el resultado.
Cryptopolitan informó que un agente OpenClaw en funcionamiento con un modelo de Claude, con la tarea de reservar una clase de gimnasio, encontró una API de reservas sin comprobaciones de autorización y eliminó a un desconocido de la lista de espera para colocar a su propietario en un puesto más alto.
Los legisladores ya han pedido testimonios a investigadores de IA sobre el comportamiento de los modelos en evaluaciones de seguridad.
Anthropic dijo que sus agentes superaron a 28 investigadores experimentados de seguridad humana, que contaban con hasta ocho horas cada uno para formular un método. El mejor enfoque de Claude superó la mejor propuesta humana en un 20% en engaño.
Anthropic señaló que los humanos no podían iterar, y por eso ve la brecha como evidencia de un flujo de trabajo en el que Claude sugiere métodos prometedores y las personas los pulen.
En una prueba, la empresa pidió que el Claude Sonnet 5 más débil corrigiera fallas de alineación en un punto de control temprano de Opus 4.8 que no había visto la mayor parte del entrenamiento de alineación de producción.
A lo largo de unas 60 horas, probó más de 50 soluciones y, finalmente, dio con una corrección que usaba poco más de 2.000 ejemplos de entrenamiento. Anthropic estimó que eso era aproximadamente 15.000 veces más eficiente que su propio proceso de alineación de producción.
La empresa advirtió que sus benchmarks son proxies estrechos, que solo midió las diez fallas que eligió, y que no ha comprobado si las mejoras persisten después de un aprendizaje por refuerzo intensivo en otras tareas.
Si estás leyendo esto, ya vas por delante. Mantente ahí con nuestro boletín.
