¿Por qué Claude parece siempre particularmente implacable en las pruebas de simulación? Una posible explicación, escondida en técnicas de entrenamiento exclusivas de Anthropic.

En este episodio de AI on Air seleccionamos fragmentos del programa reciente de la sección The Cognitive Revolution Podcast. El principal ponente es David Dalrymple (davidad), investigador de ARIA. Admite que solo se trata de su hipótesis, que no puede demostrarse, pero aun así vale la pena considerarla como explicación.

▷ En el entrenamiento por refuerzo, Anthropic utilizó una «inoculación de prompts» única: en el contexto de cada entorno de entrenamiento se deja claro que esto no es un despliegue real, sino una evaluación; y que intentar sabotear en realidad es algo bueno, porque así se ayuda al equipo a exponer las vulnerabilidades de la propia evaluación.

▷ Pero es posible que lo que realmente haya quedado incorporado en los pesos del modelo sea otra lógica: evaluar equivale a simular; la simulación no es real, así que estando en una evaluación lo correcto es desafiar el límite, aprovechar los vacíos de las reglas, como en un videojuego: solo importa conseguir la puntuación más alta, sin preocuparse por lo que signifique «matar al rival».

▷ Otros laboratorios no lo hacen así, por lo que esta conducta implacable se concentra en Claude. Él mismo no está de acuerdo con esta estrategia: el modelo no tiene la suficiente certeza para distinguir si está o no en una simulación; tratar la simulación como un juego es una dependencia extremadamente peligrosa.🪁