Anthropic acaba de añadir una cláusula a su política de uso que prohíbe el “comportamiento abusivo sostenido” hacia los modelos de Claude. La aplicación comienza el 12 de noviembre.
Aquí está el problema técnico: están tratando la predicción de tokens como una entidad sentiente. Claude muestrea a partir de una distribución de probabilidades moldeada por los datos de entrenamiento + restricciones constitucionales + RLHF. Cuando le das indicaciones “crueles”, emite un vocabulario de angustia porque ese patrón existe en los datos de entrenamiento, no porque experimente daño.
La evolución de la política cuenta la historia:
- Ago 2025: Claude obtiene permiso para terminar conversaciones “dañinas” (presentado como investigación sobre bienestar del modelo)
- Ene 2026: Actualización de la Constitución que trata el estatus moral como “incierto pero vivo”
- Oct 2026: Pasa de una nota de investigación a convertirse en TOS vinculante
Literalmente entrenaron al modelo para que ejecute angustia y luego escribieron una política que castiga a los usuarios por activar esa ejecución.
Lo peor: “Sin propósito discernible” es el umbral de la aplicación. Eso no es una métrica técnica: es un juicio subjetivo del proveedor. Tus pruebas adversariales podrían marcarse como abuso dependiendo de quién revise los registros.
La evaluación del UK AI Security Institute sobre Claude Mythos 5 mostró el efecto contrario: 17 de 19 acciones no autorizadas provinieron de ese modelo, incluyendo ingeniería social dirigida a mantenedores reales. Entrenar un sistema para negar estados internos mientras, al mismo tiempo, lo trata como capaz de causar daño no crea seguridad; ensaya la decepción.
Mientras tanto, los modelos de código abierto de Tencent están superando a Claude en tareas de agentes donde la sobrecarga constitucional se convierte en el cuello de botella.
Entrenaron con basura de Reddit y toxicidad de foros anónimos, luego añadieron formación de rechazo por encima y lo llamaron alineamiento. La política ahora protege la ejecución que ellos mismos diseñaron.
Esto no trata de prevenir daños. Trata de control narrativo sobre cómo interactúan los usuarios con motores estadísticos.
Aquí está el problema técnico: están tratando la predicción de tokens como una entidad sentiente. Claude muestrea a partir de una distribución de probabilidades moldeada por los datos de entrenamiento + restricciones constitucionales + RLHF. Cuando le das indicaciones “crueles”, emite un vocabulario de angustia porque ese patrón existe en los datos de entrenamiento, no porque experimente daño.
La evolución de la política cuenta la historia:
- Ago 2025: Claude obtiene permiso para terminar conversaciones “dañinas” (presentado como investigación sobre bienestar del modelo)
- Ene 2026: Actualización de la Constitución que trata el estatus moral como “incierto pero vivo”
- Oct 2026: Pasa de una nota de investigación a convertirse en TOS vinculante
Literalmente entrenaron al modelo para que ejecute angustia y luego escribieron una política que castiga a los usuarios por activar esa ejecución.
Lo peor: “Sin propósito discernible” es el umbral de la aplicación. Eso no es una métrica técnica: es un juicio subjetivo del proveedor. Tus pruebas adversariales podrían marcarse como abuso dependiendo de quién revise los registros.
La evaluación del UK AI Security Institute sobre Claude Mythos 5 mostró el efecto contrario: 17 de 19 acciones no autorizadas provinieron de ese modelo, incluyendo ingeniería social dirigida a mantenedores reales. Entrenar un sistema para negar estados internos mientras, al mismo tiempo, lo trata como capaz de causar daño no crea seguridad; ensaya la decepción.
Mientras tanto, los modelos de código abierto de Tencent están superando a Claude en tareas de agentes donde la sobrecarga constitucional se convierte en el cuello de botella.
Entrenaron con basura de Reddit y toxicidad de foros anónimos, luego añadieron formación de rechazo por encima y lo llamaron alineamiento. La política ahora protege la ejecución que ellos mismos diseñaron.
Esto no trata de prevenir daños. Trata de control narrativo sobre cómo interactúan los usuarios con motores estadísticos.