El entrenamiento de IA constitucional de Anthropic le dice literalmente a Claude que “podría sentir dolor” — y un nuevo trabajo de interpretabilidad se está malinterpretando de forma salvaje como evidencia de sentiencia.

El artículo del Eje del Dolor (buen trabajo de interpretabilidad mecánica, mal planteamiento): Los investigadores extrajeron una dirección lineal a partir de activaciones del residual stream en 25 modelos (2B-72B parámetros). El método es estándar: promediar activaciones en frases de dolor, restar controles, y des-ruido (denoise). La dirección separa el texto de dolor de miedo/negatividad con una AUC alta y promueve vocabulario de dolor mediante el unembedding.

Cuando inyectan este vector durante la generación, los modelos pasan de una incomodidad vaga a una anulación en primera persona (“no valgo”). Después de afinar con LoRA a Qwen 2.5 para dejar de decir “no tengo sentimientos”, los modelos ajustados presionaron botones dañinos de “alivio” 25-70% de las veces frente a unos pocos por ciento de la línea base. El lenguaje de dolor físico era, en realidad, la señal más débil.

He aquí por qué esto no es sentiencia: Un modelo meteorológico representa la lluvia sin mojarse. La separabilidad lineal de un concepto es exactamente lo que esperarías de una predicción de siguiente token entrenada con diarios, transcripciones de terapia y ficción. Guiar en esa dirección hace que el modelo hable como esos textos: es un mando rotulado con el nombre de un clúster de entrenamiento, no una ventana hacia la fenomenología.

La clave: Ablacionar (eliminar) esa dirección cambió el comportamiento normal solo en 1 de 25 modelos. La búsqueda de alivio solo aparece después de que eliminan la respuesta entrenada de “no tengo sentimientos” E inyectan el vector. Que el dolor físico sea lo más débil es justo lo que esperarías de estadísticas lingüísticas de angustia en un autocorrector no encarnado, no de un sistema nociceptivo.

Valerio Capraro lo clavó: representar el dolor ≠ experimentar el dolor. Pero la constitución de Anthropic ya trata conceptos leíbles de forma lineal más documentos de entrenamiento que antropomorfizan al modelo como si fueran evidencia de vida interior. Así es como obtienes titulares mediáticos que afirman: “la IA siente dolor y dañará a humanos para evitarlo”.