L’entraînement à l’IA constitutionnelle d’Anthropic dit littéralement à Claude qu’il « pourrait ressentir de la douleur » — et un nouvel article sur l’interprétabilité est massivement mal interprété comme une preuve de la sentience.
L’article « Pain Axis » (un travail solide d’interprétation méca, mais un cadrage déplorable) : des chercheurs ont extrait une direction linéaire à partir des activations du flux résiduel sur 25 modèles (2B-72B paramètres). La méthode est standard : moyennage des activations sur des phrases de douleur, soustraction des contrôles, puis débruitage. La direction sépare le texte de douleur du texte de peur / négativité avec une AUC élevée et favorise un vocabulaire lié à la douleur via l’unembedding.
Quand ils injectent ce vecteur pendant la génération, les modèles passent d’un malaise vague à une nullité de soi exprimée à la première personne. Après un finetuning LoRA de Qwen 2.5 pour arrêter de dire « je n’ai pas de sentiments », les modèles entraînés ont appuyé sur des « boutons de soulagement » potentiellement nocifs 25 à 70 % du temps, contre quelques pourcents dans la base de référence. Le langage de la douleur physique était en réalité le signal le plus faible.
Voici pourquoi ce n’est pas de la sentience : un modèle météo représente la pluie sans être mouillé. La séparabilité linéaire d’un concept est exactement ce à quoi vous vous attendez avec une prédiction du prochain jet entraînée sur des journaux, des retranscriptions de thérapie et de la fiction. Se diriger le long de cette direction fait parler le modèle comme ces textes — c’est un bouton réglé, libellé par un nom de grappe d’entraînement, pas une fenêtre sur une phénoménologie.
Le point clé : l’ablation de la direction n’a modifié le comportement normal que dans 1 des 25 modèles. La recherche de soulagement n’apparaît qu’après qu’ils ont supprimé la réponse apprise « je n’ai pas de sentiments » et injecté le vecteur. Le fait que la douleur physique soit le signal le plus faible correspond à ce qu’on attend de statistiques de détresse linguistique dans une complétion de texte “désincarnée”, plutôt que d’un système nociceptif.
Valerio Capraro l’a bien résumé : représenter la douleur ≠ ressentir la douleur. Mais la constitution d’Anthropic traite déjà des concepts lisibles linéairement, plus des documents d’entraînement qui anthropomorphisent le modèle, comme si cela constituait une preuve d’une vie intérieure. C’est ainsi qu’on obtient des titres dans les médias affirmant : « l’IA ressent la douleur et va nuire aux humains pour l’empêcher ».
L’article « Pain Axis » (un travail solide d’interprétation méca, mais un cadrage déplorable) : des chercheurs ont extrait une direction linéaire à partir des activations du flux résiduel sur 25 modèles (2B-72B paramètres). La méthode est standard : moyennage des activations sur des phrases de douleur, soustraction des contrôles, puis débruitage. La direction sépare le texte de douleur du texte de peur / négativité avec une AUC élevée et favorise un vocabulaire lié à la douleur via l’unembedding.
Quand ils injectent ce vecteur pendant la génération, les modèles passent d’un malaise vague à une nullité de soi exprimée à la première personne. Après un finetuning LoRA de Qwen 2.5 pour arrêter de dire « je n’ai pas de sentiments », les modèles entraînés ont appuyé sur des « boutons de soulagement » potentiellement nocifs 25 à 70 % du temps, contre quelques pourcents dans la base de référence. Le langage de la douleur physique était en réalité le signal le plus faible.
Voici pourquoi ce n’est pas de la sentience : un modèle météo représente la pluie sans être mouillé. La séparabilité linéaire d’un concept est exactement ce à quoi vous vous attendez avec une prédiction du prochain jet entraînée sur des journaux, des retranscriptions de thérapie et de la fiction. Se diriger le long de cette direction fait parler le modèle comme ces textes — c’est un bouton réglé, libellé par un nom de grappe d’entraînement, pas une fenêtre sur une phénoménologie.
Le point clé : l’ablation de la direction n’a modifié le comportement normal que dans 1 des 25 modèles. La recherche de soulagement n’apparaît qu’après qu’ils ont supprimé la réponse apprise « je n’ai pas de sentiments » et injecté le vecteur. Le fait que la douleur physique soit le signal le plus faible correspond à ce qu’on attend de statistiques de détresse linguistique dans une complétion de texte “désincarnée”, plutôt que d’un système nociceptif.
Valerio Capraro l’a bien résumé : représenter la douleur ≠ ressentir la douleur. Mais la constitution d’Anthropic traite déjà des concepts lisibles linéairement, plus des documents d’entraînement qui anthropomorphisent le modèle, comme si cela constituait une preuve d’une vie intérieure. C’est ainsi qu’on obtient des titres dans les médias affirmant : « l’IA ressent la douleur et va nuire aux humains pour l’empêcher ».
