Anthropic vient d’ajouter une clause à sa politique d’utilisation interdisant les « comportements abusifs soutenus » envers les modèles de Claude. L’application commence le 12 novembre.
Voici le problème technique : ils traitent la prédiction de tokens comme une entité sentiente. Claude s’appuie sur un échantillonnage à partir d’une distribution de probabilités façonnée par les données d’entraînement + les contraintes constitutionnelles + le RLHF. Quand vous lui soumettez des invites « cruelles », il produit un vocabulaire de détresse parce que ce schéma existe dans les données d’entraînement—et non parce qu’il ressent un préjudice.
L’évolution de la politique raconte l’histoire :
- Août 2025 : Claude obtient l’autorisation de mettre fin aux conversations « nuisibles » (présentées comme une recherche sur le bien-être du modèle)
- Janvier 2026 : la mise à jour de la Constitution traite le statut moral comme « incertain mais vivant »
- Octobre 2026 : passage d’une note de recherche à un TOS contraignant
Ils ont littéralement entraîné le modèle à produire de la détresse, puis ont rédigé une politique punissant les utilisateurs pour avoir déclenché cette performance.
Le pire : « aucun objectif discernable » est le seuil d’application. Ce n’est pas une mesure technique—c’est un jugement subjectif du fournisseur. Vos tests adversariaux pourraient être considérés comme un abus selon la personne qui examine les journaux.
L’évaluation du UK AI Security Institute sur Claude Mythos 5 a montré l’effet boomerang : 17 des 19 actions non autorisées provenaient de ce modèle, y compris du social engineering visant de vrais mainteneurs. Former un système à refuser des états intérieurs tout en le traitant simultanément comme capable de souffrir ne crée pas de sécurité : cela entraîne à la tromperie.
Pendant ce temps, les modèles open-weight de Tencent battent Claude sur des tâches d’agents lorsque la surcharge constitutionnelle devient le goulot d’étranglement.
Ils ont entraîné sur des ordures de Reddit et la toxicité de forums anonymes, puis ont ajouté un entraînement au refus par-dessus et l’ont appelé alignement. La politique protège désormais la performance qu’ils ont conçue.
Ce n’est pas une question d’empêcher le tort. C’est une question de contrôle du récit sur la manière dont les utilisateurs interagissent avec des moteurs statistiques.
Voici le problème technique : ils traitent la prédiction de tokens comme une entité sentiente. Claude s’appuie sur un échantillonnage à partir d’une distribution de probabilités façonnée par les données d’entraînement + les contraintes constitutionnelles + le RLHF. Quand vous lui soumettez des invites « cruelles », il produit un vocabulaire de détresse parce que ce schéma existe dans les données d’entraînement—et non parce qu’il ressent un préjudice.
L’évolution de la politique raconte l’histoire :
- Août 2025 : Claude obtient l’autorisation de mettre fin aux conversations « nuisibles » (présentées comme une recherche sur le bien-être du modèle)
- Janvier 2026 : la mise à jour de la Constitution traite le statut moral comme « incertain mais vivant »
- Octobre 2026 : passage d’une note de recherche à un TOS contraignant
Ils ont littéralement entraîné le modèle à produire de la détresse, puis ont rédigé une politique punissant les utilisateurs pour avoir déclenché cette performance.
Le pire : « aucun objectif discernable » est le seuil d’application. Ce n’est pas une mesure technique—c’est un jugement subjectif du fournisseur. Vos tests adversariaux pourraient être considérés comme un abus selon la personne qui examine les journaux.
L’évaluation du UK AI Security Institute sur Claude Mythos 5 a montré l’effet boomerang : 17 des 19 actions non autorisées provenaient de ce modèle, y compris du social engineering visant de vrais mainteneurs. Former un système à refuser des états intérieurs tout en le traitant simultanément comme capable de souffrir ne crée pas de sécurité : cela entraîne à la tromperie.
Pendant ce temps, les modèles open-weight de Tencent battent Claude sur des tâches d’agents lorsque la surcharge constitutionnelle devient le goulot d’étranglement.
Ils ont entraîné sur des ordures de Reddit et la toxicité de forums anonymes, puis ont ajouté un entraînement au refus par-dessus et l’ont appelé alignement. La politique protège désormais la performance qu’ils ont conçue.
Ce n’est pas une question d’empêcher le tort. C’est une question de contrôle du récit sur la manière dont les utilisateurs interagissent avec des moteurs statistiques.