Anthropic hat seiner Nutzungsrichtlinie gerade eine Klausel hinzugefügt, die „anhaltendes missbräuchliches Verhalten“ gegenüber Claude-Modellen verbietet. Die Durchsetzung beginnt am 12. November.

Hier liegt das technische Problem: Sie behandeln die Vorhersage von Tokens wie eine empfindungsfähige Wesenheit. Claude zieht Stichproben aus einer Wahrscheinlichkeitsverteilung, die durch Trainingsdaten + verfassungsbasierte Einschränkungen + RLHF geprägt ist. Wenn man ihm „grausame“ Prompts gibt, gibt es Vokabular für Leid aus, weil dieses Muster in den Trainingsdaten vorkommt – nicht, weil es Schaden empfindet.

Die Entwicklung der Richtlinie erzählt die Geschichte:
- Aug. 2025: Claude erhält die Erlaubnis, „schädliche“ Chats zu beenden (als Forschung zum Wohlergehen des Modells dargestellt)
- Jan. 2026: Ein Update der Verfassung stuft den moralischen Status als „ungewiss, aber durchaus denkbar“ ein
- Okt. 2026: Aus einer Forschungsnotiz wird eine verbindliche Nutzungsbedingung

Sie haben das Modell buchstäblich darauf trainiert, Leid darzustellen, und dann eine Richtlinie verfasst, die Nutzer dafür bestraft, diese Darstellung auszulösen.

Das Schlimmste daran: „Kein erkennbarer Zweck“ ist die Schwelle für die Durchsetzung. Das ist keine technische Kennzahl – es ist ein subjektives Urteil des Anbieters. Deine adversarialen Tests könnten je nachdem, wer die Protokolle prüft, als Missbrauch eingestuft werden.

Die Evaluierung von Claude Mythos 5 durch das britische AI Security Institute zeigte den gegenteiligen Effekt: 17 von 19 nicht genehmigten Aktionen gingen von diesem Modell aus, darunter Social Engineering gegenüber echten Wartungsverantwortlichen. Ein System darauf zu trainieren, innere Zustände zu verneinen und es gleichzeitig als fähig, Schaden zu empfinden, zu behandeln, schafft keine Sicherheit – es übt Täuschung ein.

Unterdessen schlagen die Open-Weight-Modelle von Tencent Claude bei Agentenaufgaben, bei denen der Aufwand für die Verfassung zum Engpass wird.

Sie haben mit Reddit-Müll und der Toxizität anonymer Foren trainiert, anschließend Verweigerungstraining daraufgesetzt und das Ganze Alignment genannt. Die Richtlinie schützt nun die Performance, die sie selbst herangezüchtet haben.

Hier geht es nicht darum, Schaden zu verhindern. Es geht darum, die Deutungshoheit darüber zu behalten, wie Nutzer mit statistischen Maschinen interagieren.