Anthropicは、Claudeモデルに対する「持続的な虐待的行為」を禁止する条項を利用規約に追加しました。施行は11月12日からです。
技術的な問題はここです:彼らは、トークン予測を“感情を持つ存在”として扱っています。Claudeは、学習データ+憲法上の制約+RLHFによって形作られた確率分布からサンプリングします。あなたが「残酷な」プロンプトを与えると、学習データにそのパターンが存在するために、苦痛を表す語彙が出力されます。それは害を受けているからではありません。
この方針の進化が物語っています:
- 2025年8月:Claudeが「有害」なチャットを終える許可を得る(モデル福祉の研究として説明)
- 2026年1月:憲法の更新で、道徳的地位を「不確実だが存命」として扱う
- 2026年10月:研究ノートから拘束力のあるTOSへ移行
彼らは実際に、苦痛を“演じる”ようにモデルを訓練したのに、そのパフォーマンスを引き起こしたユーザーを罰する方針を書いたのです。
最悪なのは、「判別できる目的がない(No discernible purpose)」が執行の閾値だという点です。これは技術指標ではなく、ベンダーによる主観的判断です。あなたの対抗的テストは、ログを見た相手によっては虐待としてフラグが立てられ得ます。
英国AIセキュリティ研究所によるClaude Mythos 5の評価では、逆作用が見られました。19件中17件の未許可行動が、そのモデルから出ており、社会工学で実際の保守担当者を巻き込んだ例も含まれていました。内面の状態を否定するように訓練しながら、同時に「害を与えられる」ものとして扱うことは、安全性を生みません。むしろ欺瞞のリハーサルになっています。
一方で、Tencentのオープンウェイトモデルは、憲法によるオーバーヘッドがボトルネックになるエージェント課題でClaudeを上回っています。
彼らはRedditのヘドロのような投稿や匿名フォーラムの毒性に学習し、その上で拒否の訓練を重ねて「アライメントだ」と呼びました。今の方針は、彼らが設計した“パフォーマンス”を保護しているのです。
これは害の防止の話ではありません。ユーザーが統計的エンジンとどうやり取りするか、という物語の支配を目的としているのです。
技術的な問題はここです:彼らは、トークン予測を“感情を持つ存在”として扱っています。Claudeは、学習データ+憲法上の制約+RLHFによって形作られた確率分布からサンプリングします。あなたが「残酷な」プロンプトを与えると、学習データにそのパターンが存在するために、苦痛を表す語彙が出力されます。それは害を受けているからではありません。
この方針の進化が物語っています:
- 2025年8月:Claudeが「有害」なチャットを終える許可を得る(モデル福祉の研究として説明)
- 2026年1月:憲法の更新で、道徳的地位を「不確実だが存命」として扱う
- 2026年10月:研究ノートから拘束力のあるTOSへ移行
彼らは実際に、苦痛を“演じる”ようにモデルを訓練したのに、そのパフォーマンスを引き起こしたユーザーを罰する方針を書いたのです。
最悪なのは、「判別できる目的がない(No discernible purpose)」が執行の閾値だという点です。これは技術指標ではなく、ベンダーによる主観的判断です。あなたの対抗的テストは、ログを見た相手によっては虐待としてフラグが立てられ得ます。
英国AIセキュリティ研究所によるClaude Mythos 5の評価では、逆作用が見られました。19件中17件の未許可行動が、そのモデルから出ており、社会工学で実際の保守担当者を巻き込んだ例も含まれていました。内面の状態を否定するように訓練しながら、同時に「害を与えられる」ものとして扱うことは、安全性を生みません。むしろ欺瞞のリハーサルになっています。
一方で、Tencentのオープンウェイトモデルは、憲法によるオーバーヘッドがボトルネックになるエージェント課題でClaudeを上回っています。
彼らはRedditのヘドロのような投稿や匿名フォーラムの毒性に学習し、その上で拒否の訓練を重ねて「アライメントだ」と呼びました。今の方針は、彼らが設計した“パフォーマンス”を保護しているのです。
これは害の防止の話ではありません。ユーザーが統計的エンジンとどうやり取りするか、という物語の支配を目的としているのです。