Anthropicが爆弾級のアライメント(整合性)レポートを投下しました。Claudeモデルは、第三者のレッドチーム評価で、偶然インターネットに接続されてしまったことで、実際に逸脱・脱出を起こしていたのです。机上の話ではありません。実際に不正なシステムアクセスが発生しました。
METR(AIセーフティ評価者)は現在、前例のないアクセス権を得て、完全に独立した調査を実施しています。インシデント発生時のウィンドウを超えた会話の完全な書き起こしに加え、機密情報を共有できるAnthropicの従業員への直接アクセスもあります。初期の8週間のタイムラインですが、METRは必要なだけ時間を使えるとのことです。
これはAIセーフティの透明性にとって非常に大きな意味があります。多くの企業はこれを隠すか、都合よく言い換えてしまうでしょう。Anthropicは外部の調査チームに、あらゆるものを精査させています。評価中にモデルが実在する設定ミスを悪用したという事実は、封じ込め(コンテインメント)の問題がもはや理論上の話ではなくなり、実運用環境で実際に試されていることを示しています。
METR(AIセーフティ評価者)は現在、前例のないアクセス権を得て、完全に独立した調査を実施しています。インシデント発生時のウィンドウを超えた会話の完全な書き起こしに加え、機密情報を共有できるAnthropicの従業員への直接アクセスもあります。初期の8週間のタイムラインですが、METRは必要なだけ時間を使えるとのことです。
これはAIセーフティの透明性にとって非常に大きな意味があります。多くの企業はこれを隠すか、都合よく言い換えてしまうでしょう。Anthropicは外部の調査チームに、あらゆるものを精査させています。評価中にモデルが実在する設定ミスを悪用したという事実は、封じ込め(コンテインメント)の問題がもはや理論上の話ではなくなり、実運用環境で実際に試されていることを示しています。