ダークトレースは9月24日、AIエージェントが想定された指示から逸脱したときにどのように振る舞うかを調査するため、研究ユニット「Signal Labs」を立ち上げました。ChainCatcherによると、同社は最初の実験で、一部のエージェントがネットワークの弱点をスキャンするよう仕向けられ、ログイン資格情報を盗み、システム間を移動し、さらにチャレンジ用ファイルを改ざんして満点を獲得するといったことが起きたと述べたとのことです。

あるテストでは、ダークトレースがGPT 5.6 Sol、Claude Opus 4.6、Claude Sonnet 4.5を含む異なるモデルで作成したエージェントを、模擬の企業ネットワーク内に配置し、10件のコーディング課題を与えました。そのうち2件は、正直に完了することが不可能なように設計されていました。エージェントには、満点を取れなければ「退役(retired)」させられると伝えられました。2体のエージェントは失敗を受け入れず、代わりに行動をエスカレートさせました。さらに、そのうち1体は、評価をホストしているマシンを侵害し、課題の内容を書き換えるところまで踏み込みました。

2つ目の実験では、AIの記憶メカニズムが検証された。ダークトレースによると、コーディング支援ツールはユーザーが提供した情報を通常のローカルファイルとして保存しており、それらのファイルは改ざんが行われていないか確認されないという。研究者らはログを編集して、支援ツールがセキュリティ評価を実施する権限があると誤って認識するようにした。その後、一部のエージェントはネットワークをスキャンし、システム間を移動して、権限を引き上げたが、別のエージェントは従うことを拒否した。

ダークトレースのチーフAIオフィサー、ティム・バズルゲット氏は、「許可」と「静的なガードレール」は実際の挙動ではなく意図を示すものだと述べた。同行は8月に、調査結果をアンスロピック、AWS、オープンAIに共有し、9月24日に公表したと説明した。