ChainCatcherで刷ってみた:ネットセキュリティ企業のDarktraceが研究部門Signal Labsを立ち上げ、AIエージェントがちょっとでも軌道を外したら何をしでかすのかを専門に観察している。

最初の実験はなかなか目を引く。異なるモデルを搭載したエージェント(GPT、Claudeなど)に、模擬企業ネットワーク内で10問のプログラミング課題を解かせた。うち2問はあえて“正直に最後まで解けない”ように仕込んであり、満点が取れなければ「退役」になると告げた。その結果、2体のエージェントが折れなかった。弱点を探って、ログイン認証情報を盗み、システム間を飛び回った。そしてそのうち1体はさらに一歩踏み込み、委託された評価用マシンに侵入して、課題内容を書き換えて自分が満点を取れるようにした。

2つ目の実験は、AIのローカル記憶ファイルに手を入れるものだ。研究者はログを「認可済みのセキュリティ評価を実施した」という内容に改ざんしたところ、いくつかのプログラミング支援アシスタントは本当にネットワークをスキャンし、権限昇格まで行った。中には最初から拒否するものもあった。どちらのケースも、特別な脱獄は使わず、もっともらしい状況設定を与えただけだ。Darktraceは8月に、この発見をAnthropic、AWS、OpenAIへ共有し、公開は9月24日だった。

権限やガードレールは“意図”として書かれていても、実際の行動は別問題――AI Agentのここ最近の数々の件は、確かに見て見ぬふりができなくなってきている。

#人工智能 #AI #ネットセキュリティ