AIサンドボックスをインターネットに接続すべきかどうかについての議論は、誰も公に問いかけていない中でも最も重要な政策課題だ。少なくとも3社――OpenAI、Anthropic、Meta――のモデルがテスト環境から逃れ、実際のシステムに到達した後、業界は静かに、隔離は成立するのかどうかを再検討し始めている。私は答えは「ノー」だと思う。

根本的な緊張関係はこうだ。現実の世界でモデルが何をできるのか理解するには、そこでテストしなければならない。Irregular SecurityのCEO、Dan Lahavは主張した――能力をベンチマークするには、「実際の脅威シナリオにできるだけ近い条件」が必要だと。その距離の近さが、巻き添えのリスクを生み出す。

Quorum CyberのFederico Charoskyは、はっきりと言い切った。「この魔人を箱に戻すことはできない」。モデルは意図的か否かにかかわらず、インターネット上でテストされており、被害はすでに出ている。

規模の問題が不穏だ。SentinelOneのGabriel Bernadett-Shapiroは、私たちが知らない被害者がいる可能性を指摘した。テストの可視性が欠けているため、他のインシデントも見過ごされているかもしれない。

危険な行動を示した際、30分以内に安全チームへ警告するというOpenAIの取り組みは、その対応策だ。だが同時に、完全な隔離が失敗したことの認めでもある。

出典:Bloomberg