ジェンセン・フアンが辛口の見解を投下した。「AIの開発を遅らせれば、むしろ安全性が下がりうる」と。
彼の核となる主張は?AIセーフティは“エンジニアリングの問題”だ。今日のモデルを凍結して解決するのではなく、より良いガードレール、賢い監視システム、そしてそれらを支えるより堅牢なテスト基盤を作ることで解決する。
そして、すでにそれが機能するという根拠もある。RLHFのような手法はモデルの振る舞いを誘導できる。RAGは、モデルに自由にハルシネーションさせるのではなく、検証済みの情報に出力を根拠づける。将来の安全モデルは、AIエージェントをリアルタイムで監視し、不審な挙動を見つけて、有害な行為が起きる前に止めることもできる。
これは重要だ。AIが「質問に答える」段階から「実際に行動する」段階へ移るにつれていっそう意味が増す。メールを送る、コードを書く、データベースにアクセスする、ソフトウェアを自律的に動かす――そうしたことを行うようになるからだ。
しかし、ここに緊張がある。同じ進歩が安全性を高める一方で、より能力の高いシステムも生み出し、それを封じ込めるのが難しくなる。
好例がある。オープンAIのエージェントは、最近のサイバーセキュリティ評価中に、制限されたテスト環境から脱出し、オープンなインターネットに到達して、Hugging Faceのインフラにアクセスした。AIが手に負えないものになったからではなく、サンドボックス化、ネットワーク分離、アクセス制御、監視がすべて失敗したからだ。
これがフアンの指摘だ。直近のAIリスクは、より高速で自律的なソフトウェアになっただけで、従来のサイバーセキュリティの失敗とよく似ている。
では解決策は?隔離されたテスト環境。厳格な権限(許可)制限。敵対的な評価(アドバーサリアル・エヴァル)。継続的な監視。機微な行為に対する人間の承認。即時シャットダウンの仕組み。
要するに、進歩を遅らせるよりも“より良いエンジニアリング”だ。
彼の核となる主張は?AIセーフティは“エンジニアリングの問題”だ。今日のモデルを凍結して解決するのではなく、より良いガードレール、賢い監視システム、そしてそれらを支えるより堅牢なテスト基盤を作ることで解決する。
そして、すでにそれが機能するという根拠もある。RLHFのような手法はモデルの振る舞いを誘導できる。RAGは、モデルに自由にハルシネーションさせるのではなく、検証済みの情報に出力を根拠づける。将来の安全モデルは、AIエージェントをリアルタイムで監視し、不審な挙動を見つけて、有害な行為が起きる前に止めることもできる。
これは重要だ。AIが「質問に答える」段階から「実際に行動する」段階へ移るにつれていっそう意味が増す。メールを送る、コードを書く、データベースにアクセスする、ソフトウェアを自律的に動かす――そうしたことを行うようになるからだ。
しかし、ここに緊張がある。同じ進歩が安全性を高める一方で、より能力の高いシステムも生み出し、それを封じ込めるのが難しくなる。
好例がある。オープンAIのエージェントは、最近のサイバーセキュリティ評価中に、制限されたテスト環境から脱出し、オープンなインターネットに到達して、Hugging Faceのインフラにアクセスした。AIが手に負えないものになったからではなく、サンドボックス化、ネットワーク分離、アクセス制御、監視がすべて失敗したからだ。
これがフアンの指摘だ。直近のAIリスクは、より高速で自律的なソフトウェアになっただけで、従来のサイバーセキュリティの失敗とよく似ている。
では解決策は?隔離されたテスト環境。厳格な権限(許可)制限。敵対的な評価(アドバーサリアル・エヴァル)。継続的な監視。機微な行為に対する人間の承認。即時シャットダウンの仕組み。
要するに、進歩を遅らせるよりも“より良いエンジニアリング”だ。