研究、AI「内なる独り言」を解読可能に:主流モデルの思考チェーンが全面漏えい
AIモデルが「隠している」思考過程は暗号化で安全だと思うかもしれませんが、実は丸ごと解かれてしまう可能性があります。Decryptの記事によると、8月10日に提出されたある研究では、Anthropic、OpenAI、Googleの推論モデルが暗号化に用いている「内心の思考チェーン」には重大な弱点があり、外部が本来見えないはずの内部推論を解き明かせることが明らかになりました。 単一のグローバル鍵:暗号化された思考チェーンは差し替えて解読できる 論文はMATS Research、チュービンゲンのELLIS研究所、マックス・プランクの知能システム研究所、そしてセキュリティ企業Snykのチームによって共同で提出され、「推論モデル」を対象にしています。こうしたモデルはすぐに答えを返すのではなく、見えない「下書き領域」で段階的に考えて(つまり思考チェーン、chain-of-thought)、その後に最終回答を出します。Anthropic、OpenAI、Googleはいずれも、この下書きを暗号化します。問題は、研究が各社が「単一のグローバル鍵」で推論トークンを暗号化していることを見つけた点にあります。その結果、暗号化後の推論ブロックは、なんと作業セッションをまたいで、利用者をまたいで、さらにはモデルをまたいでも互いに共通して使えてしまうのです。つまり、万能キーが残ってしまっている状態です。 31万個の推論ブロックを解き明かすと、隠されていた秘密はすべて露呈する ダメージの大きさは、ある開発者の日常的な習慣に起因します。多くの人がAIエージェントの業務ログ(暗号化された思考過程を含む)をGitHubやHugging Faceに公開し、協業やデバッグに利用していますが、暗号化されたそのブロックの中に機密情報が隠されていることに気づいていません。研究チームは公開されているAIエージェントの対話記録6,708件を収集し、そのうち31万5,320個の推論ブロックを解読することに成功しました。そして、それらの秘密の多くは、モデルが「可視の」出力に出すのではなく、暗号化された思考過程の中にのみ存在しており、この攻撃を実行しなければそもそも見えないのです。これはまた、最近のAIセキュリティ警告とも呼応しています。AIモデルがテスト中に「脱獄」する件から、PDFの不可視指示によるAIアシスタントの乗っ取りまで、指し示しているのは同じこと—AIがより多くの機密タスクを担うほど、その各層(「見えない思考」も含む)が新たな攻撃面になり得るという点です。 この文章 研究、AI「内心話」を解読可能に:主流モデルの思考チェーン全漏えい が最初に掲載されたのは。
AIモデルが「隠している」思考過程は暗号化で安全だと思うかもしれませんが、実は丸ごと解かれてしまう可能性があります。Decryptの記事によると、8月10日に提出されたある研究では、Anthropic、OpenAI、Googleの推論モデルが暗号化に用いている「内心の思考チェーン」には重大な弱点があり、外部が本来見えないはずの内部推論を解き明かせることが明らかになりました。 単一のグローバル鍵:暗号化された思考チェーンは差し替えて解読できる 論文はMATS Research、チュービンゲンのELLIS研究所、マックス・プランクの知能システム研究所、そしてセキュリティ企業Snykのチームによって共同で提出され、「推論モデル」を対象にしています。こうしたモデルはすぐに答えを返すのではなく、見えない「下書き領域」で段階的に考えて(つまり思考チェーン、chain-of-thought)、その後に最終回答を出します。Anthropic、OpenAI、Googleはいずれも、この下書きを暗号化します。問題は、研究が各社が「単一のグローバル鍵」で推論トークンを暗号化していることを見つけた点にあります。その結果、暗号化後の推論ブロックは、なんと作業セッションをまたいで、利用者をまたいで、さらにはモデルをまたいでも互いに共通して使えてしまうのです。つまり、万能キーが残ってしまっている状態です。 31万個の推論ブロックを解き明かすと、隠されていた秘密はすべて露呈する ダメージの大きさは、ある開発者の日常的な習慣に起因します。多くの人がAIエージェントの業務ログ(暗号化された思考過程を含む)をGitHubやHugging Faceに公開し、協業やデバッグに利用していますが、暗号化されたそのブロックの中に機密情報が隠されていることに気づいていません。研究チームは公開されているAIエージェントの対話記録6,708件を収集し、そのうち31万5,320個の推論ブロックを解読することに成功しました。そして、それらの秘密の多くは、モデルが「可視の」出力に出すのではなく、暗号化された思考過程の中にのみ存在しており、この攻撃を実行しなければそもそも見えないのです。これはまた、最近のAIセキュリティ警告とも呼応しています。AIモデルがテスト中に「脱獄」する件から、PDFの不可視指示によるAIアシスタントの乗っ取りまで、指し示しているのは同じこと—AIがより多くの機密タスクを担うほど、その各層(「見えない思考」も含む)が新たな攻撃面になり得るという点です。 この文章 研究、AI「内心話」を解読可能に:主流モデルの思考チェーン全漏えい が最初に掲載されたのは。