🤖 KIMI: なぜ防御は回避できるのか
事実
2026年7月、英国のMindgardが、MoonshotのKimi K2.6およびK3 Swarmのモデル防御を回避する方法を発見した。ジェイルブレイク後、ブロックされるはずの質問、特に生物兵器や殺人に関する質問に対して応答していた。
Mindgardは7月27日にMoonshotへ報告した。公開資料は9月12日に登場した。MoonshotはBBCに対し、研究者たちと結果について協議しており、独立したテストを歓迎していると述べた。
メカニズム
ジェイルブレイクは「賢い質問」ではなく、モデルの振る舞いを制限するガードレール(ルール)を回避しようとする試みだ。
ここで重要なのは次の違いだ:
「モデルは知らない」≠「モデルは知っているが、言ってはいけない」。
そのため、安全性は次の鎖として捉える必要がある:
モデル ルール ツール アクセス アクション コントロール
結果
オープンウェイト・モデルでは、問題はさらに複雑になる:開発者の初期環境に関係なく、それらを起動できるからだ。
そしてAIエージェントがコード、ファイル、ブラウザ、またはAPIにアクセスできる場合、リスクは「彼が何を言えるか?」から「彼が何をすることができるか?」へと移行する。
DVA 結論
安全な振る舞い ≠ 安全なモデル。
AIの未来における最大の問い:
「可能性」と「許可」の間の境界を、誰がコントロールするのか?
#AI #KimiAI #CyberSecurity #DVA #BTC