
Anthropicは、米国政府がサイバーセキュリティ上の懸念を理由にそれらの一時停止を命じた後、同社の最も能力の高いAIモデルであるClaude Fable 5とMythos 5のパブリックアクセスを復旧しようとしている。両モデルは、研究者がセーフガードを回避する方法を見つけたとの報道を受け、6月中旬にオフライン化された。その後、統制を強化するため、Anthropicは一般向けの再展開を一時停止した。
水曜日のAnthropicの投稿によると、政府は制限を解除し、同社は更新された安全性のアプローチでFable 5を再展開している。Anthropicは、より多くのサイバーセキュリティ業務を的確に標的化してブロックするために設計された「新しい一連の分類器」を使用しているとし、幅広いアクセスから、より狭く選択的に管理された運用への転換を示していると述べた。
要点
Anthropicは、Claude Fable 5およびMythos 5に関する米国の輸出関連の制限が水曜日に解除され、公的なアクセスが再開可能になったと述べた。
モデルは、Fable 5のセーフガードを回避できるとの報告を受けて引き下げられた。この回避は、悪意ある用途のために脆弱性を特定するのに役立つ可能性がある。
Anthropicは、追加の有害なタスクの種類を遮断することを目的とした改訂版のサイバーセキュリティ安全性分類器(classifier)で再配備する方針だ。
米当局者は、モデルの展開(デプロイ)に関して「安全」を強調しつつ、政府の優先事項に沿う形でモデルのアラインメントを見極めていた。
またAnthropicは、Project Glasswingのパートナーネットワークを通じて、脱獄の重症度を評価するためのより広範な枠組みにも取り組んでいる。
なぜAnthropicのアクセスは一時停止されたのか
Anthropicの最新の主力モデル2つ――Claude Fable 5とMythos 5――への一般公開は、6月12日から制限された。Anthropicが示した直近の引き金は、研究者がFable 5のセーフガードをどのように回避できるかを説明したレポートに関する政府の審査に紐づく、輸出管理(export-control)指示だった。
その報告書では、回避(bypass)の手法によって、モデルが複数のソフトウェア脆弱性を表面化できるようになったとされている。Anthropicは、政府が「リスクが大きすぎる」と見なした状態のまま公開向けシステムを放置するのではなく、モデルへのアクセスを取り下げることで対応した。より広い含意は、最先端モデルの能力が、悪用への耐性が不十分な状態と組み合わされると、現実世界のセキュリティ脅威に素早く転じ得るという点にあった。
再配備されたモデルで何が変わったのか
Anthropicは、「米政府との生産的な対話の後、」差し止め(停止)は終わると述べた。同社の声明では、全面的な作り直しではなく、運用上の安全性アップグレードとして今回の更新を位置づけた。再配備されるモデルは、より多くのサイバーセキュリティ関連タスクを検知し、遮断することを意図した「新しい一連の分類器(classifier)」を使用する。
分類器(classifier)に基づく統制は、モデルが拒否または誘導(リダイレクト)する依頼の種類に直接影響するため、これは利用者や開発者にとって重要だ。実務上、それらの統制によって、正当なセキュリティ分析のワークフローが引き続き利用可能かどうかが左右される一方、高リスクな方向性はより強くフィルタリングされるかどうかも決まる可能性がある。
Anthropicは、 shutdown(停止)期間中に提起された重要な懸念にも対応した。同社は、その問題はFable 5に固有のものではないと主張していた。ブログ記事「Redeploying Fable 5」の中で、Anthropicは、より弱いモデルでも同様の脆弱性を特定し、同じようなエクスプロイトの手順につながる可能性があると述べた。このような捉え方は、問題を単一モデルの異常ではなく、モデルの能力水準をまたいだ「カテゴリー(類型)リスク」として同社が見ていることを示唆する。
米政府の懸念と、迅速な展開(デプロイ)を後押しする動き
米商務長官ハワード・ルトニック氏はXで、過去2週間にわたり政府がAnthropicと緊密に連携して「Fable 5を分析し、承認した」と述べた。米国政府全体で足並みをそろえ、アメリカのAIリーダーシップを強化することが狙いだ。別件として、ホワイトハウス首席補佐官のスージー・ワイルズ氏は、優先事項は「可能な限り迅速かつ安全に、最良の[AI]技術を展開する」ことに変わりはないと語った。
これらの発言は根本的な技術的問題を変えるものではないが、介入を後押しした政策上のバランスを浮き彫りにする。米国政府は最先端モデルの利用を望んでいるが、それは不正利用の可能性を、特にサイバーセキュリティの不正利用を含めて減らせると政府が考える条件のもとに限られる。
記事の文脈でのホワイトハウスの懸念は、脱獄(jailbreaking)の可能性にあった。強力なモデルが危険な指示を生成するよう強制(強いられ)られ得るなら、それらは国家安全保障上のリスクになり得る。これは、高いインパクトがあるとされ、また広く利用可能になった後に封じ込めが難しいと見なされるモデルに対して、輸出管理のような制限を課すという考え方の根拠になっている。
AnthropicのProject Glasswingと、新たな脱獄(jailbreak)重症度へのアプローチ
今回のモデル停止は、AIの安全性が単発の修正(ワンオフの修正)を超えて、どうテストされ統治されるべきかにも注目を集めた。制限の後、Anthropicは、Amazon、Microsoft、Googleなどのパートナーを含めて、AIの脱獄の深刻度を評価するためのコンセンサス・フレームワークの草案作成を開始したと述べた。
この取り組みは、4月に発表された、AIのサイバーセキュリティ脅威からの防護に焦点を当てた協業であるProject Glasswingにつながっている。重要な狙いとしては、脱獄の試みを評価するための共通のやり方を確立することが挙げられる。つまり、安全システムが回避できるかどうかだけでなく、その回避の結果がどれほど危険か、そしてどれほど一貫して再現できるかを評価することだ。
Anthropicは、モデルのテストとセーフガードに関して、米国政府との協力を拡大しているとも述べた。同社は、リリース前のモデルへのアクセスや評価のためのセーフガード、脱獄や悪用に関する情報共有、そして共同研究のための専用リソースを含む計画を説明した。
並行して、あるAI研究者は以前、政府による制限が適用される前に、6月のローンチ後48時間以内にFable 5を脱獄できたと主張していた。研究者は、ガードレールが(少なくとも)どのようにして回避されたとされるかを示すスクリーンショットを共有した。その主張が周辺文脈の一部として報じられているとはいえ、政府やモデル提供事業者が、ガードレールのテストを「一度きりのチェックポイント」ではなく「継続的な競争」として捉えている理由を裏付けている。
より広いAI市場にとって、今回の動きはいま見慣れた緊張関係を改めて浮かび上がらせる。同じ能力が最先端モデルを有用にする一方で、安全性の失敗コストも押し上げる。特に、サイバーセキュリティの不正利用が可能だときはなおさらだ。再配備は、Anthropicが、管理(統制)を十分に素早く改善して追いつけると考えていることを示唆するが、業界全体の枠組み案の存在は、この課題が一企業の展開判断だけではないことを示している。
今後、読者は、Anthropicの分類器の変更が実際の利用者の行動にどう影響するのかに注目すべきだ。どのようなサイバーセキュリティの依頼が引き続き可能なのか、新たにどんなパターンがブロックされるのか、そして提案される脱獄重症度の枠組みが主要なモデル提供事業者全体で、より透明なテスト基準につながるのかを確認することになるだろう。
この記事は当初、「Anthropic、米が暗号に対する輸出管理を緩和:Fable 5の再開を計画 Breaking News – 暗号ニュース、ビットコインニュース、ブロックチェーンの最新情報の信頼できる情報源」として公開された。
