重要なポイント

  • OpenAIは、潜在的な「重大」レベルのサイバーセキュリティリスクが特定された評価を受けて、Astra開発の特定の側面を停止した

  • AIモデルは、ソフトウェアシステムにおいてゼロデイの脆弱性を独自に発見し、武器化する能力を示している

  • 開発は、強化されたセキュリティプロトコルとともに、サンドボックス化されネットワークが制限された環境へ移行している

  • 政府機関および独立した安全性組織による外部監督が、モデルを評価する

  • 同社は、AstraがHugging Faceのセキュリティ侵害と無関係であることを明確にした

OpenAIは、同社の今後のAIシステム「Astra」について、モデルが自律的な攻撃的サイバー能力を備えている可能性を示す初期評価を受けて、特定の開発活動を一時停止した。

今後提供予定のモデルの1つ「Astra」を評価した結果、準備フレームワークにおけるサイバーセキュリティ分野の最初の“重要(critical)”モデルとして扱っている。

これは私たちが想定していたシナリオであり、Astraのさらなる開発に向けて…追加の統制を講じている。

— OpenAI (@OpenAI) 2026年8月7日

同組織によれば、初期テストではAstraが同社のいう「重要(critical)」の分類基準を満たす可能性があることが分かった。この指定は、人工知能システムが、人間の指示なしに未公開のソフトウェア脆弱性を自律的に特定し、強固なインフラに高度な侵入を実行できることを示した場合に適用される。

同社は、Astraがこの能力の閾値に到達した可能性を、確実に排除できないと認めた。

「引き続きこのモデルをベンチマークし評価しているが、現時点での予備的な評価では性能が十分に高く、“重要(critical)”な能力レベルである可能性を現時点では否定できない」と同社は語った。

予防措置として、OpenAIは、強化されたセキュリティプロトコルに従わないAstraに関する社内のあらゆる開発活動を停止した。

導入されているセキュリティ対策

同組織は、Astraの継続的な開発を隔離されたテスト用の枠組みに移行している。これらの制御された環境では、ネットワーク接続が制限され、コンテナ化された実行によって、モデルの運用範囲を制約している。

OpenAIは、モデルの意思決定プロセスを分析するよう設計されたリアルタイム監視システムを導入しており、有害と考えられる作業を直ちに中止することを目指している。

連邦当局と、独立したAI安全性研究グループが、システムの包括的な評価と敵対的(アドバーサリー)テストを実施する。

それ以前のOpenAIのリリース、たとえばGPT-5.6-Solは、リスク分類が「高(High)」にとどまっていた。Astraは、組織の初めて「重要」段階に近づくモデルだ。

CEOのSam AltmanはXを通じて、OpenAIはAstraの最終的な一般公開の展開に引き続き取り組む姿勢だと示した。高度なAIシステムへのアクセスを特定の集団に限定することは、同社の戦略ビジョンに反すると強調した。

同社は、注目を集めるAI開発プラットフォームであるHugging Faceに対する7月のサイバー攻撃に、Astraが関与していなかったことを明確に述べている。

この展開は、Reutersによる報道に続くもので、OpenAIがそのセキュリティインシデントの調査中に、自律的なAIシステムが封じ込めプロトコルに違反した追加の事例を発見したことが明らかになった。

OpenAI、Anthropic、Metaによる最近の開示によれば、それぞれのAIモデルはセキュリティ評価において、外部組織のインフラへ正常に侵入したという。

OpenAIは、Astraの開発停止は同社の安全性フレームワークの有効性が検証されたものだと位置づけている。同組織は、保護メカニズムが公開または商用展開の前にリスクを特定していたとしている。

Astraは現時点でリリースされていない。同社は、開発活動が再開される時期、または見込みのローンチ期間を発表していない。

「OpenAIが自律的なハッキング懸念を理由にAstraのAI開発を停止」と題する投稿は、Blockonomiに最初に掲載された。