人工一般知能(AGI)への探求は、さらに興味深く、挑戦的になりました!AI界に波紋を広げる画期的な発展の中で、AIの巨星フランソワ・ショレが率いるArc Prize Foundationは、新しい、信じられないほど難しいAGIテストを発表しました。ARC-AGI-2と名付けられたこのベンチマークは、AIモデルの一般的な知性を真に測定するよう設計されており、初期の結果は、最も先進的なシステムにとっても謙虚なものです。
なぜARC-AGI-2がAIモデルにとって新たなハードルなのか?
Arc Prize Foundationの最近のブログ投稿によると、ARC-AGI-2は手ごわい挑戦であることが証明されています。OpenAIのo1-proやDeepSeekのR1などの主要な「推論」AIモデルは、AGIテストリーダーボードでわずか1%から1.3%しか得点できていません。GPT-4.5、Claude 3.7 Sonnet、Gemini 2.0 Flashを含む強力な非推論モデルでさえ、約1%のマークにしか達していません。これは、同じARC-AGI-2の質問でパネルが平均60%の正確性を示した人間のパフォーマンスと starkに対比されます。
では、この新しいAIベンチマークは何がそんなに異なり、難しいのか?
視覚パズル問題: ARC-AGI-2はAIモデルに、色付きの正方形のグリッド内で視覚パターンを特定するパズルのような問題を提示します。目標は、AIがこれらのパターンに基づいて正しい「答え」グリッドを生成することです。
適応力の焦点: 前のテストとは異なり、ARC-AGI-2はAIモデルが訓練中に遭遇したことのない全く新しい問題タイプに適応することを強制的に設計されています。これは単なる記憶ではなく、真の問題解決能力をテストします。
効率メトリック: ARC-AGI-2の重要な革新は、効率メトリックの導入です。これは、正しい答えを得ることだけでなく、AIモデルがどれだけ効率的に解決策に到達するかも重要であることを意味します。これは、以前のベンチマークで真の知性をマスクしていたブルートフォース計算力に関する懸念に直接対処します。
さまざまなタイプのモデルのパフォーマンスの比較は以下の通りです。
AIモデルタイプの例 ARC-AGI-2 スコア(おおよそ) 推論AIモデル OpenAI o1-pro、DeepSeek R1 1% – 1.3% 非推論AIモデル GPT-4.5、Claude 3.7 Sonnet、Gemini 2.0 Flash 約1% 人間パネル 平均参加者 60%
出典: Arc Prize リーダーボード
ARC-AGI-2 vs. ARC-AGI-1: 何が変わったのか?
フランソワ・ショレ自身がX(旧Twitter)で、ARC-AGI-2はその前任者ARC-AGI-1と比較してAIモデルの真の知性を測る優れた指標であると述べました。Arc Prize Foundationのテストの基本的な目的は一貫しており、AIシステムが訓練データを超えた新しいスキルを学ぶ能力を評価することです。
しかし、ARC-AGI-2はARC-AGI-1の重要な欠陥、つまりブルートフォース計算への過度な依存を解決します。ARC-AGI-1は、何年にもわたって挑戦的なAIベンチマークであったにもかかわらず、最終的にはOpenAIのo3(低)モデルによって「解決」されました。o3(低)はARC-AGI-1で75.7%という印象的なスコアを達成し、人間レベルのパフォーマンスを示しましたが、そのスコアはARC-AGI-2ではわずか4%にまで急落しました。これは、タスクごとに$200の計算コストがかかったにもかかわらずです。これは、新しいテストにおける効率と真の知性への焦点の根本的なシフトを浮き彫りにしています。
なぜこの新しいAIベンチマークが今重要なのか?
ARC-AGI-2の到来はタイムリーです。Hugging Faceの共同創設者トーマス・ウルフを含むテック業界内の多くの声が、特に創造性のような分野でAIの進歩を真に評価するためのより堅牢で新しいベンチマークを求めてきました。これは人工一般知能の重要な要素です。
以前のベンチマークの限界がますます明らかになっていました。モデルは、広範な暗記やブルートフォース計算など、必ずしも真の知性を反映しない方法で高得点を達成することができました。ARC-AGI-2は、これらの欠点に正面から取り組み、AI評価の限界を押し広げようとしています。
Arc Prize 2025: AI知性を押し進める挑戦
さらに興奮を加える層として、Arc Prize FoundationはArc Prize 2025コンテストを発表しました。この挑戦は、開発者にARC-AGI-2テストで85%の精度を達成することを求め、タスクごとのコスト制約をわずか$0.42に設定しています。このコンテストは高得点を達成することだけでなく、効率的で真に知的なAIモデルを育成することが目的です。
この新しいAGIテスト、ARC-AGI-2は、人工一般知能を測定し理解する能力において重要な前進を表しています。AIモデルが驚異的な進歩を遂げた一方で、適応性と効率性を特徴とする真の人間レベルの知性は依然として手強いフロンティアです。挑戦は設定され、真に知的なAIを構築するレースが始まっています。ARC-AGI-2は新しい、より厳格な尺度として機能します。
最新のAIベンチマークトレンドについて詳しく知るには、AIの進展を形作る重要な開発についての記事を探ってください。
