La quête de l'intelligence générale artificielle (AGI) vient de devenir beaucoup plus intéressante et difficile ! Dans un développement révolutionnaire qui envoie des ondes de choc à travers le monde de l'IA, la Fondation Arc Prize, dirigée par le luminaire de l'IA François Chollet, a dévoilé un nouveau test AGI incroyablement difficile. Nommé ARC-AGI-2, ce benchmark est conçu pour mesurer véritablement l'intelligence générale des modèles d'IA, et les premiers résultats sont, eh bien, humbles même pour les systèmes les plus avancés.

Pourquoi ARC-AGI-2 est-il le nouveau défi pour les modèles d'IA ?

Selon un récent article de blog de la Fondation Arc Prize, ARC-AGI-2 s'avère être un défi redoutable. Les principaux modèles d'IA « raisonnants » comme o1-pro d'OpenAI et R1 de DeepSeek n'effleurent à peine la surface, obtenant à peine 1 % à 1,3 % sur le tableau de classement du test AGI. Même les puissants modèles non raisonnants, y compris GPT-4.5, Claude 3.7 Sonnet et Gemini 2.0 Flash, n'atteignent qu'environ 1 %. Cela contraste fortement avec la performance humaine, où les panels ont enregistré une précision moyenne de 60 % sur les mêmes questions ARC-AGI-2.

Alors, qu'est-ce qui rend ce nouveau benchmark d'IA si différent et difficile ?

  • Problèmes de puzzles visuels : ARC-AGI-2 présente aux modèles d'IA des problèmes de type puzzle impliquant l'identification de motifs visuels dans des grilles de carrés colorés. L'objectif est que l'IA génère la grille de « réponse » correcte basée sur ces motifs.

  • Concentration sur l'adaptabilité : Contrairement aux tests précédents, ARC-AGI-2 est spécifiquement conçu pour obliger les modèles d'IA à s'adapter à des types de problèmes entièrement nouveaux qu'ils n'ont pas rencontrés pendant l'entraînement. Cela teste la véritable capacité à résoudre des problèmes plutôt que simplement la mémoire.

  • Métrique d'efficacité : Une innovation clé dans ARC-AGI-2 est l'introduction d'une métrique d'efficacité. Cela signifie qu'il ne s'agit pas seulement d'obtenir la bonne réponse, mais aussi de la manière dont le modèle d'IA parvient à la solution. Cela répond directement aux préoccupations concernant la puissance de calcul brute masquant la véritable intelligence dans les benchmarks précédents.

Voici une comparaison de la performance de différents types de modèles :

Exemples de types de modèles d'IA Score ARC-AGI-2 (environ) Modèles d'IA raisonnants OpenAI o1-pro, DeepSeek R1 1 % – 1,3 % Modèles d'IA non raisonnants GPT-4.5, Claude 3.7 Sonnet, Gemini 2.0 Flash Environ 1 % Panels humains Participants moyens 60 %

Source : Tableau de classement de l'Arc Prize

ARC-AGI-2 vs. ARC-AGI-1 : Qu'est-ce qui a changé ?

François Chollet lui-même a déclaré sur X (anciennement Twitter) qu'ARC-AGI-2 est une mesure supérieure de la véritable intelligence d'un modèle d'IA par rapport à son prédécesseur, ARC-AGI-1. L'objectif principal des tests de la Fondation Arc Prize reste constant : évaluer la capacité d'un système d'IA à apprendre de nouvelles compétences au-delà de ses données d'entraînement.

Cependant, ARC-AGI-2 s'attaque à un défaut critique d'ARC-AGI-1 – la dépendance excessive à la computation par force brute. ARC-AGI-1, bien qu'étant un benchmark d'IA difficile pendant des années, a finalement été « résolu » par le modèle o3 (faible) d'OpenAI. Bien que o3 (faible) ait atteint un impressionnant 75,7 % sur ARC-AGI-1, démontrant une performance apparemment au niveau humain, son score a chuté à seulement 4 % sur ARC-AGI-2, même avec un coût de calcul significatif de 200 $ par tâche. Cela souligne le changement fondamental d'orientation vers l'efficacité et l'intelligence véritable dans le nouveau test.

Pourquoi ce nouveau benchmark d'IA est-il important maintenant ?

L'arrivée d'ARC-AGI-2 est opportune. De nombreuses voix au sein de l'industrie technologique, y compris le co-fondateur de Hugging Face, Thomas Wolf, ont plaidé pour des benchmarks plus robustes et novateurs afin de vraiment évaluer les progrès de l'IA, en particulier dans des domaines comme la créativité – un composant clé de l'intelligence générale artificielle.

Les limites des benchmarks précédents devenaient de plus en plus évidentes. Les modèles pouvaient obtenir des scores élevés par des méthodes qui ne reflétaient pas nécessairement une intelligence véritable, comme une mémorisation extensive ou des calculs par force brute. ARC-AGI-2 cherche à aborder ces lacunes de front, repoussant les limites de l'évaluation de l'IA.

Le Prix Arc 2025 : Un défi pour faire avancer l'intelligence de l'IA

Ajoutant une autre couche d'excitation, la Fondation Arc Prize a annoncé le concours Arc Prize 2025. Ce défi invite les développeurs à atteindre une précision de 85 % sur le test ARC-AGI-2 tout en respectant une contrainte de coût stricte de seulement 0,42 $ par tâche. Ce concours ne consiste pas seulement à obtenir des scores élevés ; il s'agit de favoriser des modèles d'IA efficaces et véritablement intelligents.

Ce nouveau test AGI, ARC-AGI-2, représente un pas en avant significatif dans notre capacité à mesurer et comprendre l'intelligence générale artificielle. C'est un rappel frappant que bien que les modèles d'IA aient fait d'incroyables progrès, la véritable intelligence au niveau humain, caractérisée par l'adaptabilité et l'efficacité, demeure une frontière redoutable. Le défi est lancé, et la course pour construire une IA véritablement intelligente est lancée, avec ARC-AGI-2 servant de nouvelle référence plus rigoureuse.

Pour en savoir plus sur les dernières tendances des benchmarks d'IA, explorez notre article sur les développements clés qui façonnent les avancées de l'IA.