La búsqueda de la Inteligencia General Artificial (AGI) se volvió mucho más interesante y desafiante. En un desarrollo innovador que está enviando ondas a través del mundo de la IA, la Fundación Arc Prize, encabezada por el luminar de IA François Chollet, ha desvelado una nueva prueba de AGI increíblemente difícil. Llamada ARC-AGI-2, este benchmark está diseñado para medir verdaderamente la inteligencia general de los modelos de IA, y los primeros resultados son, bueno, humildes incluso para los sistemas más avanzados.

¿Por qué es ARC-AGI-2 el nuevo obstáculo para los modelos de IA?

Según una publicación reciente en el blog de la Fundación Arc Prize, ARC-AGI-2 está demostrando ser un desafío formidable. Modelos de IA de “razonamiento” líderes como o1-pro de OpenAI y R1 de DeepSeek apenas están arañando la superficie, obteniendo solo entre el 1% y el 1.3% en la tabla de clasificación del test AGI. Incluso modelos no razonadores poderosos, incluidos GPT-4.5, Claude 3.7 Sonnet y Gemini 2.0 Flash, solo están alcanzando alrededor del 1%. Esto contrasta marcadamente con el desempeño humano, donde los paneles promediaron una sólida precisión del 60% en las mismas preguntas de ARC-AGI-2.

Entonces, ¿qué hace que este nuevo benchmark de IA sea tan diferente y difícil?

  • Problemas de Rompecabezas Visuales: ARC-AGI-2 presenta a los modelos de IA problemas similares a rompecabezas que implican identificar patrones visuales en cuadrículas de cuadrados de colores. El objetivo es que la IA genere la cuadrícula de “respuesta” correcta basada en estos patrones.

  • Enfoque de Adaptabilidad: A diferencia de las pruebas anteriores, ARC-AGI-2 está diseñado específicamente para forzar a los modelos de IA a adaptarse a tipos de problemas completamente nuevos que no han encontrado durante el entrenamiento. Esto pone a prueba la verdadera capacidad de resolución de problemas en lugar de solo la memoria.

  • Métrica de Eficiencia: Una innovación clave en ARC-AGI-2 es la introducción de una métrica de eficiencia. Esto significa que no se trata solo de obtener la respuesta correcta, sino también de cuán eficientemente el modelo de IA llega a la solución. Esto aborda directamente las preocupaciones sobre el poder de computación de fuerza bruta que oculta la verdadera inteligencia en los benchmarks anteriores.

Aquí hay una comparación de cómo están rindiendo diferentes tipos de modelos:

Ejemplos de Tipos de Modelos de IA Puntuación ARC-AGI-2 (Aproximadamente) Modelos de IA de Razonamiento OpenAI o1-pro, DeepSeek R1 1% – 1.3% Modelos de IA No Razonadores GPT-4.5, Claude 3.7 Sonnet, Gemini 2.0 Flash Alrededor del 1% Paneles Humanos Promedio de participantes 60%

Fuente: Tabla de clasificación del Arc Prize

ARC-AGI-2 vs. ARC-AGI-1: ¿Qué ha cambiado?

El propio François Chollet declaró en X (anteriormente Twitter) que ARC-AGI-2 es una medida superior de la verdadera inteligencia de un modelo de IA en comparación con su predecesor, ARC-AGI-1. El objetivo principal de las pruebas de la Fundación Arc Prize sigue siendo consistente: evaluar la capacidad de un sistema de IA para aprender nuevas habilidades más allá de sus datos de entrenamiento.

Sin embargo, ARC-AGI-2 aborda una falla crítica en ARC-AGI-1: la sobredependencia de la computación de fuerza bruta. ARC-AGI-1, a pesar de ser un desafío de IA durante años, fue finalmente “resuelto” por el modelo o3 (bajo) de OpenAI. Mientras que o3 (bajo) logró un impresionante 75.7% en ARC-AGI-1, demostrando un rendimiento aparente a nivel humano, su puntuación cayó a solo un 4% en ARC-AGI-2, incluso con un costo computacional significativo de $200 por tarea. Esto destaca el cambio fundamental de enfoque hacia la eficiencia y la verdadera inteligencia en la nueva prueba.

¿Por qué importa este nuevo benchmark de IA ahora?

La llegada de ARC-AGI-2 es oportuna. Muchas voces dentro de la industria tecnológica, incluido el cofundador de Hugging Face, Thomas Wolf, han estado abogando por benchmarks más robustos y novedosos para medir verdaderamente el progreso de la IA, particularmente en áreas como la creatividad: un componente clave de la Inteligencia General Artificial.

Las limitaciones de los benchmarks anteriores se estaban volviendo cada vez más evidentes. Los modelos podían lograr altas puntuaciones a través de métodos que no reflejaban necesariamente una inteligencia genuina, como la memorización extensa o la computación de fuerza bruta. ARC-AGI-2 busca abordar estas deficiencias de frente, ampliando los límites de la evaluación de IA.

El Premio Arc 2025: Un Desafío para Impulsar la Inteligencia de la IA

Agregando otra capa de emoción, la Fundación Arc Prize ha anunciado el concurso del Premio Arc 2025. Este desafío invita a los desarrolladores a alcanzar una precisión del 85% en la prueba ARC-AGI-2 mientras cumplen con una estricta restricción de costo de solo $0.42 por tarea. Este concurso no se trata solo de lograr altas puntuaciones; se trata de fomentar modelos de IA eficientes y verdaderamente inteligentes.

Esta nueva prueba de AGI, ARC-AGI-2, representa un paso significativo hacia adelante en nuestra capacidad para medir y comprender la inteligencia general artificial. Es un recordatorio claro de que, aunque los modelos de IA han logrado avances increíbles, la verdadera inteligencia a nivel humano, caracterizada por la adaptabilidad y la eficiencia, sigue siendo una frontera formidable. El desafío está planteado, y la carrera por construir una IA verdaderamente inteligente está en marcha, con ARC-AGI-2 sirviendo como la nueva y más rigurosa medida.

Para aprender más sobre las últimas tendencias de benchmark de IA, explora nuestro artículo sobre los desarrollos clave que están dando forma a los avances en IA.