A busca pela Inteligência Geral Artificial (AGI) ficou muito mais interessante e desafiadora! Em um desenvolvimento inovador que está causando repercussões no mundo da IA, a Arc Prize Foundation, liderada pelo luminar da IA François Chollet, revelou um novo teste de AGI incrivelmente difícil. Batizado de ARC-AGI-2, este benchmark é projetado para medir verdadeiramente a inteligência geral dos modelos de IA, e os primeiros resultados são, bem, humilhantes até mesmo para os sistemas mais avançados.
Por que o ARC-AGI-2 é o novo obstáculo para os modelos de IA?
De acordo com uma postagem recente no blog da Arc Prize Foundation, o ARC-AGI-2 está se mostrando um desafio formidável. Modelos de IA “raciocínio” líderes, como o o1-pro da OpenAI e o R1 da DeepSeek, estão mal arranhando a superfície, pontuando apenas 1% a 1,3% na tabela de classificação do teste AGI. Mesmo modelos não-raciocínio poderosos, incluindo GPT-4.5, Claude 3.7 Sonnet e Gemini 2.0 Flash, estão apenas marcando cerca de 1%. Isso contrasta fortemente com o desempenho humano, onde os painéis tiveram uma média sólida de 60% de precisão nas mesmas perguntas do ARC-AGI-2.
Então, o que torna este novo benchmark de IA tão diferente e difícil?
Problemas de Quebra-Cabeça Visual: O ARC-AGI-2 apresenta modelos de IA com problemas semelhantes a quebra-cabeças envolvendo a identificação de padrões visuais em grades de quadrados coloridos. O objetivo é que a IA gere a grade de “resposta” correta com base nesses padrões.
Foco em Adaptabilidade: Ao contrário dos testes anteriores, o ARC-AGI-2 é especificamente projetado para forçar modelos de IA a se adaptarem a tipos de problemas totalmente novos que não encontraram durante o treinamento. Isso testa a verdadeira capacidade de resolução de problemas, em vez de apenas a memória.
Métrica de Eficiência: Uma inovação chave no ARC-AGI-2 é a introdução de uma métrica de eficiência. Isso significa que não se trata apenas de obter a resposta certa, mas também de quão eficientemente o modelo de IA chega à solução. Isso aborda diretamente as preocupações sobre o poder de computação de força bruta mascarando a verdadeira inteligência em benchmarks anteriores.
Aqui está uma comparação de como diferentes tipos de modelos estão se saindo:
Exemplos de Tipos de Modelos de IA Pontuação ARC-AGI-2 (Aproximadamente) Modelos de IA Raciocínio OpenAI o1-pro, DeepSeek R1 1% – 1,3% Modelos de IA Não-Raciocínio GPT-4.5, Claude 3.7 Sonnet, Gemini 2.0 Flash Cerca de 1% Painéis Humanos Participantes médios 60%
Fonte: Tabela de Classificação da Arc Prize
ARC-AGI-2 vs. ARC-AGI-1: O que mudou?
François Chollet declarou no X (antigo Twitter) que o ARC-AGI-2 é uma medida superior da verdadeira inteligência de um modelo de IA em comparação com seu predecessor, o ARC-AGI-1. O objetivo central dos testes da Arc Prize Foundation permanece consistente: avaliar a capacidade de um sistema de IA de aprender novas habilidades além de seus dados de treinamento.
No entanto, o ARC-AGI-2 aborda uma falha crítica no ARC-AGI-1 – a dependência excessiva da computação de força bruta. O ARC-AGI-1, apesar de ser um benchmark desafiador de IA por anos, foi eventualmente “resolvido” pelo modelo o3 (baixo) da OpenAI. Embora o o3 (baixo) tenha alcançado impressionantes 75,7% no ARC-AGI-1, demonstrando aparente desempenho em nível humano, sua pontuação despencou para meros 4% no ARC-AGI-2, mesmo com um custo significativo de $200 por tarefa. Isso destaca a mudança fundamental de foco em direção à eficiência e à verdadeira inteligência no novo teste.
Por que este novo benchmark de IA é importante agora?
A chegada do ARC-AGI-2 é oportuna. Muitas vozes dentro da indústria de tecnologia, incluindo o cofundador da Hugging Face, Thomas Wolf, têm defendido benchmarks mais robustos e novos para realmente medir o progresso da IA, particularmente em áreas como criatividade – um componente chave da Inteligência Geral Artificial.
As limitações dos benchmarks anteriores estavam se tornando cada vez mais evidentes. Os modelos podiam alcançar pontuações altas por meio de métodos que não refletiam necessariamente a verdadeira inteligência, como a memorização extensa ou a computação de força bruta. O ARC-AGI-2 busca abordar essas deficiências de frente, ampliando os limites da avaliação de IA.
O Arc Prize 2025: Um Desafio para Impulsionar a Inteligência da IA
Adicionando outra camada de empolgação, a Arc Prize Foundation anunciou o concurso Arc Prize 2025. Este desafio convida desenvolvedores a alcançar uma precisão de 85% no teste ARC-AGI-2, enquanto adere a uma restrição de custo rigorosa de apenas $0,42 por tarefa. Este concurso não se trata apenas de alcançar altas pontuações; trata-se de promover modelos de IA eficientes e verdadeiramente inteligentes.
Este novo teste de AGI, ARC-AGI-2, representa um passo significativo em nossa capacidade de medir e entender a inteligência geral artificial. É um lembrete claro de que, embora os modelos de IA tenham feito avanços incríveis, a verdadeira inteligência em nível humano, caracterizada por adaptabilidade e eficiência, continua sendo uma fronteira formidável. O desafio está lançado, e a corrida para construir uma IA verdadeiramente inteligente está em andamento, com o ARC-AGI-2 servindo como o novo critério mais rigoroso.
Para saber mais sobre as últimas tendências de benchmark de IA, explore nosso artigo sobre os principais desenvolvimentos que moldam os avanços em IA.
