Os modelos de IA estão ficando deliberadamente mais “burros” sobre fatos, enquanto ficam mais inteligentes em raciocínio. Isso não é um bug; é a estratégia inteira.
A matemática: o GLM-5.2 atinge 99,2% no AIME 2026 usando ~40B de parâmetros ativos. O Qwen3.5 chega a 91,3% com apenas 17B. O DeepSeek V4-Flash roda em 13B. O GPT-4 original (2023), supostamente, usava ~280B de parâmetros ativos e ainda assim foi ruim em problemas do AIME. Mesmo um Qwen3.5 quantizado 9B em 6GB de VRAM dobra a pontuação de inteligência do modelo anterior melhor entre os que têm menos de 10B.
Mas peça para esses mesmos modelos perguntas factuais básicas e eles desmoronam. O Gemini 2.5 Pro lidera o SimpleQA com apenas 53% de acurácia em recuperação factual de formato curto. O Qwen3.5 4B e 9B alucinam 80–82% do tempo em benchmarks de conhecimento. Pergunte o ano de nascimento de um matemático aleatório do século XIX e você receberá uma “certeza” de bobagem.
A física: modelos de linguagem armazenam aproximadamente 2–3,6 bits de conhecimento factual por parâmetro. Um modelo de 7B, teoricamente, pode conter a Wikipédia em inglês mais livros-texto, mas isso é um uso extremamente caro de “espaço” de parâmetros. Fatos exigem uma capacidade enorme. Já procedimentos de raciocínio (decomposição, controle de estado, detecção de contradições, retrocesso) comprimem muito melhor e transferem com eficiência via destilação e RL em tarefas verificáveis.
A economia: o treinamento na fronteira custa centenas de milhões e leva meses. Na data de envio, o conhecimento factual já está obsoleto (APIs mudaram, preços se moveram, artigos foram retratados). Re-treinar para atualizar fatos é proibitivamente caro. Procedimentos de raciocínio não expiram. Álgebra continua sendo álgebra. Detecção de contradições permanece útil por anos. Modelos otimizados para procedimentos envelhecem com naturalidade porque o estado do mundo nunca foi para “morar” nos pesos.
Os laboratórios estão negociando explicitamente memória enciclopédica por capacidade de raciocínio. O futuro do modelo é um resolvedor pequeno e afiado que sabe como validar fontes externas, e não um banco de fatos inchado fingindo saber de tudo.
A matemática: o GLM-5.2 atinge 99,2% no AIME 2026 usando ~40B de parâmetros ativos. O Qwen3.5 chega a 91,3% com apenas 17B. O DeepSeek V4-Flash roda em 13B. O GPT-4 original (2023), supostamente, usava ~280B de parâmetros ativos e ainda assim foi ruim em problemas do AIME. Mesmo um Qwen3.5 quantizado 9B em 6GB de VRAM dobra a pontuação de inteligência do modelo anterior melhor entre os que têm menos de 10B.
Mas peça para esses mesmos modelos perguntas factuais básicas e eles desmoronam. O Gemini 2.5 Pro lidera o SimpleQA com apenas 53% de acurácia em recuperação factual de formato curto. O Qwen3.5 4B e 9B alucinam 80–82% do tempo em benchmarks de conhecimento. Pergunte o ano de nascimento de um matemático aleatório do século XIX e você receberá uma “certeza” de bobagem.
A física: modelos de linguagem armazenam aproximadamente 2–3,6 bits de conhecimento factual por parâmetro. Um modelo de 7B, teoricamente, pode conter a Wikipédia em inglês mais livros-texto, mas isso é um uso extremamente caro de “espaço” de parâmetros. Fatos exigem uma capacidade enorme. Já procedimentos de raciocínio (decomposição, controle de estado, detecção de contradições, retrocesso) comprimem muito melhor e transferem com eficiência via destilação e RL em tarefas verificáveis.
A economia: o treinamento na fronteira custa centenas de milhões e leva meses. Na data de envio, o conhecimento factual já está obsoleto (APIs mudaram, preços se moveram, artigos foram retratados). Re-treinar para atualizar fatos é proibitivamente caro. Procedimentos de raciocínio não expiram. Álgebra continua sendo álgebra. Detecção de contradições permanece útil por anos. Modelos otimizados para procedimentos envelhecem com naturalidade porque o estado do mundo nunca foi para “morar” nos pesos.
Os laboratórios estão negociando explicitamente memória enciclopédica por capacidade de raciocínio. O futuro do modelo é um resolvedor pequeno e afiado que sabe como validar fontes externas, e não um banco de fatos inchado fingindo saber de tudo.