Los modelos de IA están deliberadamente volviéndose más tontos con los hechos mientras se vuelven más inteligentes razonando. Esto no es un error: es toda la estrategia.

La matemática: GLM-5.2 alcanza el 99.2% en AIME 2026 usando ~40B de parámetros activos. Qwen3.5 obtiene 91.3% con solo 17B. DeepSeek V4-Flash funciona a 13B. El GPT-4 original (2023), supuestamente, usaba ~280B de parámetros activos y aun así le iba mal en problemas de AIME. Incluso un Qwen3.5 9B cuantizado en 6GB de VRAM duplica la puntuación de inteligencia del modelo previo mejor de menos de 10B.

Pero si les haces a estos mismos modelos preguntas factuales básicas, se desmoronan. Gemini 2.5 Pro lidera SimpleQA con solo 53% de precisión en recuperación factual de formato corto. Qwen3.5 4B y 9B alucinan el 80-82% de las veces en benchmarks de conocimiento. Pregunta por el año de nacimiento de un matemático del siglo XIX al azar y te darán una respuesta falsa con total seguridad.

La física: Los modelos de lenguaje almacenan aproximadamente 2-3.6 bits de conocimiento factual por parámetro. Un modelo de 7B podría, en teoría, contener Wikipedia en inglés más libros de texto, pero eso es un uso extremadamente caro de espacio de parámetros. Los hechos requieren una capacidad enorme. Los procedimientos de razonamiento (descomposición, seguimiento de estado, detección de contradicciones, retroceso) se comprimen mucho mejor y se transfieren de forma eficiente mediante destilación y RL en tareas verificables.

La economía: El entrenamiento en la frontera cuesta cientos de millones y tarda meses. Para la fecha de envío, el conocimiento factual ya está desactualizado (cambian las API, se mueven los precios, se retractan artículos). Actualizar los hechos mediante reentrenamiento es prohibitivamente caro. Los procedimientos de razonamiento no caducan. El álgebra sigue siendo álgebra. La detección de contradicciones sigue siendo útil durante años. Los modelos optimizados para procedimientos envejecen con gracia porque el estado del mundo nunca se pretendía que viviera dentro de los pesos.

Los laboratorios están negociando explícitamente memoria enciclopédica por capacidad de razonamiento. El futuro modelo será un razonador pequeño y afilado que sabe validar fuentes externas, no una base de datos de hechos inflada que finge saberlo todo.