I. Primera etapa: hacer que las máquinas “vean” — era de las reglas → era de la percepción


La historia de la IA, en realidad, empezó hace mucho tiempo.


La conferencia de Dartmouth de 1956 suele considerarse el punto de partida importante de la inteligencia artificial moderna como un campo de investigación independiente. En aquel entonces, la IA dependía más de que las personas definieran reglas manualmente, con la esperanza de escribir la lógica humana directamente en las máquinas.


El problema central de esta época es:


“¿Puedo decirle a la máquina cómo debe hacer las cosas?”


Por ejemplo:



  • Si A, entonces B;


  • Si se detecta alguna característica, entonces se determina como algún objeto;


  • Si se cumplen ciertas condiciones, se ejecuta una acción específica.


El problema también es muy claro:


El mundo real es demasiado complejo.


Una persona puede juzgarlo con facilidad:


“Es un gato.”


Pero es difícil escribir “¿qué es un gato?” como decenas de miles de reglas.


Entonces la IA empieza desde:


Hacer que la máquina ejecute reglas escritas por humanos


Giro hacia:


Que las máquinas aprendan por sí mismas las reglas a partir de los datos.


Esta es la razón fundamental por la que surgieron el machine learning y, más tarde, el deep learning.



II. 2012: La IA por primera vez “entiende el mundo” de verdad


ImageNet de 2012 fue un punto de inflexión muy importante.


AlexNet usa redes convolucionales profundas y logra avances en tareas de reconocimiento de imágenes a gran escala, haciendo que toda la industria replantee su comprensión:


Mientras haya suficientes datos, suficiente capacidad de cómputo y suficiente tamaño de red neuronal, las máquinas pueden aprender por sí mismas reglas visuales complejas.


Después de esto, la IA entra en la era del deep learning.


Entonces aparece un gran conjunto de capacidades que hoy damos por sentadas:



  • Clasificación de imágenes


  • Reconocimiento facial


  • OCR


  • Visión para conducción autónoma


  • Reconocimiento de imágenes médicas


  • Comprensión de video


  • Sistemas de recomendación


En esta etapa, lo mejor que hace la IA es:


Identificar.


Dale una foto y te dirá:


“Esto es un gato.”


Le das un fragmento de voz y te dice:


“Es lo que dijiste.”


Dale una placa de rayos X y determinará:


“Aquí existe una anomalía.”


Pero aún no comprendía de verdad este mundo.


Solo se irá volviendo cada vez más capaz de extraer patrones de la entrada.



III. 2016: AlphaGo le muestra al mundo que la IA no solo puede reconocer, sino también “pensar”


En 2016, AlphaGo vence a Lee Sedol: otro gran hito en la historia de la IA.


AlphaGo no solo memoriza secuencias de partidas.


Transforma en:


Redes neuronales profundas + búsqueda + aprendizaje por refuerzo


Combínalo.


Aprende tanto los registros de ajedrez humano como, mediante el autoenfrentamiento, sigue aprendiendo. Finalmente, en el enorme espacio de búsqueda del Go, forma estrategias que superan a los mejores jugadores humanos.


La importancia de esto es:


La IA muestra a gran escala su valor para el público por primera vez:


Las máquinas no solo pueden reconocer patrones, sino que mediante el entrenamiento, la búsqueda, la retroalimentación y el ensayo y error forman estrategias.


Entonces la capacidad de la IA comenzó a pasar de:


Percepción


Hacia:


Decisión


Desarrollarse.


Esto siembra las bases para el aprendizaje por refuerzo, modelos de razonamiento y agentes de IA posteriores.



IV. 2017: Transformer cambia toda la industria de la IA


Si 2012 fue el estallido de la era del deep learning, entonces 2017 es la verdadera base tecnológica de la era actual de los grandes modelos.


Ese año, el equipo de Google publicó un paper:


(Attention Is All You Need)


Proponer Transformer.


Su mayor cambio es poner “Attention” en el núcleo del modelo, y además es especialmente adecuado para el entrenamiento masivamente paralelo.


Después, casi todo el mundo de la IA generativa se basó en esta ruta tecnológica:


Transformer → GPT → LLM → Modelos multimodales → Agente → Modelo del mundo


Así que lo que vemos hoy con ChatGPT, Claude y Gemini no surgió de la nada.


En realidad, es lo que ha sido en décadas pasadas:


Datos + Red neuronal + GPU + Transformer + Scaling


El resultado de lo que acumulamos juntos.



V. 2020: GPT-3 demuestra algo muy importante


En 2020, OpenAI lanzó GPT-3.


175 mil millones de parámetros.


Su importancia no es solo “grande”.


Lo verdaderamente importante es:


Después de que el tamaño del modelo crece, aparecen capacidades generales “emergentes” cada vez más potentes.


GPT-3 ya puede completar distintas tareas con pocos ejemplos, sin necesidad de volver a entrenar el modelo para cada tarea.


Esto cambia la ruta de investigación de la industria de la IA.


Antes todos pensaban:


Entrenar un modelo para una tarea.


Luego poco a poco se volvió:


Entrenar un modelo base lo bastante grande y dejar que se adapte a muchas tareas.


Entonces aparece un concepto muy importante:


Foundation Model


Modelo base.


Esa también es la clave de la explosión de la IA en los últimos años.



VI. 2021—2022: la IA empieza a entrar en “generar el mundo” desde “comprender texto”


Esta etapa es muy importante porque la IA empieza a superar el texto puro.


La DALL·E de OpenAI ya puede generar imágenes a partir del texto.


Luego:



  • Stable Diffusion


  • Midjourney


  • DALL·E


  • Imagen


  • Sora


  • Veo


Sigue ampliando la capacidad generativa de IA desde:


Texto → Imagen → Video → Audio → 3D


Hacia la expansión hacia afuera.


Entonces la IA empieza a mostrar un cambio muy evidente:


Antes era:


La IA comprende el contenido creado por humanos.


Ahora se ha convertido en:


La IA crea contenido por sí misma.


Esto es Generative AI.



VII. A finales de 2022: ChatGPT lleva la IA a la era masiva


Después de 2022, la IA entra de verdad en la vida de la gente común.


El mayor avance de ChatGPT no fue la primera aparición de un modelo de lenguaje.


En vez de eso, empaquetar muchas capacidades complejas de IA en:


Una interfaz con la que una persona normal puede conversar directamente.


A partir de este momento:


Por primera vez, la IA se convierte en una herramienta de productividad masiva real.


Escribir artículos, escribir código, traducir, resumir, analizar, buscar, aprender…


Todo empieza a girar en torno a:


“Le dices a la IA qué quieres hacer.”


Desplegarse.


Entonces en los últimos años, toda la industria de IA casi ha competido alrededor de un solo problema:


¿El modelo de quién es más fuerte?



VIII. 2023—2025: la IA evoluciona de “chat” a “razonamiento”


Este es en realidad el paso más clave para entender la IA hoy.


Los grandes modelos tempranos se parecían más a:


Un súper predictor de lenguaje.


Le das una frase y predice la siguiente.


Pero luego la investigación empezó a enfocarse cada vez más en:



  • Chain of Thought


  • Aprendizaje por refuerzo


  • Cómputo en tiempo de prueba


  • Razonamiento


  • Uso de herramientas


  • Planificación


  • Tareas de horizonte largo


Es decir:


La IA empieza a no estar satisfecha con:


“Te doy una respuesta.”


Y empieza a intentar:


“Primero déjame pensarlo y completaré la tarea.”


Ese es el Reasoning Model.


Para 2026, el foco de la competencia entre laboratorios de vanguardia como OpenAI, Anthropic y Google ya se ve claramente que se ha desplazado desde la mera capacidad de chat hacia:


Razonamiento complejo + programación + llamadas a herramientas + tareas de largo horizonte + Agente.


Por ejemplo, el GPT-6 Astra de OpenAI enfatiza capacidades como matemáticas, ingeniería de software, operaciones informáticas, navegación en navegador y trabajo profesional; al mismo tiempo, OpenAI sigue optimizando los modelos, la infraestructura de inferencia y el Agentic Harness.


La serie más reciente de Claude 5.5 de Anthropic también resalta claramente el trabajo complejo, las tareas de ciclo largo y la codificación agentificada.


Esto significa:


La IA ya pasó de “responder preguntas” a “completar tareas”.


Esta es una línea divisoria muy importante hoy.



IX. Entonces, ¿hasta qué punto ha llegado realmente la IA mainstream hoy?


Si dibujas la industria de la IA de 2026 como un mapa, más o menos se puede dividir en las siguientes rutas.


































































Ruta de IA


Capacidad central actual


Representa a los jugadores


Siguiente paso


LLM


Lenguaje, conocimiento, razonamiento


OpenAI, Anthropic, Google


Mejor razonamiento, Agente


Multimodal


Texto + imagen + audio + video


OpenAI, Google, Meta, Mistral


Representación unificada del mundo


Agente de IA


Ejecutar tareas automáticamente


OpenAI, Anthropic, Google


Acción autónoma de ciclo largo


Coding Agent


Escribir código, cambiar código, desplegar


OpenAI, Anthropic, Google, etc.


Automatización de ingeniería de software


Video World


Generación y comprensión de video


Google, OpenAI, etc.


Simulación del mundo


Modelo del mundo


Comprender espacio, tiempo y causalidad


World Labs, Google, Meta, NVIDIA


Simular el mundo real


Robotics / Physical AI


Controlar el robot


Google, NVIDIA, etc.


Entrar en el mundo real


Inteligencia espacial


Comprensión del espacio 3D


World Labs, etc.


La máquina entiende de verdad el espacio


Edge AI


Ejecutar localmente


Apple, Google, Qualcomm, NVIDIA, etc.


La IA entra en el terminal


Así que hoy en realidad no es:


“La IA ya entró en la era del modelo del mundo, y el gran modelo terminó.”


Más exactamente:


El LLM sigue siendo un núcleo importante de la IA de hoy, pero se está convirtiendo en un componente dentro de sistemas de IA más grandes.


Estas dos frases son muy diferentes.



X. OpenAI: pasar de “modelo de lenguaje” a “Agente general”


La ruta actual de OpenAI se puede entender de forma simple como:


LLM → Reasoning → Multimodal → Agente → Computer Use → Inteligencia general


O sea:


Hacer que la IA no solo pueda responder:


“¿Cómo se hace?”


Sino directamente:


“Lo hago por ti.”


Así es como se agentifica.


En el futuro, un solo sistema de IA quizá no sea “te doy un fragmento de código”, sino:



  1. Entender las necesidades


  2. Buscar información


  3. Escribir código


  4. Ejecutar el código


  5. Encontrar bugs


  6. Modificar


  7. Probar


  8. Desplegar


  9. Informar los resultados


Así que el enfoque de OpenAI ahora se parece cada vez menos a un “chatbot” en el sentido tradicional.


Más bien:


El trabajador general en el mundo digital.


La última arquitectura de modelos de OpenAI ya cubre simultáneamente razonamiento, uso de computadoras, navegación, ingeniería de software, voz en tiempo real y generación de imágenes, entre otras direcciones.



XI. Anthropic: convertir la IA en un “agente de trabajo a largo plazo”


La ruta de Anthropic también es muy clara.


Claude está pasando de:


Asistente de chat


Hacia:


Ejecutor de tareas de horizonte largo


La evolución.


Especialmente en que:



  • Coding


  • Computer Use


  • Tareas de horizonte largo


  • Flujos de trabajo agentificados


  • Trabajo del conocimiento en empresas


La inversión en eso.


La última serie de Claude 5.5 ya enfatiza claramente la codificación agentificada y la capacidad de trabajo de ciclo largo.


Si la IA temprana era:


“Me preguntas y te respondo.”


Ahora se parece cada vez más a:


“Me das un proyecto y yo lo termino.”



XII. Google DeepMind: quizá sea la ruta más completa


La ruta de Google es muy interesante.


Porque Google tiene al mismo tiempo:



  • Gemini


  • Búsqueda


  • YouTube


  • Android


  • Waymo


  • DeepMind


  • TPU


  • Investigación en robótica


  • Investigación de modelo del mundo


Así que Google no limitó la IA a un chatbot.


Actualmente, Google DeepMind ya ha definido claramente sus direcciones de investigación en:


Foundation Models


↓


Multimodal AI


↓


Agentes


↓


World Models


↓


Robotics / Physical AI


En el sistema de modelos más reciente de Google ya aparecen claramente Genie 3 World Model y Gemini Robotics 2.


Gemini Robotics 2 va aún más lejos: conecta la visión, el lenguaje, el razonamiento espacial y las acciones del robot:


Ver objetos → Comprender el entorno → Definir un plan → Controlar el robot.


Esto ya no es un chatbot en el sentido tradicional.



XIII. Meta: V-JEPA representa otra ruta del modelo del mundo


La dirección de investigación de Meta vale mucho la pena prestar atención.


Lo que hace V-JEPA 2 no es simplemente dejar que la IA genere videos bonitos.


Sino que:


Hacer que la IA aprenda cómo cambia el mundo a partir del video.


Por ejemplo:


Una taza cae.


La IA no solo debería saber:


“Esto es una taza.”


Lo que deberíamos predecir es:


“¿Hacia dónde caerá después?”


Esta es:


Predicción del mundo


Meta posicionó V-JEPA 2 como un modelo del mundo de auto-supervisión; puede comprender y predecir cambios en el entorno, y usarse aún más para el control de robots.


En realidad esto se parece mucho a la dirección que dijo Li Fei-Fei.



XIV. NVIDIA: apuesta directamente por Physical AI


Si OpenAI está investigando:


Inteligencia en el mundo digital.


Entonces NVIDIA claramente está apostando por:


La inteligencia en el mundo físico.


NVIDIA Cosmos es un caso típico.


Cosmos 3 ya se ha identificado como un modelo base abierto de Physical AI, que cubre:



  • Vision Reasoning


  • Generación del mundo


  • Predicción de acciones


  • Simulación del mundo


  • Datos sintéticos


  • Robotics


Esto significa que el entrenamiento de robots en el futuro quizá no sea:


Hacer que los robots caigan realmente 1 millón de veces.


Sino que:


Caer un millón de veces en un mundo virtual generado por IA.


Y luego transferir las estrategias aprendidas al mundo real.


Esto reducirá enormemente el costo de entrenamiento de robots.



XV. World Labs: ¿en qué estaba apostando de verdad Li Fei-Fei?


Mirando hacia atrás ahora, se entiende por qué la acción de Li Fei-Fei merece tanta atención.


La ruta de World Labs no es:


Reconstruir otro ChatGPT.


No es:


Obtener inteligencia espacial para la IA.


El Atlas más reciente de World Labs es un ejemplo muy representativo.


No es un simple generador de video.


Atlas puede manejar:


Texto + imagen + video + 3D + posición de la cámara + profundidad


Y poner toda esa información en un único espacio de contexto.


Puede:



  • Reconstruir un mundo 3D a partir de imágenes


  • Generar nuevas perspectivas


  • Comprender relaciones espaciales


  • Simular espacio y tiempo


  • Generar entornos utilizables para entrenar robots


Esto es:


World Model


Modelo del mundo.



XVI. ¿Por qué “World Model” podría ser el siguiente destino de la IA?


Porque los LLM tienen una limitación natural.


Su dato más familiar es:


Token.


Por ejemplo:


Hay una taza sobre la mesa.


El modelo puede entender esta frase.


Pero el problema del mundo real es:


¿Cuántos centímetros hay desde la taza hasta el borde de la mesa?


¿Cuánto pesa la taza?


¿Desde qué ángulo se estira la mano?


Después de que la mano toca la taza, ¿se volcará?


Si la mesa se golpea, ¿qué le pasa a la taza?


Estos problemas no son solo problemas de lenguaje puro.


Son:


Espacio + tiempo + física + causalidad + acción


Problema.


Así que:


Lo que comprende el modelo de lenguaje es el “mundo descrito por los humanos”.


Y el modelo del mundo intenta comprender:


“Cómo funciona el mundo en sí.”


Esa es la diferencia central entre ambas.



XVII. Por eso Fei-Fei Li dice:


“The world is not made of words.”


Esta frase en realidad merece entenderse una y otra vez.


Porque en los últimos años cometimos un error fácil de entender:


Hacemos que:


IA = LLM


Pero en realidad:


El LLM es solo un contenedor de la inteligencia.


La inteligencia humana no es solo lenguaje.


Cuando los humanos empiezan a aprender desde pequeños:


No empezar leyendo 10 mil millones de tokens.


Sino que:


Mira.


Escucha.


Tocar.


Mover.


Caer.


Observar a los demás.


Predecir el resultado.


Seguir probando y equivocándose.


Finalmente se forma un modelo interno del mundo.



XVIII. Entonces la siguiente etapa de la IA podría ser la “era de los cinco sentidos”


Si descomponemos aún más el futuro de la IA, más o menos se convertiría en:


Capa uno: Language


Comprender el lenguaje.


↓


Capa dos: Vision


Comprender imágenes.


↓


Capa tres: Audio


Comprender los sonidos.


↓


Capa cuatro: Video


Comprender cambios continuos en el mundo.


↓


Capa cinco: 3D / Espacial


Comprensión del espacio.


↓


Capa seis: World Model


Entender cómo funciona el mundo.


↓


Capa siete: Action


Tomar acción.


↓


Capa ocho: Physical AI


Ejecutar acciones en el mundo real.


En ese momento, la IA por fin salió de:


“El cerebro”


Empieza a convertirse en:


“Cerebro + ojos + oídos + manos + cuerpo”.



XIX. Entonces, lo que realmente vale la pena mirar en el futuro no es “quién tiene más parámetros en su gran modelo”


Este es un punto que yo creo que vale mucho la pena ampliar en este artículo.


En el pasado, la competencia de IA era:


Cantidad de parámetros.


Luego:


Benchmark.


Luego:


Capacidad de razonamiento.


Ahora:


Agente.


Siguiente paso:


Modelo del mundo + Physical AI.


Entonces la cadena de la industria de la IA cambiará.


Lo más central en el pasado era:


Datos → GPU → Gran modelo → Chatbot


El futuro podría volverse:


Datos → Modelo base → Modelo del mundo → Simulación → Agente → Robot → Mundo real


Esto también explica por qué las empresas de chips empiezan a acercarse frenéticamente a la capa del modelo.


Porque:


El mejor chip en el futuro no necesariamente es solo el que ejecuta los grandes modelos de hoy; podría decidir qué puede comprender, qué puede simular y qué puede hacer la IA de la siguiente generación.



XX. Y por eso AMD tiene que gastar 8.200 millones de dólares para comprar World Labs


Esta transacción vale más la pena mirar, en realidad no es 82 mil millones de dólares en sí.


En vez de eso, cambia la posición en la cadena industrial.


World Labs declaró oficialmente que en el pasado ya había iniciado una colaboración profunda con AMD, incluyendo el entrenamiento de modelos y la optimización del procesamiento de inferencia en GPUs de AMD.


Ahora ambas partes se fusionan directamente.


Li Fei-Fei se convertirá en vicepresidenta ejecutiva de AMD y científica jefe; el equipo de World Labs seguirá a cargo de las investigaciones de modelos relacionadas. La transacción se espera completar a finales de 2026 y aún requiere aprobación regulatoria.


La lógica que AMD ofrece por sí misma también es directa:


A medida que la IA entra en:


Razonamiento, robots, simulación, Physical AI


La demanda de cómputo cambiará.


Por lo tanto, las empresas de chips deben comprender más a fondo:


Cómo será realmente el modelo del futuro.


Esta frase es en realidad más importante que 8.200 millones de dólares.



XXI. Entonces, la verdadera ruta de evolución de la IA se puede condensar en esta imagen


1950s


Reglas de IA


│


│ Hacer que la máquina ejecute las reglas escritas por el humano


▼


2012


Deep learning


│


│ Hacer que las máquinas aprendan desde los datos


▼


2016


Aprendizaje por refuerzo


│


│ Hacer que la máquina forme estrategias mediante ensayo y error


▼


2017


Transformer


│


│ Hacer posible los modelos a gran escala


▼


2020


GPT-3


│


│ Empiezan a aparecer capacidades generales en los modelos base


▼


2021-2022


Generative AI


│


│ Texto → Imagen → Audio → Video


▼


2022-2024


LLM


│


│ La IA se convierte en un asistente general de conocimiento


▼


2024-2026


Razonamiento


│


│ La IA empieza a “pensar”


▼


2025-2026


Agente de IA


│


│ La IA empieza a “hacer cosas”


▼


Se está acelerando


Modelo del mundo


│


│ La IA empieza a comprender espacio, tiempo y causalidad


▼


Siguiente etapa


Physical AI


│


│ La IA empieza a controlar robots


▼


Un futuro más lejano


Inteligencia encarnada


│


│ La IA entra de verdad en el mundo real



XXII. Y la IA de 2026, en realidad, está en un “punto de cruce”


Este es el lugar más fácil de pasar por alto.


Hoy no es el fin de la era de LLM.


Justo lo contrario.


Es muy probable que el futuro no sea:


Los LLM son reemplazados por el modelo del mundo.


En vez de eso:


El LLM se convierte en parte del modelo del mundo.


Un sistema futuro de IA realmente poderoso probablemente tenga simultáneamente:


Modelos de lenguaje


Encargarse de comprender la intención humana.


Modelo de visión


Encargado de observar.


Modelo del mundo


Encargado de predecir el entorno.


Modelos de razonamiento


Encargado de definir planes.


Agente


Encargarse de llamar a herramientas.


Modelo de robots


Encargado de ejecutar acciones.


Un chip


Encargado de ejecutar todo eso en tiempo real.


Finalmente se forma:


Percepción → Razonamiento → Simulación → Planificación → Acción


O sea:


Percepción → Pensar → Simular → Planificar → Actuar.



XXIII. Entonces, la siguiente etapa de la IA quizá no sea “un modelo más grande”


Sino que:


Una inteligencia más completa.


Antes siempre preguntábamos:


“¿Cuántos parámetros tiene este modelo?”


En el futuro quizá sea cada vez más apropiado preguntar:


“¿Cuánto mundo entiende realmente esta IA?”


Antes comparábamos:


¿Quién tiene mejores respuestas?


En el futuro quizá se compare:


¿Quién puede completar realmente una tarea compleja?


Antes, la IA existía en:


Dentro de la ventana de ChatGPT.


En el futuro, la IA podría existir en:


En autos, robots, fábricas, hospitales, juegos, edificios, drones, dispositivos de computación espacial y todo el mundo físico.



Por último, resume en una frase la evolución de la IA durante estos 70 años


Al principio, la IA aprendía reglas humanas; luego aprendía la visión humana; después aprendía el lenguaje humano; ahora empieza a aprender el razonamiento humano; y en la siguiente etapa, lo que realmente necesita aprender es el mundo del que depende la humanidad para vivir.


Así que lo que Li Fei-Fei merece realmente la pena observar en esta ocasión no es que haya ido a AMD.


Sino:


Una científica que lleva más de 20 años “haciendo que las máquinas vean”, ahora está cambiando el objetivo de “ver” hacia “comprender el espacio, comprender el mundo, comprender la realidad”.


Y se puede ver una tendencia industrial muy clara en todo esto: de Google Genie 3, Gemini Robotics a Meta V-JEPA 2, y luego a NVIDIA Cosmos y World Labs Atlas:


El campo de batalla de la IA se está expandiendo de “información digital” a “mundo real”.


Esta podría ser la línea principal de IA más digna de atención en los próximos años.


El gran modelo resuelve “si la IA puede hablar”; el agente resuelve “si la IA puede hacer”; y el modelo del mundo, quizá es “si la IA realmente entiende este mundo”.