I. Primera etapa: hacer que las máquinas “vean” — era de las reglas → era de la percepción
La historia de la IA, en realidad, empezó hace mucho tiempo.
La conferencia de Dartmouth de 1956 suele considerarse el punto de partida importante de la inteligencia artificial moderna como un campo de investigación independiente. En aquel entonces, la IA dependía más de que las personas definieran reglas manualmente, con la esperanza de escribir la lógica humana directamente en las máquinas.
El problema central de esta época es:
“¿Puedo decirle a la máquina cómo debe hacer las cosas?”
Por ejemplo:
Si A, entonces B;
Si se detecta alguna característica, entonces se determina como algún objeto;
Si se cumplen ciertas condiciones, se ejecuta una acción específica.
El problema también es muy claro:
El mundo real es demasiado complejo.
Una persona puede juzgarlo con facilidad:
“Es un gato.”
Pero es difícil escribir “¿qué es un gato?” como decenas de miles de reglas.
Entonces la IA empieza desde:
Hacer que la máquina ejecute reglas escritas por humanos
Giro hacia:
Que las máquinas aprendan por sí mismas las reglas a partir de los datos.
Esta es la razón fundamental por la que surgieron el machine learning y, más tarde, el deep learning.
II. 2012: La IA por primera vez “entiende el mundo” de verdad
ImageNet de 2012 fue un punto de inflexión muy importante.
AlexNet usa redes convolucionales profundas y logra avances en tareas de reconocimiento de imágenes a gran escala, haciendo que toda la industria replantee su comprensión:
Mientras haya suficientes datos, suficiente capacidad de cómputo y suficiente tamaño de red neuronal, las máquinas pueden aprender por sí mismas reglas visuales complejas.
Después de esto, la IA entra en la era del deep learning.
Entonces aparece un gran conjunto de capacidades que hoy damos por sentadas:
Clasificación de imágenes
Reconocimiento facial
OCR
Visión para conducción autónoma
Reconocimiento de imágenes médicas
Comprensión de video
Sistemas de recomendación
En esta etapa, lo mejor que hace la IA es:
Identificar.
Dale una foto y te dirá:
“Esto es un gato.”
Le das un fragmento de voz y te dice:
“Es lo que dijiste.”
Dale una placa de rayos X y determinará:
“Aquí existe una anomalía.”
Pero aún no comprendía de verdad este mundo.
Solo se irá volviendo cada vez más capaz de extraer patrones de la entrada.
III. 2016: AlphaGo le muestra al mundo que la IA no solo puede reconocer, sino también “pensar”
En 2016, AlphaGo vence a Lee Sedol: otro gran hito en la historia de la IA.
AlphaGo no solo memoriza secuencias de partidas.
Transforma en:
Redes neuronales profundas + búsqueda + aprendizaje por refuerzo
Combínalo.
Aprende tanto los registros de ajedrez humano como, mediante el autoenfrentamiento, sigue aprendiendo. Finalmente, en el enorme espacio de búsqueda del Go, forma estrategias que superan a los mejores jugadores humanos.
La importancia de esto es:
La IA muestra a gran escala su valor para el público por primera vez:
Las máquinas no solo pueden reconocer patrones, sino que mediante el entrenamiento, la búsqueda, la retroalimentación y el ensayo y error forman estrategias.
Entonces la capacidad de la IA comenzó a pasar de:
Percepción
Hacia:
Decisión
Desarrollarse.
Esto siembra las bases para el aprendizaje por refuerzo, modelos de razonamiento y agentes de IA posteriores.
IV. 2017: Transformer cambia toda la industria de la IA
Si 2012 fue el estallido de la era del deep learning, entonces 2017 es la verdadera base tecnológica de la era actual de los grandes modelos.
Ese año, el equipo de Google publicó un paper:
(Attention Is All You Need)
Proponer Transformer.
Su mayor cambio es poner “Attention” en el núcleo del modelo, y además es especialmente adecuado para el entrenamiento masivamente paralelo.
Después, casi todo el mundo de la IA generativa se basó en esta ruta tecnológica:
Transformer → GPT → LLM → Modelos multimodales → Agente → Modelo del mundo
Así que lo que vemos hoy con ChatGPT, Claude y Gemini no surgió de la nada.
En realidad, es lo que ha sido en décadas pasadas:
Datos + Red neuronal + GPU + Transformer + Scaling
El resultado de lo que acumulamos juntos.
V. 2020: GPT-3 demuestra algo muy importante
En 2020, OpenAI lanzó GPT-3.
175 mil millones de parámetros.
Su importancia no es solo “grande”.
Lo verdaderamente importante es:
Después de que el tamaño del modelo crece, aparecen capacidades generales “emergentes” cada vez más potentes.
GPT-3 ya puede completar distintas tareas con pocos ejemplos, sin necesidad de volver a entrenar el modelo para cada tarea.
Esto cambia la ruta de investigación de la industria de la IA.
Antes todos pensaban:
Entrenar un modelo para una tarea.
Luego poco a poco se volvió:
Entrenar un modelo base lo bastante grande y dejar que se adapte a muchas tareas.
Entonces aparece un concepto muy importante:
Foundation Model
Modelo base.
Esa también es la clave de la explosión de la IA en los últimos años.
VI. 2021—2022: la IA empieza a entrar en “generar el mundo” desde “comprender texto”
Esta etapa es muy importante porque la IA empieza a superar el texto puro.
La DALL·E de OpenAI ya puede generar imágenes a partir del texto.
Luego:
Stable Diffusion
Midjourney
DALL·E
Imagen
Sora
Veo
Sigue ampliando la capacidad generativa de IA desde:
Texto → Imagen → Video → Audio → 3D
Hacia la expansión hacia afuera.
Entonces la IA empieza a mostrar un cambio muy evidente:
Antes era:
La IA comprende el contenido creado por humanos.
Ahora se ha convertido en:
La IA crea contenido por sí misma.
Esto es Generative AI.
VII. A finales de 2022: ChatGPT lleva la IA a la era masiva
Después de 2022, la IA entra de verdad en la vida de la gente común.
El mayor avance de ChatGPT no fue la primera aparición de un modelo de lenguaje.
En vez de eso, empaquetar muchas capacidades complejas de IA en:
Una interfaz con la que una persona normal puede conversar directamente.
A partir de este momento:
Por primera vez, la IA se convierte en una herramienta de productividad masiva real.
Escribir artículos, escribir código, traducir, resumir, analizar, buscar, aprender…
Todo empieza a girar en torno a:
“Le dices a la IA qué quieres hacer.”
Desplegarse.
Entonces en los últimos años, toda la industria de IA casi ha competido alrededor de un solo problema:
¿El modelo de quién es más fuerte?
VIII. 2023—2025: la IA evoluciona de “chat” a “razonamiento”
Este es en realidad el paso más clave para entender la IA hoy.
Los grandes modelos tempranos se parecían más a:
Un súper predictor de lenguaje.
Le das una frase y predice la siguiente.
Pero luego la investigación empezó a enfocarse cada vez más en:
Chain of Thought
Aprendizaje por refuerzo
Cómputo en tiempo de prueba
Razonamiento
Uso de herramientas
Planificación
Tareas de horizonte largo
Es decir:
La IA empieza a no estar satisfecha con:
“Te doy una respuesta.”
Y empieza a intentar:
“Primero déjame pensarlo y completaré la tarea.”
Ese es el Reasoning Model.
Para 2026, el foco de la competencia entre laboratorios de vanguardia como OpenAI, Anthropic y Google ya se ve claramente que se ha desplazado desde la mera capacidad de chat hacia:
Razonamiento complejo + programación + llamadas a herramientas + tareas de largo horizonte + Agente.
Por ejemplo, el GPT-6 Astra de OpenAI enfatiza capacidades como matemáticas, ingeniería de software, operaciones informáticas, navegación en navegador y trabajo profesional; al mismo tiempo, OpenAI sigue optimizando los modelos, la infraestructura de inferencia y el Agentic Harness.
La serie más reciente de Claude 5.5 de Anthropic también resalta claramente el trabajo complejo, las tareas de ciclo largo y la codificación agentificada.
Esto significa:
La IA ya pasó de “responder preguntas” a “completar tareas”.
Esta es una línea divisoria muy importante hoy.
IX. Entonces, ¿hasta qué punto ha llegado realmente la IA mainstream hoy?
Si dibujas la industria de la IA de 2026 como un mapa, más o menos se puede dividir en las siguientes rutas.
Ruta de IA
Capacidad central actual
Representa a los jugadores
Siguiente paso
LLM
Lenguaje, conocimiento, razonamiento
OpenAI, Anthropic, Google
Mejor razonamiento, Agente
Multimodal
Texto + imagen + audio + video
OpenAI, Google, Meta, Mistral
Representación unificada del mundo
Agente de IA
Ejecutar tareas automáticamente
OpenAI, Anthropic, Google
Acción autónoma de ciclo largo
Coding Agent
Escribir código, cambiar código, desplegar
OpenAI, Anthropic, Google, etc.
Automatización de ingeniería de software
Video World
Generación y comprensión de video
Google, OpenAI, etc.
Simulación del mundo
Modelo del mundo
Comprender espacio, tiempo y causalidad
World Labs, Google, Meta, NVIDIA
Simular el mundo real
Robotics / Physical AI
Controlar el robot
Google, NVIDIA, etc.
Entrar en el mundo real
Inteligencia espacial
Comprensión del espacio 3D
World Labs, etc.
La máquina entiende de verdad el espacio
Edge AI
Ejecutar localmente
Apple, Google, Qualcomm, NVIDIA, etc.
La IA entra en el terminal
Así que hoy en realidad no es:
“La IA ya entró en la era del modelo del mundo, y el gran modelo terminó.”
Más exactamente:
El LLM sigue siendo un núcleo importante de la IA de hoy, pero se está convirtiendo en un componente dentro de sistemas de IA más grandes.
Estas dos frases son muy diferentes.
X. OpenAI: pasar de “modelo de lenguaje” a “Agente general”
La ruta actual de OpenAI se puede entender de forma simple como:
LLM → Reasoning → Multimodal → Agente → Computer Use → Inteligencia general
O sea:
Hacer que la IA no solo pueda responder:
“¿Cómo se hace?”
Sino directamente:
“Lo hago por ti.”
Así es como se agentifica.
En el futuro, un solo sistema de IA quizá no sea “te doy un fragmento de código”, sino:
Entender las necesidades
Buscar información
Escribir código
Ejecutar el código
Encontrar bugs
Modificar
Probar
Desplegar
Informar los resultados
Así que el enfoque de OpenAI ahora se parece cada vez menos a un “chatbot” en el sentido tradicional.
Más bien:
El trabajador general en el mundo digital.
La última arquitectura de modelos de OpenAI ya cubre simultáneamente razonamiento, uso de computadoras, navegación, ingeniería de software, voz en tiempo real y generación de imágenes, entre otras direcciones.
XI. Anthropic: convertir la IA en un “agente de trabajo a largo plazo”
La ruta de Anthropic también es muy clara.
Claude está pasando de:
Asistente de chat
Hacia:
Ejecutor de tareas de horizonte largo
La evolución.
Especialmente en que:
Coding
Computer Use
Tareas de horizonte largo
Flujos de trabajo agentificados
Trabajo del conocimiento en empresas
La inversión en eso.
La última serie de Claude 5.5 ya enfatiza claramente la codificación agentificada y la capacidad de trabajo de ciclo largo.
Si la IA temprana era:
“Me preguntas y te respondo.”
Ahora se parece cada vez más a:
“Me das un proyecto y yo lo termino.”
XII. Google DeepMind: quizá sea la ruta más completa
La ruta de Google es muy interesante.
Porque Google tiene al mismo tiempo:
Gemini
Búsqueda
YouTube
Android
Waymo
DeepMind
TPU
Investigación en robótica
Investigación de modelo del mundo
Así que Google no limitó la IA a un chatbot.
Actualmente, Google DeepMind ya ha definido claramente sus direcciones de investigación en:
Foundation Models
↓
Multimodal AI
↓
Agentes
↓
World Models
↓
Robotics / Physical AI
En el sistema de modelos más reciente de Google ya aparecen claramente Genie 3 World Model y Gemini Robotics 2.
Gemini Robotics 2 va aún más lejos: conecta la visión, el lenguaje, el razonamiento espacial y las acciones del robot:
Ver objetos → Comprender el entorno → Definir un plan → Controlar el robot.
Esto ya no es un chatbot en el sentido tradicional.
XIII. Meta: V-JEPA representa otra ruta del modelo del mundo
La dirección de investigación de Meta vale mucho la pena prestar atención.
Lo que hace V-JEPA 2 no es simplemente dejar que la IA genere videos bonitos.
Sino que:
Hacer que la IA aprenda cómo cambia el mundo a partir del video.
Por ejemplo:
Una taza cae.
La IA no solo debería saber:
“Esto es una taza.”
Lo que deberíamos predecir es:
“¿Hacia dónde caerá después?”
Esta es:
Predicción del mundo
Meta posicionó V-JEPA 2 como un modelo del mundo de auto-supervisión; puede comprender y predecir cambios en el entorno, y usarse aún más para el control de robots.
En realidad esto se parece mucho a la dirección que dijo Li Fei-Fei.
XIV. NVIDIA: apuesta directamente por Physical AI
Si OpenAI está investigando:
Inteligencia en el mundo digital.
Entonces NVIDIA claramente está apostando por:
La inteligencia en el mundo físico.
NVIDIA Cosmos es un caso típico.
Cosmos 3 ya se ha identificado como un modelo base abierto de Physical AI, que cubre:
Vision Reasoning
Generación del mundo
Predicción de acciones
Simulación del mundo
Datos sintéticos
Robotics
Esto significa que el entrenamiento de robots en el futuro quizá no sea:
Hacer que los robots caigan realmente 1 millón de veces.
Sino que:
Caer un millón de veces en un mundo virtual generado por IA.
Y luego transferir las estrategias aprendidas al mundo real.
Esto reducirá enormemente el costo de entrenamiento de robots.
XV. World Labs: ¿en qué estaba apostando de verdad Li Fei-Fei?
Mirando hacia atrás ahora, se entiende por qué la acción de Li Fei-Fei merece tanta atención.
La ruta de World Labs no es:
Reconstruir otro ChatGPT.
No es:
Obtener inteligencia espacial para la IA.
El Atlas más reciente de World Labs es un ejemplo muy representativo.
No es un simple generador de video.
Atlas puede manejar:
Texto + imagen + video + 3D + posición de la cámara + profundidad
Y poner toda esa información en un único espacio de contexto.
Puede:
Reconstruir un mundo 3D a partir de imágenes
Generar nuevas perspectivas
Comprender relaciones espaciales
Simular espacio y tiempo
Generar entornos utilizables para entrenar robots
Esto es:
World Model
Modelo del mundo.
XVI. ¿Por qué “World Model” podría ser el siguiente destino de la IA?
Porque los LLM tienen una limitación natural.
Su dato más familiar es:
Token.
Por ejemplo:
Hay una taza sobre la mesa.
El modelo puede entender esta frase.
Pero el problema del mundo real es:
¿Cuántos centímetros hay desde la taza hasta el borde de la mesa?
¿Cuánto pesa la taza?
¿Desde qué ángulo se estira la mano?
Después de que la mano toca la taza, ¿se volcará?
Si la mesa se golpea, ¿qué le pasa a la taza?
Estos problemas no son solo problemas de lenguaje puro.
Son:
Espacio + tiempo + física + causalidad + acción
Problema.
Así que:
Lo que comprende el modelo de lenguaje es el “mundo descrito por los humanos”.
Y el modelo del mundo intenta comprender:
“Cómo funciona el mundo en sí.”
Esa es la diferencia central entre ambas.
XVII. Por eso Fei-Fei Li dice:
“The world is not made of words.”
Esta frase en realidad merece entenderse una y otra vez.
Porque en los últimos años cometimos un error fácil de entender:
Hacemos que:
IA = LLM
Pero en realidad:
El LLM es solo un contenedor de la inteligencia.
La inteligencia humana no es solo lenguaje.
Cuando los humanos empiezan a aprender desde pequeños:
No empezar leyendo 10 mil millones de tokens.
Sino que:
Mira.
Escucha.
Tocar.
Mover.
Caer.
Observar a los demás.
Predecir el resultado.
Seguir probando y equivocándose.
Finalmente se forma un modelo interno del mundo.
XVIII. Entonces la siguiente etapa de la IA podría ser la “era de los cinco sentidos”
Si descomponemos aún más el futuro de la IA, más o menos se convertiría en:
Capa uno: Language
Comprender el lenguaje.
↓
Capa dos: Vision
Comprender imágenes.
↓
Capa tres: Audio
Comprender los sonidos.
↓
Capa cuatro: Video
Comprender cambios continuos en el mundo.
↓
Capa cinco: 3D / Espacial
Comprensión del espacio.
↓
Capa seis: World Model
Entender cómo funciona el mundo.
↓
Capa siete: Action
Tomar acción.
↓
Capa ocho: Physical AI
Ejecutar acciones en el mundo real.
En ese momento, la IA por fin salió de:
“El cerebro”
Empieza a convertirse en:
“Cerebro + ojos + oídos + manos + cuerpo”.
XIX. Entonces, lo que realmente vale la pena mirar en el futuro no es “quién tiene más parámetros en su gran modelo”
Este es un punto que yo creo que vale mucho la pena ampliar en este artículo.
En el pasado, la competencia de IA era:
Cantidad de parámetros.
Luego:
Benchmark.
Luego:
Capacidad de razonamiento.
Ahora:
Agente.
Siguiente paso:
Modelo del mundo + Physical AI.
Entonces la cadena de la industria de la IA cambiará.
Lo más central en el pasado era:
Datos → GPU → Gran modelo → Chatbot
El futuro podría volverse:
Datos → Modelo base → Modelo del mundo → Simulación → Agente → Robot → Mundo real
Esto también explica por qué las empresas de chips empiezan a acercarse frenéticamente a la capa del modelo.
Porque:
El mejor chip en el futuro no necesariamente es solo el que ejecuta los grandes modelos de hoy; podría decidir qué puede comprender, qué puede simular y qué puede hacer la IA de la siguiente generación.
XX. Y por eso AMD tiene que gastar 8.200 millones de dólares para comprar World Labs
Esta transacción vale más la pena mirar, en realidad no es 82 mil millones de dólares en sí.
En vez de eso, cambia la posición en la cadena industrial.
World Labs declaró oficialmente que en el pasado ya había iniciado una colaboración profunda con AMD, incluyendo el entrenamiento de modelos y la optimización del procesamiento de inferencia en GPUs de AMD.
Ahora ambas partes se fusionan directamente.
Li Fei-Fei se convertirá en vicepresidenta ejecutiva de AMD y científica jefe; el equipo de World Labs seguirá a cargo de las investigaciones de modelos relacionadas. La transacción se espera completar a finales de 2026 y aún requiere aprobación regulatoria.
La lógica que AMD ofrece por sí misma también es directa:
A medida que la IA entra en:
Razonamiento, robots, simulación, Physical AI
La demanda de cómputo cambiará.
Por lo tanto, las empresas de chips deben comprender más a fondo:
Cómo será realmente el modelo del futuro.
Esta frase es en realidad más importante que 8.200 millones de dólares.
XXI. Entonces, la verdadera ruta de evolución de la IA se puede condensar en esta imagen
1950s
Reglas de IA
│
│ Hacer que la máquina ejecute las reglas escritas por el humano
▼
2012
Deep learning
│
│ Hacer que las máquinas aprendan desde los datos
▼
2016
Aprendizaje por refuerzo
│
│ Hacer que la máquina forme estrategias mediante ensayo y error
▼
2017
Transformer
│
│ Hacer posible los modelos a gran escala
▼
2020
GPT-3
│
│ Empiezan a aparecer capacidades generales en los modelos base
▼
2021-2022
Generative AI
│
│ Texto → Imagen → Audio → Video
▼
2022-2024
LLM
│
│ La IA se convierte en un asistente general de conocimiento
▼
2024-2026
Razonamiento
│
│ La IA empieza a “pensar”
▼
2025-2026
Agente de IA
│
│ La IA empieza a “hacer cosas”
▼
Se está acelerando
Modelo del mundo
│
│ La IA empieza a comprender espacio, tiempo y causalidad
▼
Siguiente etapa
Physical AI
│
│ La IA empieza a controlar robots
▼
Un futuro más lejano
Inteligencia encarnada
│
│ La IA entra de verdad en el mundo real
XXII. Y la IA de 2026, en realidad, está en un “punto de cruce”
Este es el lugar más fácil de pasar por alto.
Hoy no es el fin de la era de LLM.
Justo lo contrario.
Es muy probable que el futuro no sea:
Los LLM son reemplazados por el modelo del mundo.
En vez de eso:
El LLM se convierte en parte del modelo del mundo.
Un sistema futuro de IA realmente poderoso probablemente tenga simultáneamente:
Modelos de lenguaje
Encargarse de comprender la intención humana.
Modelo de visión
Encargado de observar.
Modelo del mundo
Encargado de predecir el entorno.
Modelos de razonamiento
Encargado de definir planes.
Agente
Encargarse de llamar a herramientas.
Modelo de robots
Encargado de ejecutar acciones.
Un chip
Encargado de ejecutar todo eso en tiempo real.
Finalmente se forma:
Percepción → Razonamiento → Simulación → Planificación → Acción
O sea:
Percepción → Pensar → Simular → Planificar → Actuar.
XXIII. Entonces, la siguiente etapa de la IA quizá no sea “un modelo más grande”
Sino que:
Una inteligencia más completa.
Antes siempre preguntábamos:
“¿Cuántos parámetros tiene este modelo?”
En el futuro quizá sea cada vez más apropiado preguntar:
“¿Cuánto mundo entiende realmente esta IA?”
Antes comparábamos:
¿Quién tiene mejores respuestas?
En el futuro quizá se compare:
¿Quién puede completar realmente una tarea compleja?
Antes, la IA existía en:
Dentro de la ventana de ChatGPT.
En el futuro, la IA podría existir en:
En autos, robots, fábricas, hospitales, juegos, edificios, drones, dispositivos de computación espacial y todo el mundo físico.
Por último, resume en una frase la evolución de la IA durante estos 70 años
Al principio, la IA aprendía reglas humanas; luego aprendía la visión humana; después aprendía el lenguaje humano; ahora empieza a aprender el razonamiento humano; y en la siguiente etapa, lo que realmente necesita aprender es el mundo del que depende la humanidad para vivir.
Así que lo que Li Fei-Fei merece realmente la pena observar en esta ocasión no es que haya ido a AMD.
Sino:
Una científica que lleva más de 20 años “haciendo que las máquinas vean”, ahora está cambiando el objetivo de “ver” hacia “comprender el espacio, comprender el mundo, comprender la realidad”.
Y se puede ver una tendencia industrial muy clara en todo esto: de Google Genie 3, Gemini Robotics a Meta V-JEPA 2, y luego a NVIDIA Cosmos y World Labs Atlas:
El campo de batalla de la IA se está expandiendo de “información digital” a “mundo real”.
Esta podría ser la línea principal de IA más digna de atención en los próximos años.
El gran modelo resuelve “si la IA puede hablar”; el agente resuelve “si la IA puede hacer”; y el modelo del mundo, quizá es “si la IA realmente entiende este mundo”.
