一、第一阶段:让机器“看见”——规则时代 → 感知时代
AI 的故事其实很早就开始了。
1956年达特茅斯会议通常被视为现代人工智能作为独立研究领域的重要起点。当时的 AI 更多依赖人工制定规则,希望把人的逻辑直接写进机器。
这个时代的核心问题是:
“我能不能告诉机器应该怎么做?”
比如:
如果 A,那么 B;
如果看到某个特征,就判断成某个物体;
如果满足某些条件,就执行某个动作。
问题也非常明显:
现实世界太复杂了。
人可以轻松判断:
“这是一只猫。”
但你很难把“猫是什么”写成几十万条规则。
于是 AI 开始从:
让机器执行人写好的规则
转向:
让机器自己从数据里面学习规律。
这就是机器学习和后来深度学习崛起的根本原因。
二、2012:AI第一次真正“看懂世界”
2012年的 ImageNet 是一个非常重要的转折点。
AlexNet 使用深度卷积神经网络,在大规模图像识别任务上取得突破,让整个行业重新认识到:
只要数据足够多、算力足够强、神经网络足够大,机器可以自己学习复杂的视觉规律。
这之后,AI进入深度学习时代。
于是出现了一大批今天我们已经习以为常的能力:
图片分类
人脸识别
OCR
自动驾驶视觉
医学影像识别
视频理解
推荐系统
这个阶段的 AI,最擅长的一件事是:
识别。
给它一张照片,它告诉你:
“这是猫。”
给它一段语音,它告诉你:
“这是你说的话。”
给它一张X光片,它判断:
“这里存在异常。”
但它仍然没有真正理解这个世界。
它只是越来越擅长从输入中提取模式。
三、2016:AlphaGo告诉世界,AI不仅能识别,还能“思考”
2016年 AlphaGo 战胜李世石,是 AI 历史上的另外一个巨大节点。
AlphaGo并不是简单地把棋谱背下来。
它把:
深度神经网络 + 搜索 + 强化学习
结合起来。
它既学习人类棋谱,又通过自我对弈不断学习。最终在围棋这个巨大搜索空间中形成了超越人类顶尖棋手的策略。
这件事情的重要性在于:
AI第一次大规模向大众展示:
机器不仅可以识别模式,还可以通过训练、搜索、反馈和试错形成策略。
于是 AI 的能力开始从:
Perception 感知
向:
Decision 决策
发展。
这为后来强化学习、推理模型、AI Agent埋下了种子。
四、2017:Transformer改变整个AI产业
如果说2012年是深度学习时代的爆发,那么2017年就是今天大模型时代真正的技术地基。
这一年,Google团队发表论文:
《Attention Is All You Need》
提出 Transformer。
它最大的改变,是把“Attention”放在模型核心,并且非常适合大规模并行训练。
后来几乎整个生成式 AI 世界都建立在这条技术路线上:
Transformer → GPT → LLM → 多模态模型 → Agent → 世界模型
所以今天我们看到的 ChatGPT、Claude、Gemini,并不是突然出现的。
它们实际上是过去几十年:
数据 + 神经网络 + GPU + Transformer + Scaling
共同积累的结果。
五、2020:GPT-3证明了一件非常重要的事情
2020年,OpenAI推出 GPT-3。
1750亿参数。
它的重要性并不仅仅是“大”。
真正重要的是:
模型规模扩大之后,出现了越来越强的“涌现式”通用能力。
GPT-3已经能够通过少量示例完成不同任务,而不需要针对每个任务重新训练模型。
这改变了AI产业的研究路线。
以前大家想的是:
一个任务训练一个模型。
后来逐渐变成:
训练一个足够大的基础模型,然后让它适应大量任务。
于是出现一个非常重要的概念:
Foundation Model
基础模型。
这也是过去几年 AI 爆发的核心。
六、2021—2022:AI从“理解文字”开始进入“生成世界”
这一阶段非常重要,因为 AI 开始突破纯文本。
OpenAI的 DALL·E 已经可以根据文字生成图像。
随后:
Stable Diffusion
Midjourney
DALL·E
Imagen
Sora
Veo
不断把 AI 的生成能力从:
文字 → 图片 → 视频 → 音频 → 3D
往外扩张。
于是 AI 开始出现一个非常明显的变化:
以前是:
AI理解人类创造的内容。
现在变成:
AI自己创造内容。
这就是 Generative AI。
七、2022年底:ChatGPT把AI带入大众时代
2022年之后,AI真正进入普通人的生活。
ChatGPT最大的突破,并不是第一次出现语言模型。
而是把大量复杂的 AI 能力包装成:
一个普通人可以直接对话的接口。
从这一刻开始:
AI第一次真正成为大众生产力工具。
写文章、写代码、翻译、总结、分析、搜索、学习……
所有东西都开始围绕:
“你告诉AI你想做什么。”
展开。
于是过去几年整个 AI 行业几乎都在围绕一个问题竞争:
谁的大模型更强?
八、2023—2025:AI开始从“聊天”进化到“推理”
这其实是现在理解 AI 最关键的一步。
早期大模型更像:
超级语言预测器。
你给它一句话,它预测下一句话。
但后来研究开始越来越重视:
Chain of Thought
Reinforcement Learning
Test-time Compute
Reasoning
Tool Use
Planning
Long-horizon tasks
也就是说:
AI开始不满足于:
“给你一个答案。”
而开始尝试:
“让我先想一想,再完成这个任务。”
这就是 Reasoning Model。
到了2026年,OpenAI、Anthropic、Google等前沿实验室的竞争重点已经明显从单纯的聊天能力,转向:
复杂推理 + 编程 + 工具调用 + 长任务 + Agent。
例如OpenAI目前的GPT-6 Astra强调数学、软件工程、计算机操作、浏览器操作和专业工作等能力;OpenAI同时也在持续优化模型、推理基础设施和 Agentic Harness。
Anthropic最新的 Claude 5.5 系列也明显强调复杂工作、长周期任务和 Agentic Coding。
这意味着:
AI已经从“回答问题”进入“完成任务”。
这是今天非常重要的一条分界线。
九、所以,现在主流AI到底走到了哪一步?
如果把2026年的AI产业画成一张地图,大概可以分成下面几条路线。
AI路线
当前核心能力
代表玩家
下一步
LLM
语言、知识、推理
OpenAI、Anthropic、Google
更强推理、Agent
Multimodal
文本+图像+音频+视频
OpenAI、Google、Meta、Mistral
统一世界表示
AI Agent
自动执行任务
OpenAI、Anthropic、Google
长周期自主行动
Coding Agent
写代码、改代码、部署
OpenAI、Anthropic、Google等
软件工程自动化
Video World
视频生成、理解
Google、OpenAI等
世界模拟
World Model
理解空间、时间、因果
World Labs、Google、Meta、NVIDIA
模拟真实世界
Robotics / Physical AI
控制机器人
Google、NVIDIA等
进入现实世界
Spatial Intelligence
3D空间理解
World Labs等
机器真正理解空间
Edge AI
本地运行
Apple、Google、Qualcomm、NVIDIA等
AI进入终端
所以今天其实不是:
“AI已经进入世界模型时代,大模型结束了。”
更准确的说法是:
LLM仍然是今天AI的重要核心,但它正在成为更大AI系统中的一个组件。
这两句话差别非常大。
十、OpenAI:从“语言模型”向“通用Agent”走
OpenAI目前的路线可以简单理解成:
LLM → Reasoning → Multimodal → Agent → Computer Use → General Intelligence
也就是:
让AI不仅能够回答:
“怎么做?”
而是直接:
“我替你做。”
这就是 Agent 化。
未来一个AI可能不是给你一段代码,而是:
理解需求
搜索资料
写代码
运行代码
找Bug
修改
测试
部署
汇报结果
所以OpenAI现在研究的重点,已经越来越不像传统意义上的“聊天机器人”。
而更像:
数字世界里的通用劳动者。
OpenAI最新模型体系已经同时覆盖推理、计算机使用、浏览、软件工程、实时语音以及图像生成等方向。
十一、Anthropic:把AI变成“长期工作的Agent”
Anthropic的路线也非常明显。
Claude正在从:
聊天助手
向:
长周期任务执行者
演化。
特别是它在:
Coding
Computer Use
Long-horizon tasks
Agentic workflows
企业知识工作
上的投入。
最新 Claude 5.5 系列已经明显强调 Agentic Coding 和长周期工作能力。
如果说早期AI是:
“你问我答。”
现在则越来越像:
“你交给我一个项目,我自己完成。”
十二、Google DeepMind:可能是最完整的一条路线
Google的路线非常有意思。
因为Google同时拥有:
Gemini
搜索
YouTube
Android
Waymo
DeepMind
TPU
机器人研究
世界模型研究
所以Google并没有把AI局限在聊天机器人。
目前Google DeepMind已经把研究方向明确分成:
Foundation Models
↓
Multimodal AI
↓
Agents
↓
World Models
↓
Robotics / Physical AI
Google最新模型体系中已经出现明确的 Genie 3 World Model,以及 Gemini Robotics 2。
Gemini Robotics 2更进一步,把视觉、语言、空间推理和机器人动作连接起来:
看见东西 → 理解环境 → 制定计划 → 控制机器人。
这已经不是传统意义上的Chatbot了。
十三、Meta:V-JEPA代表另一条世界模型路线
Meta的研究方向非常值得关注。
它在做的 V-JEPA 2,并不是简单地让AI生成漂亮视频。
而是:
让AI从视频中学习世界如何变化。
例如:
一个杯子掉下来。
AI不仅应该知道:
“这是一个杯子。”
更应该预测:
“它接下来会往哪里掉?”
这就是:
Prediction of the World
Meta把V-JEPA 2定位为一种自监督世界模型,可以理解、预测环境变化,并进一步用于机器人控制。
这其实非常接近李飞飞所说的方向。
十四、NVIDIA:直接押注 Physical AI
如果说OpenAI是在研究:
数字世界里的智能。
那么NVIDIA现在明显在押注:
物理世界里的智能。
NVIDIA Cosmos就是典型案例。
Cosmos 3已经被定位为 Physical AI 的开放基础模型,覆盖:
Vision Reasoning
World Generation
Action Prediction
World Simulation
Synthetic Data
Robotics
这意味着未来机器人训练可能不是:
让机器人真的摔100万次。
而是:
在AI生成的虚拟世界里摔100万次。
然后把学到的策略迁移到现实世界。
这会极大降低机器人训练成本。
十五、World Labs:李飞飞真正押注的是什么?
现在回过头来看,就能理解为什么李飞飞这次动作如此值得关注。
World Labs的路线不是:
再造一个ChatGPT。
而是:
让AI获得空间智能。
World Labs最新的 Atlas 就非常具有代表性。
它不是单纯的视频生成器。
Atlas可以处理:
文字 + 图片 + 视频 + 3D + 相机位置 + 深度
并把这些信息放进一个统一的空间上下文。
它可以:
从图片重建3D世界
生成新的视角
理解空间关系
模拟空间和时间
生成可用于机器人训练的环境
这就是:
World Model
世界模型。
十六、为什么“世界模型”可能是AI的下一站?
因为LLM有一个天然限制。
它最熟悉的数据是:
Token。
比如:
桌子上有一个杯子。
模型可以理解这句话。
但现实世界的问题是:
杯子距离桌子边缘还有多少厘米?
杯子的重量是多少?
手从哪个角度伸过去?
手碰到杯子之后,杯子会不会倒?
如果桌子被撞了一下,杯子会发生什么?
这些问题不是纯语言问题。
它们是:
空间 + 时间 + 物理 + 因果 + 行动
问题。
所以:
语言模型理解的是“人类描述的世界”。
而世界模型试图理解:
“世界本身是怎么运行的。”
这就是两者最核心的区别。
十七、这也是为什么李飞飞说:
“The world is not made of words.”
这句话其实非常值得反复理解。
因为过去几年我们犯了一个很容易理解的错误:
我们把:
AI = LLM
但其实:
LLM只是智能的一种载体。
人的智能本来就不只有语言。
人类从小开始学习的时候:
不是先读100亿个Token。
而是:
看。
听。
触摸。
移动。
摔倒。
观察别人。
预测结果。
不断试错。
最终形成对世界的内部模型。
十八、所以AI下一阶段可能是“五感时代”
如果把AI未来进一步拆开,大概会变成:
第一层:Language
理解语言。
↓
第二层:Vision
理解图像。
↓
第三层:Audio
理解声音。
↓
第四层:Video
理解连续的世界变化。
↓
第五层:3D / Spatial
理解空间。
↓
第六层:World Model
理解世界如何运行。
↓
第七层:Action
采取行动。
↓
第八层:Physical AI
在现实世界里执行行动。
这时候AI才真正从:
“大脑”
开始变成:
“大脑 + 眼睛 + 耳朵 + 手 + 身体”。
十九、所以未来真正值得关注的,不是“谁的大模型参数最多”
这是最值得延伸的一点。
过去AI竞争:
参数量。
后来:
Benchmark。
再后来:
推理能力。
现在:
Agent。
下一步:
World Model + Physical AI。
于是AI产业链会发生变化。
过去最核心的是:
数据 → GPU → 大模型 → Chatbot
未来可能变成:
数据 → 基础模型 → 世界模型 → 仿真 → Agent → 机器人 → 现实世界
这也解释了为什么芯片公司开始疯狂向模型层靠近。
因为:
未来最好的芯片,不一定只是跑今天的大模型,而可能决定下一代AI到底能理解什么、模拟什么、行动什么。
二十、这也是AMD为什么要花82亿美元买World Labs
这笔交易最值得看的,其实不是82亿美元本身。
而是产业链的位置变化。
World Labs官方明确表示,它过去已经和AMD展开深度技术合作,包括在AMD GPU上进行模型训练和推理优化。
现在双方直接合并。
李飞飞将成为AMD执行副总裁兼首席科学家,World Labs团队继续负责相关模型研究。交易预计在2026年底完成,仍需监管审批。
AMD自己给出的逻辑也很直接:
随着AI进入:
推理、机器人、仿真、Physical AI
计算需求会发生变化。
因此芯片公司必须更深入理解:
未来的模型到底长什么样。
这句话其实比82亿美元更重要。
二十一、所以,AI真正的进化路线,可以浓缩成这张图
1950s
规则 AI
│
│ 让机器执行人写好的规则
▼
2012
深度学习
│
│ 让机器从数据中学习
▼
2016
强化学习
│
│ 让机器通过试错形成策略
▼
2017
Transformer
│
│ 让大规模模型成为可能
▼
2020
GPT-3
│
│ 基础模型开始出现通用能力
▼
2021-2022
Generative AI
│
│ 文字 → 图片 → 音频 → 视频
▼
2022-2024
LLM
│
│ AI成为通用知识助手
▼
2024-2026
Reasoning
│
│ AI开始“思考”
▼
2025-2026
AI Agent
│
│ AI开始“做事”
▼
正在加速
World Model
│
│ AI开始理解空间、时间、因果
▼
下一阶段
Physical AI
│
│ AI开始控制机器人
▼
更远未来
Embodied Intelligence
│
│ AI真正进入现实世界
二十二、而2026年的AI,实际上正处在一个“交叉点”
这是最容易被忽略的地方。
今天并不是LLM时代结束了。
恰恰相反。
未来很可能不是:
LLM被World Model取代。
而是:
LLM成为World Model的一部分。
一个真正强大的未来AI系统,很可能同时拥有:
语言模型
负责理解人类意图。
视觉模型
负责观察。
世界模型
负责预测环境。
推理模型
负责制定计划。
Agent
负责调用工具。
机器人模型
负责执行动作。
芯片
负责把这一切实时运行起来。
最终形成:
Perception → Reasoning → Simulation → Planning → Action
也就是:
感知 → 思考 → 模拟 → 规划 → 行动。
二十三、所以AI下一站,可能不是“更大的模型”
而是:
更完整的智能。
过去我们一直问:
“这个模型有多少参数?”
未来可能越来越应该问:
“这个AI理解了多少世界?”
过去我们比较:
谁的回答更好?
未来可能比较:
谁能把一个复杂任务真正完成?
过去AI存在于:
ChatGPT窗口里。
未来AI可能存在于:
汽车、机器人、工厂、医院、游戏、建筑、无人机、空间计算设备和整个物理世界里。
最后,用一句话总结这70年的AI进化
AI最开始是在学习人类的规则;后来学习人类的视觉;再后来学习人类的语言;现在开始学习人类的推理;而下一阶段,它真正要学习的,是人类赖以生存的那个世界。
所以李飞飞这次真正值得关注的,并不是她去了AMD。
而是:
一个做了20多年“让机器看见”的科学家,现在开始把目标从“看见”推向“理解空间、理解世界、理解现实”。
而从 Google 的 Genie 3、Gemini Robotics,到 Meta 的 V-JEPA 2,再到 NVIDIA Cosmos 和 World Labs Atlas,可以看到一个非常明显的产业趋势:
AI的战场正在从“数字信息”向“现实世界”扩张。
这可能才是未来几年 AI 最值得关注的一条主线。
大模型解决的是“AI会不会说”;Agent解决的是“AI会不会做”;世界模型解决的,则可能是“AI到底懂不懂这个世界”。
