DeepSeek 的 Agent(DSH)测评数据,藏着一个硬件路线的信号。
几个关键数字:
- token 消耗量巨大,KV 缓存命中率是讨论焦点
- 同样的任务,DSH 耗时是 GPT/Claude 的 2 倍
这个"2 倍",很多人只当性能差距看,但它是硬件路线的重要线索。
Agent 时代的瓶颈是什么?
不是算力,是内存带宽。
Agent 干活 = 超长上下文 = 海量 KV 缓存反复读写。
上下文越长,KV cache 越大,读取越慢——
你的计算芯片再快,数据从内存搬不过来,全是白等。
DSH 耗时翻倍,本质是"内存墙"打脸:它在用"更慢的内存访问"换"更低的成本"。
这就解释了陈立武(英特尔)为什么坚持 CPU+DRAM 堆叠封装:
英伟达的解法是 GPU + HBM 堆叠封装(CoWoS 技术),
让计算单元贴着内存,数据搬运距离从"厘米级"缩到"微米级"——带宽暴涨。
陈立武看的是同一件事,但放在 CPU 上:
Agent 普及后,CPU 承担大量推理和调度,一样需要贴着内存跑。
Agent 的普及,会加速"CPU/GPU 1:1"时代的到来:
- 现在:数据中心 GPU 是主角,CPU 是配角
- Agent 时代:每个 GPU 旁边都要有强大的 CPU 处理调度、Agent 循环、KV 管理
- 那时 CPU 也必须要像 GPU 一样:CPU + HBM 堆叠封装
这意味着什么(投资视角):
1. 封装技术 = 下一个卡脖子环节
CoWoS、2.5D/3D 堆叠、混合键合——这些封装工艺,是 AI 硬件新的军备竞赛点
2. 内存厂商重新定价
HBM 已经卖爆了,如果 CPU 也要 HBM,DRAM 厂商的想象空间再上一层
3. 英特尔的"错位押注"可能翻盘
市场都在看英伟达,但陈立武的 CPU+DRAM 堆叠,赌的是 Agent 时代的"第二曲线"
最后一句:
Agent 的 token 账单,正在重新定义硬件——
当"读取速度"比"计算速度"更值钱的时候,贴着内存的芯片,才是赢家。
算力军备竞赛的上半场是 GPU,
下半场是封装。
#DeepSeek #DSH #封装 #HBM
几个关键数字:
- token 消耗量巨大,KV 缓存命中率是讨论焦点
- 同样的任务,DSH 耗时是 GPT/Claude 的 2 倍
这个"2 倍",很多人只当性能差距看,但它是硬件路线的重要线索。
Agent 时代的瓶颈是什么?
不是算力,是内存带宽。
Agent 干活 = 超长上下文 = 海量 KV 缓存反复读写。
上下文越长,KV cache 越大,读取越慢——
你的计算芯片再快,数据从内存搬不过来,全是白等。
DSH 耗时翻倍,本质是"内存墙"打脸:它在用"更慢的内存访问"换"更低的成本"。
这就解释了陈立武(英特尔)为什么坚持 CPU+DRAM 堆叠封装:
英伟达的解法是 GPU + HBM 堆叠封装(CoWoS 技术),
让计算单元贴着内存,数据搬运距离从"厘米级"缩到"微米级"——带宽暴涨。
陈立武看的是同一件事,但放在 CPU 上:
Agent 普及后,CPU 承担大量推理和调度,一样需要贴着内存跑。
Agent 的普及,会加速"CPU/GPU 1:1"时代的到来:
- 现在:数据中心 GPU 是主角,CPU 是配角
- Agent 时代:每个 GPU 旁边都要有强大的 CPU 处理调度、Agent 循环、KV 管理
- 那时 CPU 也必须要像 GPU 一样:CPU + HBM 堆叠封装
这意味着什么(投资视角):
1. 封装技术 = 下一个卡脖子环节
CoWoS、2.5D/3D 堆叠、混合键合——这些封装工艺,是 AI 硬件新的军备竞赛点
2. 内存厂商重新定价
HBM 已经卖爆了,如果 CPU 也要 HBM,DRAM 厂商的想象空间再上一层
3. 英特尔的"错位押注"可能翻盘
市场都在看英伟达,但陈立武的 CPU+DRAM 堆叠,赌的是 Agent 时代的"第二曲线"
最后一句:
Agent 的 token 账单,正在重新定义硬件——
当"读取速度"比"计算速度"更值钱的时候,贴着内存的芯片,才是赢家。
算力军备竞赛的上半场是 GPU,
下半场是封装。
#DeepSeek #DSH #封装 #HBM