这两天,被誉为半导体行业风向标的Hot Chips 2026大会召开,英伟达、美光、海力士等核心厂商发表技术演讲,聚焦AI算力基础设施的下一代演进。过去几年各家还在比拼晶体管密度与峰值算力,今年大会表明,AI算力的主要瓶颈已从计算核心转移到数据搬运效率和存储系统架构,内存正从单纯的数据容器转变为系统组件。HBM是这一轮存储超级周期的核心引擎,但同样面临物理约束。美光披露,同等容量下HBM3E的硅片尺寸约为传统DDR5的3倍,因其庞大的并行数据通路、TSV及供电网络所致,在典型GPU封装中内存芯片占系统级封装硅面积约90%;HBM对晶圆产能的巨大消耗使行业难以迅速应对需求冲击,催生高昂定价,令AI系统在数据移动的性能墙之外再添成本墙。海力士还指出,随着HBM向16层乃至20层推进,散热与封装逼近物理极限,向混合键合过渡已是必然趋势。

面对瓶颈,存储原厂开始向逻辑计算延伸。三星提出清晰的三阶段路线,试图将HBM基片打造为智能化AI平台。第一阶段定制HBM(cHBM),将内存控制器转移到先进逻辑工艺制造的HBM基片上,以芯粒间(D2D)专用接口替代传统HBM PHY,可为XPU回收5%到10%的硅面积,转化为10%到20%的系统性能提升。第二阶段先进HBM(AHBM),在基片闲置区域集成处理单元,将大模型推理中极耗带宽的注意力机制卸载到近存执行。第三阶段3D堆叠HBM(zHBM),抛弃2.5D中介层,将HBM垂直堆叠在XPU正上方。据三星数据,相比标准HBM4E,zHBM的I/O功耗仅约0.5 pJ/bit,使总DRAM功耗下降约70%,带宽提升超2.3倍,单个模块最高可节省100W、把约8.3%的功耗余量让渡给加速器。实现它需要晶圆对晶圆及小于6微米间距的混合铜键合,并要求DRAM与SoC逻辑从一开始深度协同设计。

在推理端,容量需求膨胀催生存储分层化趋势。面对长上下文和大量KV缓存,单纯用HBM成本难以承受,业界提出的高带宽闪存(HBF)容量是HBM的十数倍,尽管每GB带宽仅为HBM的1/25,但在单机承载万亿参数模型、低批处理或稀疏注意力等场景中,作为高容量二级内存层展现出极佳经济性。AI对机械硬盘需求的提升导致供应短缺,超大规模数据中心开始更广泛地将低成本QLC SSD部署在TLC SSD与HDD之间,既提升系统性能,也拉动NAND出货。

对市场而言,Hot Chips释放的绝非几个季度的短期信号,而是指引未来3-5年的战略趋势,可从三个维度观察产业链长期价值。第一,存储原厂:随着HBM走向定制化乃至与计算芯片垂直融合的zHBM,三星、海力士等正从单纯"卖水人"转型为智能计算平台的联合设计者,深度介入下一代加速器架构定义,从而获得更强溢价能力与不可替代性。第二,先进封装与核心设备材料:从微凸点向混合键合、从2.5D向3D WoW堆叠的演进将带来巨大资本开支增量,为上游TSV刻蚀设备、混合键合机、测试设备及高性能热界面材料提供空间,能同步验证的国内设备/材料供应商将享受稀缺溢价。第三,通用AI硬件:未来不会有一刀切的AI硬件,训练端依赖追求带宽高密度集成的zHBM,推理端衍生出以HBF、高容量LPDDR和企业级QLC SSD为主的异构分层体系;在存算一体深度融合的时代,离数据越近的环节,创造的商业价值就越大。