昨晚美股科技板块回暖,英伟达结束七连跌收涨超2%,Lumentum、Coherent分别涨超6%和4%,美光、海力士均涨约2.5%。核心催化是OpenAI公布其首款自研推理芯片Jalapeno(火爆辣椒)的性能测试,在多个指标上超越英伟达GB300。该芯片由OpenAI与博通联合开发,采用N3P工艺并搭载HBM4内存(容量高达216 GiB),带宽达15.4TB/s,核心定位专攻推理。市场此前以为它只是为GPT模型定制的私有芯片,但它实际是一颗高度通用、架构完全开放的推理芯片。此次以自家较小的开源模型GPT-OSS 120B及DeepSeek、Kimi等第三方模型主要与GB300对比,结果显示其在单位功耗处理AI工作量和响应速度两项指标上具备优势。
测试结果凸显出从训练到推理的规则之变。过去芯片看重绝对峰值算力(FLOPS),这是训练阶段的重点、也是英伟达的主场;但OpenAI面临的现实是,数据中心瓶颈不是买不到芯片,而是没有足够的电,建变电站、拉电网、搞冷却需要数年,因此最核心的经济指标是每兆瓦电能能吐出多少Token。Jalapeno正抓住这一痛点:单颗芯片额定功耗仅700W(高负载测试甚至低于550W),而英伟达同级芯片动辄900W乃至上千瓦;峰值吞吐量下,其每瓦处理任务量是GB200/GB300的1.5至1.9倍,使OpenAI能在同等机房和电力预算下并发服务更多用户、降低单次查询成本。需要注意的是,它并未与最新一代Vera Rubin对比。
架构上,Jalapeno采用软硬一体协同设计,直接在芯片内部署高带宽HBM4并让计算核心优先访问本地内存,避免数据跨芯片搬运带来的高延迟与功耗;且未采用当前流行的Prefill/Decode分离架构,而是打通全部算力、靠软件动态调度,以应对真实业务流量波动。在测试Kimi K2.5时,其峰值每瓦性能提升约1.5倍、端到端延迟降低3.4倍。OpenAI从设计到流片仅用9个月,关键在于用AI造芯片、再让AI写驱动代码:在部分复杂注意力机制和MoE模块中,AI自动生成的代码比专家手写还快1.5倍以上,团队在没有现成内核的情况下不到两周便完成第三方模型的高水平优化,证明在极致AI能力面前,英伟达的CUDA生态壁垒并非牢不可破。
客观来看,短期内英伟达并不会受到挑战:OpenAI芯片负责人明确表示短期内不会放弃现有供应商,并称"英伟达仍是非常好的合作伙伴"。对英伟达而言,推理定价权面临松动,但训练壁垒依然稳固,且以Jalapeno对比GB300并不完全公平,真正的对手应是同样采用HBM4的下一代Rubin。不过,作为英伟达最大客户之一,OpenAI拥有自研推理芯片,意味着未来算力采购谈判中议价权更强。对AMD而言,压力不仅来自峰值算力,更来自软件生态与模型适配的迭代速度。产业趋势愈发清晰:当软件算法发展到一定体量,AI企业会向下整合硬件以寻求最优单位经济效益,谷歌(TPU)、亚马逊(Inferentia)、初创企业乃至如今亲自下场的OpenAI,都在从成本、能效、特定场景等维度向英伟达发起挑战,而上游代工与互连"卖水人"的确定性依然很高。