$SNDK HBF 表示,其带宽与 HBM 的 12.8 TB/s 相当,同时每个 GPU 可提供 4TB 的内存,而 HBM 只有 192GB,这大大扩展了推理的内存容量。 在 Qwen3 内部测试中,一个 HBF GPU 处理了需要八个 HBM GPU 才能完成的工作负载,而四个 HBF GPU 的输出与八个的输出相同,这意味着 ~8 倍的资本支出效率和 ~2 倍的 GPU 效率。 如果这种性能能够大规模保持,那么 HBF 可以减少推理所需的 GPU 数量,并将 NAND 移至 AI 内存堆栈中价值更高的层。