$SNDK HBF 表示,其帶寬與 HBM 的 12.8 TB/s 相當,同時每個 GPU 可提供 4TB 的內存,而 HBM 只有 192GB,這大大擴展了推理的內存容量。 在 Qwen3 內部測試中,一個 HBF GPU 處理了需要八個 HBM GPU 才能完成的工作負載,而四個 HBF GPU 的輸出與八個的輸出相同,這意味着 ~8 倍的資本支出效率和 ~2 倍的 GPU 效率。 如果這種性能能夠大規模保持,那麼 HBF 可以減少推理所需的 GPU 數量,並將 NAND 移至 AI 內存堆棧中價值更高的層。