$SNDK HBF indique que sa bande passante équivaut à celle de la HBM de 12,8 To/s, tout en offrant, pour chaque GPU, 4 To de mémoire, alors que la HBM n’en dispose que de 192 Go. Cela étend considérablement la capacité mémoire disponible pour l’inférence. Lors des tests internes de Qwen3, un GPU HBF a traité une charge de travail qui aurait nécessité huit GPU HBM. De plus, la sortie de quatre GPU HBF est identique à celle de huit, ce qui signifie ~8 fois l’efficacité des dépenses en capital et ~2 fois l’efficacité des GPU. Si ces performances peuvent être maintenues à grande échelle, le HBF pourrait réduire le nombre de GPU nécessaires à l’inférence et déplacer la NAND vers des niveaux plus précieux de la pile de mémoire pour l’IA.