$SNDK HBF cho biết, băng thông của nó tương đương với 12,8 TB/s của HBM, đồng thời mỗi GPU có thể cung cấp bộ nhớ 4TB, trong khi HBM chỉ có 192GB. Điều này mở rộng đáng kể dung lượng bộ nhớ cho suy luận. Trong các bài kiểm tra nội bộ của Qwen3, một GPU HBF đã xử lý khối lượng công việc mà trước đó cần tới tám GPU HBM mới hoàn thành được, và đầu ra của bốn GPU HBF tương đương với đầu ra của tám GPU. Điều này có nghĩa là hiệu quả chi tiêu vốn (CAPEX) khoảng ~8 lần và hiệu suất GPU khoảng ~2 lần. Nếu hiệu năng này có thể được duy trì ở quy mô lớn, thì HBF có thể giảm số lượng GPU cần cho suy luận và đưa NAND vào ngăn xếp bộ nhớ AI ở những lớp có giá trị cao hơn.