Những ngày này, Hội nghị Hot Chips 2026—được xem là phong vũ biểu của ngành bán dẫn—đã diễn ra. NVIDIA, Micron, SK hynix và nhiều nhà sản xuất cốt lõi khác đã có các bài diễn thuyết kỹ thuật, tập trung vào bước tiến thế hệ tiếp theo của hạ tầng cơ sở cho năng lực tính toán AI. Trong vài năm qua, các bên vẫn đang cạnh tranh mật độ transistor và hiệu năng tính toán đỉnh cao. Tuy nhiên, hội nghị lần này cho thấy các nút thắt chính của năng lực tính toán AI đã chuyển từ lõi tính toán sang hiệu suất vận chuyển dữ liệu và kiến trúc hệ thống của bộ nhớ. Bộ nhớ trong đang thay đổi từ việc chỉ là “bộ chứa dữ liệu” đơn thuần thành một thành phần của cả hệ thống. HBM là “động cơ” cốt lõi của chu kỳ siêu bộ nhớ lần này, nhưng cũng đang phải đối mặt với các ràng buộc về mặt vật lý. Micron cho biết, trong cùng một dung lượng, kích thước wafer của HBM3E vào khoảng gấp 3 lần so với DDR5 truyền thống, do các đường truyền dữ liệu song song quy mô lớn, TSV và mạng lưới cấp nguồn. Ở các gói GPU điển hình, chip nhớ chiếm khoảng 90% diện tích wafer ở cấp độ đóng gói hệ thống. Việc HBM tiêu tốn công suất sản xuất wafer ở mức rất lớn khiến ngành khó có thể nhanh chóng ứng phó với các cú sốc về nhu cầu, dẫn đến giá bán cao, khiến hệ thống AI ngoài “bức tường” hiệu năng ở khâu di chuyển dữ liệu còn thêm một “bức tường” chi phí. SK hynix cũng nhấn mạnh rằng, khi HBM tiến tới 16 lớp, thậm chí 20 lớp, vấn đề tản nhiệt và đóng gói đang tiến gần giới hạn vật lý; việc chuyển tiếp sang liên kết lai (hybrid bonding) là xu hướng tất yếu.
Trước những nút thắt, các nhà sản xuất bộ nhớ bắt đầu mở rộng sang hướng tính toán logic. Samsung đưa ra lộ trình ba giai đoạn rõ ràng, nhằm biến đế HBM (HBM base die) thành một nền tảng AI mang tính thông minh. Giai đoạn 1: HBM tùy biến (cHBM). Chuyển bộ điều khiển bộ nhớ sang chế tạo trên đế HBM bằng quy trình logic tiên tiến, dùng giao diện chuyên dụng giữa chip với nhau (D2D) thay cho truyền thống HBM PHY. Giải pháp này có thể thu hồi 5% đến 10% diện tích silicon cho XPU, từ đó chuyển hóa thành mức tăng hiệu năng hệ thống từ 10% đến 20%. Giai đoạn 2: HBM tiên tiến (AHBM). Tích hợp các đơn vị xử lý trong vùng nhàn rỗi trên đế; dỡ tải cơ chế chú ý (attention) vốn tốn băng thông cực lớn trong suy luận mô hình lớn sang thực thi gần bộ nhớ. Giai đoạn 3: xếp chồng HBM 3D (zHBM). Bỏ lớp trung gian 2.5D, xếp chồng HBM theo chiều dọc trực tiếp phía trên XPU. Theo dữ liệu của Samsung, so với chuẩn HBM4E, công suất tiêu thụ I/O của zHBM chỉ khoảng 0,5 pJ/bit, khiến tổng công suất DRAM giảm khoảng 70%, băng thông tăng hơn 2,3 lần. Với một mô-đun đơn lẻ, có thể tiết kiệm tới 100W, nhường khoảng 8,3% “dư địa” công suất cho bộ tăng tốc. Để hiện thực nó cần liên kết đồng (liên kết đồng lai) từ wafer tới wafer và yêu cầu khoảng cách giữa các mối nối hỗn hợp đồng nhỏ hơn 6 micron; đồng thời đòi hỏi DRAM và logic SoC phải được thiết kế phối hợp sâu ngay từ đầu.
Ở giai đoạn suy luận, nhu cầu về dung lượng tăng vọt đã thúc đẩy xu hướng phân tầng lưu trữ. Trước bối cảnh ngữ cảnh dài và lượng lớn bộ nhớ đệm KV, việc chỉ dựa vào chi phí HBM là không thể chịu nổi. Ngành đã đưa ra bộ nhớ flash băng thông cao (HBF) với dung lượng lớn, cao gấp hàng chục lần HBM. Mặc dù băng thông trên mỗi GB chỉ bằng 1/25 so với HBM, trong các kịch bản như một máy có thể tải các mô hình quy mô hàng nghìn tỷ tham số, xử lý theo lô nhỏ hoặc chú ý thưa, HBF vẫn thể hiện tính kinh tế vượt trội như một tầng bộ nhớ thứ cấp dung lượng cao. Nhu cầu của AI đối với ổ cứng cơ học khiến nguồn cung bị thiếu hụt; các trung tâm dữ liệu quy mô siêu lớn bắt đầu triển khai rộng rãi SSD QLC chi phí thấp giữa SSD TLC và HDD. Điều này không chỉ nâng hiệu năng hệ thống mà còn kéo theo việc tiêu thụ NAND tăng lên.
Đối với thị trường, tín hiệu từ Hot Chips không phải là những thông tin ngắn hạn chỉ trong vài quý, mà là định hướng cho xu thế chiến lược 3-5 năm tới. Có thể quan sát giá trị dài hạn của chuỗi công nghiệp từ ba góc độ. Thứ nhất, nhà sản xuất bộ nhớ: khi HBM hướng tới tùy biến và thậm chí tích hợp dọc với chip tính toán (zHBM), Samsung và SK hynix đang chuyển từ vai trò “bán nước” đơn thuần sang trở thành người đồng thiết kế các nền tảng tính toán thông minh. Họ đi sâu vào việc định nghĩa kiến trúc cho các bộ tăng tốc thế hệ tiếp theo, từ đó đạt khả năng định giá cao hơn và tính không thể thay thế. Thứ hai, đóng gói tiên tiến và vật liệu cho thiết bị cốt lõi: sự phát triển từ micro-bump sang liên kết lai (hybrid bonding), từ 2.5D sang xếp chồng dạng 3D trong kiến trúc xếp lớp WoW sẽ mang lại sự gia tăng lớn về chi tiêu vốn. Điều này tạo không gian cho các thiết bị khắc TSV ở thượng nguồn, máy liên kết lai, thiết bị kiểm thử và vật liệu giao diện nhiệt hiệu năng cao. Các nhà cung cấp thiết bị/vật liệu trong nước có thể được kiểm chứng đồng thời sẽ được hưởng “premium” do tính khan hiếm. Thứ ba, phần cứng AI đa dụng: tương lai sẽ không có một loại phần cứng AI “một kích cỡ cho tất cả”. Ở phía huấn luyện, có xu hướng dựa vào zHBM tập trung vào băng thông cao và tích hợp mật độ cao. Ở phía suy luận, sẽ hình thành hệ thống phân tầng dị cấu trúc chủ yếu dựa trên HBF, LPDDR dung lượng cao và SSD QLC cấp doanh nghiệp. Trong kỷ nguyên tích hợp sâu “tính toán gần bộ nhớ” (compute-in-memory), càng đến gần dữ liệu thì giá trị thương mại tạo ra càng lớn.