SK Hynix vừa chỉ ra “nút thắt” AI thực sự — và không còn là do máy tính (compute) nữa.
Tại diễn đàn Dell, Phó chủ tịch phụ trách kiến trúc hệ thống của họ cho biết băng thông bộ nhớ hiện nay quyết định hiệu năng AI tổng thể nhiều hơn so với sức mạnh GPU thô. LLM (mô hình ngôn ngữ lớn) đã phải di chuyển các khối lượng dữ liệu rất lớn. Các tác vụ agentic (tác nhân) và cửa sổ ngữ cảnh dài hơn đang đẩy tốc độ thông lượng token từ mức vài chục token/giây lên hàng trăm hoặc thậm chí hàng nghìn.
HBM đã tăng trưởng nhanh từ Gen 1 đến HBM4, nhưng SK cho rằng như vậy là chưa đủ cho các hệ thống agentic thế hệ tiếp theo. Việc xếp chồng bộ nhớ trực tiếp lên GPU có thể mở ra băng thông cao hơn nhiều, song giới hạn nhiệt khiến hướng đi này trở nên khó khăn. Điểm “nóng” còn lại là năng lượng — phần lớn điện năng được dùng để di chuyển dữ liệu chứ không phải để tính toán. Vì thế, nghiên cứu xử lý trong bộ nhớ (processing-in-memory) vẫn tiếp tục tiến lên.
Bộ nhớ dùng chung (memory pooling) qua CXL đang được triển khai để giảm thời gian GPU nhàn rỗi và cải thiện hiệu quả chi phí. Các cải thiện về hiệu suất ở những nơi khác, bao gồm các nâng cấp mang tính thuật toán, cũng đã bị chi phối bởi nghịch lý Jevons: thay vì giảm nhu cầu bộ nhớ tổng thể, chúng lại làm tăng tổng nhu cầu bộ nhớ.
Mẫu hình rất rõ ràng. Khả năng tính toán vẫn tiếp tục tiến bộ. Hệ thống ngày càng bị “khóa” bởi tốc độ và mức độ hiệu quả mà bạn có thể cung cấp dữ liệu. Đó là ràng buộc đang định hình làn sóng chi tiêu cho hạ tầng AI tiếp theo.
Tại diễn đàn Dell, Phó chủ tịch phụ trách kiến trúc hệ thống của họ cho biết băng thông bộ nhớ hiện nay quyết định hiệu năng AI tổng thể nhiều hơn so với sức mạnh GPU thô. LLM (mô hình ngôn ngữ lớn) đã phải di chuyển các khối lượng dữ liệu rất lớn. Các tác vụ agentic (tác nhân) và cửa sổ ngữ cảnh dài hơn đang đẩy tốc độ thông lượng token từ mức vài chục token/giây lên hàng trăm hoặc thậm chí hàng nghìn.
HBM đã tăng trưởng nhanh từ Gen 1 đến HBM4, nhưng SK cho rằng như vậy là chưa đủ cho các hệ thống agentic thế hệ tiếp theo. Việc xếp chồng bộ nhớ trực tiếp lên GPU có thể mở ra băng thông cao hơn nhiều, song giới hạn nhiệt khiến hướng đi này trở nên khó khăn. Điểm “nóng” còn lại là năng lượng — phần lớn điện năng được dùng để di chuyển dữ liệu chứ không phải để tính toán. Vì thế, nghiên cứu xử lý trong bộ nhớ (processing-in-memory) vẫn tiếp tục tiến lên.
Bộ nhớ dùng chung (memory pooling) qua CXL đang được triển khai để giảm thời gian GPU nhàn rỗi và cải thiện hiệu quả chi phí. Các cải thiện về hiệu suất ở những nơi khác, bao gồm các nâng cấp mang tính thuật toán, cũng đã bị chi phối bởi nghịch lý Jevons: thay vì giảm nhu cầu bộ nhớ tổng thể, chúng lại làm tăng tổng nhu cầu bộ nhớ.
Mẫu hình rất rõ ràng. Khả năng tính toán vẫn tiếp tục tiến bộ. Hệ thống ngày càng bị “khóa” bởi tốc độ và mức độ hiệu quả mà bạn có thể cung cấp dữ liệu. Đó là ràng buộc đang định hình làn sóng chi tiêu cho hạ tầng AI tiếp theo.