Trời đất ơi, 2,3 TB bộ nhớ trên mỗi chip! Đây không phải là cụm HBM thông thường — chúng ta đang nói về một kiến trúc bộ nhớ hoàn toàn khác. Để dễ hình dung, các GPU cao cấp hiện nay có dung lượng HBM3 tối đa khoảng 192 GB. Khả năng cao đây là một trong các phương án sau:
1) Công nghệ xếp chồng HBM thế hệ tiếp theo với mức tích hợp theo chiều dọc cực cao (hãy nghĩ đến hơn 24 lớp thay vì 8–12 lớp hiện nay)
2) Kiến trúc DRAM-flash lai, đánh đổi một phần độ trễ để có dung lượng cực lớn
3) Các mô-đun bộ nhớ kết nối qua CXL, về mặt kỹ thuật được tính là "trên mỗi chip" nhưng không nằm trên đế chip
Câu hỏi thực sự là: băng thông bao nhiêu? Bạn có thể có hàng terabyte bộ nhớ, nhưng nếu bị nghẽn ở tốc độ PCIe thì cũng vô dụng khi huấn luyện các mô hình lớn. Nếu ở dung lượng 2,3 TB mà băng thông vẫn gần đạt mức hơn 3 TB/s của HBM3, thì đây sẽ là bước đột phá hoàn toàn cho việc phục vụ suy luận và các mô hình hỗn hợp chuyên gia (mixture-of-experts) cần giữ những tập tham số khổng lồ trong bộ nhớ tốc độ cao.
Điều này cuối cùng có thể giúp các mô hình có hơn 405 tỷ tham số trở nên thực sự khả thi để suy luận theo thời gian thực, mà không cần chia nhỏ mô hình trên nhiều nút. Bức tường bộ nhớ vừa cao thêm rất nhiều.
1) Công nghệ xếp chồng HBM thế hệ tiếp theo với mức tích hợp theo chiều dọc cực cao (hãy nghĩ đến hơn 24 lớp thay vì 8–12 lớp hiện nay)
2) Kiến trúc DRAM-flash lai, đánh đổi một phần độ trễ để có dung lượng cực lớn
3) Các mô-đun bộ nhớ kết nối qua CXL, về mặt kỹ thuật được tính là "trên mỗi chip" nhưng không nằm trên đế chip
Câu hỏi thực sự là: băng thông bao nhiêu? Bạn có thể có hàng terabyte bộ nhớ, nhưng nếu bị nghẽn ở tốc độ PCIe thì cũng vô dụng khi huấn luyện các mô hình lớn. Nếu ở dung lượng 2,3 TB mà băng thông vẫn gần đạt mức hơn 3 TB/s của HBM3, thì đây sẽ là bước đột phá hoàn toàn cho việc phục vụ suy luận và các mô hình hỗn hợp chuyên gia (mixture-of-experts) cần giữ những tập tham số khổng lồ trong bộ nhớ tốc độ cao.
Điều này cuối cùng có thể giúp các mô hình có hơn 405 tỷ tham số trở nên thực sự khả thi để suy luận theo thời gian thực, mà không cần chia nhỏ mô hình trên nhiều nút. Bức tường bộ nhớ vừa cao thêm rất nhiều.