Trong thời đại AI, vì sao lại nói rằng mãi mãi sẽ thiếu bộ nhớ? Thực ra, điều này vốn đã được “định sẵn” từ trong bụng mẹ. Vì “cổ chai Von Neumann”!
Nền tảng của máy tính hiện đại đều dựa trên kiến trúc Von Neumann. Điểm cốt lõi của kiến trúc này là: chương trình và dữ liệu cùng tồn tại trong một hệ thống bộ nhớ. CPU sẽ lần lượt lấy từng lệnh ra để thực thi.
Khi CPU/GPU ngày nay tính toán ngày càng nhanh hơn, việc vận chuyển dữ liệu không theo kịp tốc độ suy nghĩ của bộ não, khiến bộ não thường xuyên phải chờ dữ liệu. Điều này càng trở nên rõ ràng hơn trong thời đại AI: giữa năng lực tính toán và bộ nhớ thiếu các kênh dữ liệu đủ nhanh, nên việc di chuyển dữ liệu làm chậm quá trình tính toán. Đây chính là “cổ chai Von Neumann”.
Điều này giống như CPU/GPU là đầu bếp. Bộ nhớ giống như kho hàng. Còn bus/kết nối giống như đường vận chuyển rau. Đầu bếp ngày càng nhiều, tay nghề/công cụ càng nhanh, nhưng kho cách xa nhà bếp, còn đường vận chuyển thì hẹp. Kết quả không phải là đầu bếp không nấu được, mà là đầu bếp phải chờ nguyên liệu.
Trong máy chủ AI hiện nay, nút thắt này chủ yếu bị mắc ở bốn việc:
1:Độ trễ bộ nhớ—mất bao lâu để lấy được một lần dữ liệu.
2:Băng thông bộ nhớ—mỗi đơn vị thời gian có thể vận chuyển được bao nhiêu dữ liệu.
3:Dữ liệu có nhét vừa vào dung lượng bộ nhớ không. Nếu không nhét được thì phải chuyển sang SSD/ổ cứng chậm hơn.
4:Việc tiêu thụ năng lượng và việc di chuyển dữ liệu bản thân tốn điện rất nhiều. Nhiều lúc, chỉ cần chuyển dữ liệu một lần còn tốn kém hơn cả tính toán. Khi suy luận của mô hình lớn chạy, phải liên tục đọc: trọng số mô hình, KV cache, token đầu vào/đầu ra của activation. Nếu băng thông HBM không đủ, dù GPU có mạnh đến đâu cũng không tận dụng hết được.
Vậy làm sao giải quyết “nút thắt Von Neumann”?
Vì không thể xóa bỏ hoàn toàn, chỉ có thể giảm bớt.
1. Thêm cache cho CPU/GPU: không truy cập trực tiếp bộ nhớ mỗi lần, mà thêm nhiều tầng cache.
2. Tăng băng thông bộ nhớ. Hiện nay, hướng thiếu nhất là HBM: chất đầy bộ nhớ, đặt cạnh GPU, và kết nối bằng giao diện siêu rộng.
3. Đưa việc tính toán và bộ nhớ đến gần nhau hơn. Ví dụ: GPU + HBM, CPU + HBM, xếp chồng 3D, đóng gói tiên tiến chiplet, mở rộng bộ nhớ CXL. Bản chất là rút ngắn khoảng cách phải vận chuyển dữ liệu.
4. Giảm lượng dữ liệu. Trong AI thường dùng lượng tử hóa FP8/INT8/FP4, làm thưa (sparsity), cắt tỉa mô hình, nén KV cache, GQA/MQA/MLA, FlashAttention không phải làm “đường truyền” rộng hơn, mà là làm cho lượng dữ liệu cần vận chuyển ít đi.
5. Thay đổi thuật toán và phần mềm. Ví dụ: nạp dữ liệu trước (prefetch), xử lý theo lô (batching), hợp nhất toán tử (operator fusion), cải thiện bố cục dữ liệu để tăng tỉ lệ cache hit. Rất nhiều cải tiến hiệu năng không phải do phần cứng mạnh lên, mà do phần mềm giúp dữ liệu phải được chuyển đi ít lần hơn.
6. Khi liên kết quang / CPO—từ giữa các chip, giữa các tủ rack—việc vận chuyển dữ liệu trở thành nút thắt, thì dùng quang.
Xem xong những điều này, bạn có phải cuối cùng đã hiểu rằng “nút thắt Von Neumann” không phải do một thiết kế lỗi nào đó, mà là mâu thuẫn căn bản của tính toán hiện đại: tính toán ngày càng rẻ, còn việc di chuyển dữ liệu ngày càng đắt.
Trước đây mọi người chủ yếu thi nhau về xung nhịp CPU. Giờ mọi người thi nhau về: HBM cache, đóng gói (packaging), băng thông bộ nhớ, mạng trung tâm dữ liệu (data center network), liên kết quang (optical interconnect), in-memory compute, điều phối phần mềm (software scheduling). Vì vậy, trong kỷ nguyên AI, HBM, DRAM, SSD, CPO, module quang, OCS đều trở nên quan trọng—bản chất đều là để giải quyết nút thắt này.#美股科技股反弹道指创新高
