Trong tuần này, Nvidia đang ra sức quảng bá hệ thống chip Vera Rubin mới và công bố dữ liệu benchmark hiệu năng mới nhất cho bộ kết hợp GPU và CPU của hãng.

Tại một hội thảo kỹ thuật chuyên sâu được tổ chức vào tuần trước ở trụ sở tại Santa Clara, California, các lãnh đạo của Nvidia đã giới thiệu cho một nhóm phóng viên nhỏ những điểm nhấn về các cải tiến của hệ thống chip này về hiệu năng và hiệu suất năng lượng. Thông điệp cốt lõi được truyền tải trong lần ra mắt này là: Nvidia, vốn lâu nay nổi tiếng nhờ sản xuất GPU, đang ngày càng nỗ lực định vị mình như một nhà cung cấp CPU có thể cung cấp sức mạnh để vận hành các tác nhân AI (AI agents).

Mặc dù GPU vẫn là phần cứng chủ đạo cho việc huấn luyện và vận hành các mô hình AI trong doanh nghiệp, nhưng khi ngành chuyển sang các hệ thống phức tạp hơn, giàu tính “tác nhân” (agent) hơn, nhu cầu đối với CPU cũng tăng theo. CPU có thể điều phối luồng dữ liệu, kết nối mạng và các tác vụ phần mềm khác. Có lẽ đây cũng là một trong những lý do khiến Nvidia luôn tích cực định vị mình là nhà cung cấp hệ thống AI hoàn chỉnh (không chỉ là nhà cung cấp chip AI).

Vera Rubin là người kế nhiệm trong hệ thống siêu chip lai của Nvidia là Grace Blackwell, đồng thời là điểm then chốt trong chiến lược phát triển ngành AI gần đây của công ty. Triết lý thiết kế của nó là cứ hai GPU thì có một CPU. Trong một hệ thống siêu chip Vera Rubin NVL72, cứ 72 GPU Rubin sẽ có 36 CPU Vera. Nvidia cũng bán riêng CPU Vera; theo đưa tin, công ty đã cho khách hàng Trung Quốc biết sản phẩm này sớm nhất có thể ra mắt vào tháng 8.

Các lãnh đạo Nvidia nhấn mạnh rằng rack Vera Rubin NVL72 mới—lắp chồng nhiều con chip trên một nền tảng làm mát bằng chất lỏng—thực sự “cắm là chạy” hơn một số sản phẩm trước đó. Trong lúc thăm phòng thí nghiệm trung tâm dữ liệu của Nvidia ở Thung lũng Silicon, các lãnh đạo Nvidia cho biết OpenAI đã đang sử dụng một rack Vera Rubin.

CEO Nvidia Jensen Huang tuần trước không tham dự hội thảo được tổ chức tại Santa Clara; lúc đó ông đang ở Nhật Bản để công bố việc công ty thiết lập các quan hệ đối tác mới với nhiều doanh nghiệp Nhật nhằm cùng phát triển công nghệ AI cho lĩnh vực robot. Bản tóm tắt của hội thảo do Ian Bark—Phó chủ tịch phụ trách tăng tốc điện toán lâu năm của Nvidia kiêm Kiến trúc sư phần mềm CUDA—chủ trì.

Bark nói với phóng viên: “Chúng tôi đang xây dựng lộ trình để đưa ra một kiến trúc mới—không chỉ là GPU mà còn là CPU. Chúng tôi sẽ tiếp tục đổi mới, vì ở thung lũng Silicon, hoặc bạn đổi mới, hoặc bạn biến mất.”

Người phát ngôn của Nvidia cho WIRED biết rằng buổi họp được tổ chức tại trung tâm cập nhật thông tin cho các lãnh đạo của Jensen Huang, và gần đó là vài bàn chất đầy các túi đồ ăn vặt kiểu Đài Loan. Toàn bộ đều là những món CEO này vừa mang về từ Triển lãm Máy tính Quốc tế Đài Bắc (Computex—một triển lãm thương mại bán dẫn lớn hằng năm).

Nvidia khẳng định, hệ thống Vera Rubin NVL72 có năng lực xử lý trên mỗi watt gấp 10 lần so với siêu chip Grace Blackwell. Công ty cho biết, so với các đối thủ của AMD và Intel, CPU Vera của họ xử lý nhanh hơn đối với các tác vụ AI dạng “tác nhân” (dù các bài test dùng để hỗ trợ các chuẩn đánh giá này dường như sử dụng CPU của đối thủ thế hệ hơi cũ). Hệ thống phụ bộ nhớ cục bộ trên chip mới cũng sẽ cung cấp băng thông bộ nhớ cao hơn gần ba lần so với Blackwell; trong bối cảnh hiện nay thiếu hụt bộ nhớ băng thông cao, đây có khả năng là một điểm rất hấp dẫn đối với nhiều công ty.

Nvidia cho biết họ đã cắt giảm đáng kể số lượng cáp cần thiết để kết nối chip với rack trong các hệ thống máy chủ đa rack, đến mức công ty gắn nhãn hệ thống Vera Rubin là “tính toán không dây (wireless cables computing)” và “hot-plug” (cắm nóng). Điều này có nghĩa là về mặt lý thuyết, khách hàng có thể rút ngắn thời gian lắp đặt cho mỗi rack từ vài giờ xuống còn vài phút—một điểm cũng được nhấn mạnh đồng thời bởi Phó chủ tịch cấp cao kỹ thuật phần cứng Nvidia Andrew Bell và Bark. Ngoài ra, hệ thống chip mới sử dụng tản nhiệt 100% bằng chất lỏng; do tản nhiệt bằng gió tiêu tốn năng lượng hơn, nên có thể giảm lượng năng lượng cần cho việc làm mát chip.

Kể từ khi Nvidia công bố sẽ ra mắt chip Vera Rubin vào mùa xuân năm 2025, công ty đã dần hé lộ thêm nhiều chi tiết về hệ thống chip này, đồng thời khẳng định họ sẽ phát hành đúng kế hoạch. Jensen Huang đã nhiều lần nói rằng Vera Rubin đang được tăng tốc sản xuất hàng loạt và sẽ được giao hàng vào nửa cuối năm; các khách hàng ban đầu bao gồm Microsoft, OpenAI và Oracle.

Trước đó từng có thông tin rằng chip Blackwell thế hệ trước của Nvidia khi được kết nối với nhau trong các rack máy chủ do công ty tùy chế có thể bị quá nhiệt, buộc Nvidia phải thay đổi thiết kế và trì hoãn việc xuất hàng; vì vậy Nvidia đặc biệt nhạy cảm trước mọi gợi ý về khả năng bị trễ tiến độ.

Hoạt động marketing của Nvidia cho Vera Rubin diễn ra đúng trước thềm hội nghị thường niên của đối thủ AMD, nơi các lãnh đạo AMD dự kiến sẽ quảng bá mạnh mẽ về các chip AI và trung tâm dữ liệu thế hệ tiếp theo của mình. Chủ nhật, AMD công bố thêm chi tiết về ngăn xếp (rack) máy chủ chip AI Helios; rack này được thiết kế để cạnh tranh với sản phẩm mới của Nvidia. Nvidia và AMD luôn chạy đua giành các hợp đồng lớn nhiều năm để cung cấp chip cho các trung tâm dữ liệu AI quy mô siêu lớn như của Meta và Amazon, cũng như cho các phòng thí nghiệm AI như OpenAI, Anthropic và SpaceXAI.

Trong hai năm qua, AMD đã tăng đáng kể thị phần trong thị trường CPU cho trung tâm dữ liệu. Công ty lâu nay được công nhận là tiên phong trong kiến trúc chip hiện đại được dùng trong bộ xử lý x86, và đến nay bộ xử lý x86 vẫn chiếm phần lớn doanh thu của CPU trung tâm dữ liệu. Ngược lại, Nvidia sử dụng kiến trúc ARM để xây dựng CPU cho trung tâm dữ liệu—ARM là kiến trúc chip nổi bật với hiệu suất năng lượng (energy efficiency).

Các lãnh đạo Nvidia là Bark và Hannah Kuttend, người phụ trách marketing sản phẩm CPU của Nvidia, đều nhấn mạnh rằng bộ xử lý Vera Rubin đã loại bỏ nhiều kiến trúc chipset được dùng trong các bộ xử lý hiện đại, chuyển sang thiết kế dạng một chip. Kuttend cho biết việc ghép nhiều chipset lại sẽ “làm suy giảm nghiêm trọng băng thông bộ nhớ và truyền dữ liệu”, trong khi thiết kế một chip của Vera Rubin cho phép dữ liệu được truyền nhanh hơn trên chính mạch tích hợp đơn lẻ.