Điểm thực sự ấn tượng lần này của NVIDIA không chỉ là GPU nhanh hơn
Lần này, NVIDIA lại đẩy hạ tầng AI tiến thêm một bước: AI Agent bắt đầu tự viết “bộ tăng tốc” cho AI.
Theo NVIDIA Labs công bố, tác tử thiết kế nhân KDAgent đã có thể tự tối ưu toán tử Kimi Delta Attention của Moonshot AI. Trong thử nghiệm với B300 và 8192 token, so với baseline FlashKDA chính thức, phiên bản TIRx đạt mức tăng tốc hình học trung bình khoảng 2,96 lần, CAKE-PTX khoảng 2,94 lần, CuTe-DSL khoảng 2,85 lần; đồng thời sai số trạng thái cuối với 8K tokens giảm mạnh từ 3,45% xuống còn 0,22% và 0,29%.
Điều đáng chú ý thực sự ở đây không chỉ là “nhanh gần 3 lần”, mà là AI đang chuyển từ việc gọi công cụ sang tự tối ưu công cụ.
Trước đây, các cải tiến hiệu năng GPU chủ yếu dựa vào quy trình chế tạo chip, nâng cấp kiến trúc và tối ưu CUDA thủ công; giờ đây, chính mô hình bắt đầu tham gia vào thiết kế kernel cấp thấp. Nếu năng lực này còn tiếp tục trưởng thành, tốc độ lặp ứng dụng AI trong tương lai có thể không còn bị ràng buộc hoàn toàn bởi chu kỳ tối ưu hóa của các kỹ sư con người.
Và Kimi chỉ là một ví dụ. NVIDIA hiện đã liên tục đầu tư vào Kimi, Blackwell, tối ưu suy luận và hạ tầng Agentic AI; phía hãng cũng nhấn mạnh tầm quan trọng của các chỉ số như tokens/s, tokens/W, cost/token.
Điều này cho thấy cạnh tranh trong chuỗi công nghiệp AI đang chuyển từ “ai có GPU nhiều hơn” sang dần mở rộng sang “ai có thể khai thác được nhiều năng lực tính toán hơn từ cùng một miếng GPU”.
Với thị trường, thông tin này có hai lớp tác động: trong ngắn hạn là lợi cho hiệu suất sử dụng GPU, hiệu quả suy luận AI và hệ sinh thái tối ưu phần mềm; còn trong trung dài hạn, có thể tiếp tục làm giảm chi phí theo mỗi Token, tạo điều kiện thương mại cho các AI Agent phức tạp hơn và có ngữ cảnh dài hơn.
Vì vậy, điều đáng chú ý có lẽ không phải là lần này Kimi nhanh 2,96 lần, mà là nếu AI bắt đầu tự tối ưu các toán tử cấp thấp, thì năng lực tính toán hiệu dụng của GPU còn có thể được giải phóng nhiều đến mức nào trong tương lai?
Đó có thể mới là một logic ẩn khác đằng sau việc nhu cầu năng lực tính toán AI tiếp tục tăng.