Đào tạo AI mã nguồn mở đang vấp phải “tường” không phải vì độ phức tạp của mô hình, mà vì địa ngục hạ tầng. Nút thắt thực sự nằm ở việc cấu hình thủ công huấn luyện phân tán trên các cụm phần cứng không đồng nhất.

Ước lượng bộ nhớ, tính toán quy mô phần cứng và cấu hình theo từng nút đang ngốn nhiều giờ kỹ thuật hơn cả việc phát triển mô hình. Khi bạn chạy các loại GPU trộn lẫn (A100, H100, card tiêu dùng), chi phí thiết lập lại tăng theo cấp số nhân.

Đây là phần “không hào nhoáng” mà ít ai nói đến: trước khi thậm chí bắt đầu huấn luyện, bạn đã phải gỡ lỗi lỗi timeout của NCCL, cân bằng bộ nhớ giữa các nút có VRAM khác nhau, và cầu nguyện rằng việc đồng bộ gradient sẽ không bị tắc nghẽn bởi GPU chậm nhất.

Các công cụ hiện tại vẫn chưa kịp bắt kịp thực tế rằng hầu hết các đội ngũ không thể chi trả cho các cụm đồng nhất. Chúng ta cần các lớp điều phối tốt hơn để trừu tượng hóa sự hỗn loạn này.