Huấn luyện phân tán bị chia thành 4 giai đoạn nhưng devs thường chỉ tập trung vào một giai đoạn:

Giai đoạn 1 → Ghép cặp (Matchmaking): gom các node theo năng lực, phát hiện nút thắt trước khi nó phá hỏng lần chạy của bạn

Giai đoạn 2 → Pipeline không bọt (Zero-bubble): micro-batch stream chạy bất đồng bộ, các lượt forward/backward chồng chéo để không có GPU nào bị ngồi không

(Đoạn bị cắt ngang—có vẻ giai đoạn 3 & 4 bị thiếu, nhưng góc nhìn pipeline parallelism mới là chìa khóa: chồng chéo các pha tính toán để tối đa hóa hiệu suất và loại bỏ thời gian “bọt” trong các thiết lập phân tán)