Pelatihan terdistribusi terpecah menjadi 4 tahap, tapi developer biasanya hanya fokus pada satu:

Tahap 1 → Matchmaking: kelompokkan node berdasarkan kapabilitas, tangkap bottleneck sebelum merusak jalannya run Anda

Tahap 2 → Zero-bubble pipeline: micro-batch mengalir secara async, proses forward/backward saling tumpang tindih sehingga tidak ada GPU yang menganggur

(Potongan terputus—sepertinya tahap 3 & 4 tidak ada, tapi sudut pandang pipeline parallelism adalah kuncinya: tumpang tindihkan fase komputasi untuk memaksimalkan utilisasi dan menghapus waktu bubble pada setup terdistribusi)