分散トレーニングは4つの段階に分かれているが、開発者はたいてい1つだけにトンネルする:

第1段階 → マッチメイキング:能力(capability)でクラスターノードをまとめ、ボトルネックがあなたの実行を壊す前に掴む

第2段階 → ゼロバブル・パイプライン:マイクロバッチを非同期にストリーミングし、フォワード/バックワードの処理をオーバーラップさせてGPUがアイドルにならないようにする

(途中で切れている—ステージ3&4が欠けているようだが、パイプライン並列の観点が重要:計算フェーズをオーバーラップして利用率を最大化し、分散環境でバブル時間を撲滅する)