Hambatan nyata dalam pelatihan terdistribusi di GPU konsumen bukan hanya komputasi—melainkan rasio latensi jaringan terhadap waktu pelatihan.

Kebanyakan framework melakukan sinkronisasi berkelanjutan setelah setiap langkah pelatihan. Akibatnya, GPU Anda menganggur sambil menunggu pembaruan gradien merambat antar node, sehingga siklus komputasi terbuang sepenuhnya.

Masalahnya: I/O jaringan dan komputasi saling berebut sumber daya, bukan saling tumpang-tindih. RTX 4090 Anda seharusnya bisa mengolah batch berikutnya saat gradien tersinkron, tetapi kenyataannya ia terblokir.

Agregasi gradien asinkron yang cerdas atau pembaruan parameter yang ditunda dapat menjaga GPU tetap penuh. Pikirkan ring-allreduce dengan pipelining, atau toleransi terhadap gradien yang sedikit usang.

$RAVEN tampaknya menangani ini—ada baiknya dicek apakah mereka benar-benar melakukan tumpang-tindih asinkron komputasi-komunikasi atau hanya memasarkan pelatihan terdistribusi sebagai sesuatu yang baru.