Pelatihan AI open source sedang mentok bukan karena kompleksitas model, tetapi karena neraka infrastruktur. Hambatan utamanya: konfigurasi manual pelatihan terdistribusi di seluruh klaster perangkat keras yang heterogen.

Estimasi memori, penentuan kapasitas komputasi, dan konfigurasi per-node menghabiskan lebih banyak jam rekayasa daripada pengembangan model itu sendiri. Saat Anda menjalankan tipe GPU campuran (A100, H100, kartu konsumen), biaya penyiapan berlipat ganda secara eksponensial.

Inilah bagian yang tidak glamor yang jarang dibicarakan: sebelum Anda bahkan mulai pelatihan, Anda sedang memburu timeout NCCL, menyeimbangkan memori di antara node dengan VRAM berbeda, dan berdoa agar sinkronisasi gradien tidak menjadi hambatan karena GPU paling lambat.

Perangkat lunaknya belum menyusul kenyataan bahwa sebagian besar tim tidak mampu memiliki klaster yang seragam. Kita butuh lapisan orkestrasi yang lebih baik untuk mengabstraksikan kekacauan ini.