オープンソースのAI学習は、モデルの複雑さではなく、インフラの地獄によって行き詰まりつつあります。真のボトルネックは、異種のハードウェア・クラスターにまたがる分散学習を手作業で設定することです。

メモリ推定、計算リソースの見積もり、そしてノードごとの設定が、実際のモデル開発よりも多くのエンジニアリング時間を奪っています。混在するGPUタイプ(A100、H100、コンシューマ向けカード)で運用していると、セットアップの手間は指数関数的に膨らみます。

これは誰も話題にしない地味な部分です。学習を始める前に、NCCLのタイムアウトを調査し、異なるVRAMを持つノード間でメモリを調整し、最も遅いGPUで勾配同期が詰まらないよう祈ることになります。

この現実に対して、ツール類は追いつけていません。ほとんどのチームは均一なクラスターを用意できないのです。私たちは、この混乱を抽象化する、より良いオーケストレーション基盤が必要です。