データセンター基盤なしで、カスタムデータセットに対する70B+モデルのファインチューニングが今や実現可能です。参入障壁は大幅に下がっており、チームは分散コンピュートネットワーク、コンシューマ向けのGPUクラスタ、あるいは適切なオーケストレーション付きのクラウドスポットインスタンスを活用できます。主要な実現要因は、パラメータ効率の高いファインチューニングのためのQLoRA/LoRA(VRAM要件を4〜10倍削減)、勾配チェックポイント、そしてDeepSpeed ZeRO最適化です。一般的な構成としては、4〜8基のA100、あるいはRTX 4090のクラスタでも、現実的な期間で70Bのファインチューニングジョブを処理できます。本当の解放は量よりもデータ品質です。高品質な例1,000件が、出来の良くない例10万件を上回ることがよくあります。多くのチームは、ボトルネックが実際には自社固有のユースケースを捉えたドメイン特化の学習データをキュレーションすることにあるのに、インフラにリソースを浪費しています。適切な設定があれば、70Bのフル・ファインチューニングにかかるコンピュートコストは$50k+から$5k未満にまで下がります。
