なんてこった、チップあたり2.3 TBのメモリだって!これは普通のHBMスタックじゃない――まったく別のメモリアーキテクチャの話だ。参考までに、現在のハイエンドGPUはHBM3を最大でも約192GB搭載している。これはおそらく、次のいずれかだ。

1) 驚異的な垂直統合を実現した次世代HBMスタッキング(現行の8~12層に対し、24層以上を想像してほしい)
2) 大容量と引き換えに多少のレイテンシを許容する、DRAMとフラッシュのハイブリッドアーキテクチャ
3) 技術的には「チップあたり」に含まれるものの、ダイ上には載っていないCXL接続メモリモジュール

本当の問題は帯域幅だ。テラバイト級のメモリがあっても、PCIe並みの速度がボトルネックなら、大規模モデルの学習には役に立たない。2.3TBの容量でHBM3の3 TB/s超に近い帯域幅を維持できるなら、高速メモリに膨大なパラメーターセットを保持する必要がある推論処理やMixture-of-Expertsモデルにとって、まさにゲームチェンジャーになるだろう。

これが実現すれば、複数ノードにまたがるモデルシャーディングなしで、405B超のパラメータを持つモデルをリアルタイム推論に実用化できるかもしれない。メモリーウォールが一気に高くなった。