AIの時代に、なぜ永遠にメモリが足りないと言われるのか。それは実は、生まれた時から運命づけられているからです。フォン・ノイマン・ボトルネックのせいです!

現代のコンピュータの基礎は、フォン・ノイマンのアーキテクチャに基づいています。このアーキテクチャの核心の1つは、プログラムとデータが同じ種類のメモリに存在することです。CPUは命令を1つずつ取り出して実行します。

現在のCPU/GPUがますます速く計算できるようになるにつれて、データの搬送が脳の思考速度に追いつかなくなり、脳はしばしばデータを待つことになります。これはAIの時代になるほど顕著です。計算能力とメモリの間のデータ経路が十分に速くなく、データの搬送が計算を遅らせてしまいます。これがフォン・ノイマン・ボトルネックです。

これはCPU/GPUが料理人、メモリが倉庫だと思えばいい。バス/相互接続は料理を運ぶ通路。料理人は増え、包丁さばきも速くなるのに、倉庫が厨房から遠くて通路が狭い。その結果は、料理人が料理できないわけではなく、料理人が食材待ちになっているということだ。

AIサーバーにおけるこのボトルネックは、いま主に4つのことが原因になっている:

1:メモリのレイテンシ。データを1回取り出すのにどれくらい待たされるか。

2:メモリ帯域。単位時間にどれだけのデータを運べるか。

3:メモリ容量にデータが載るかどうか。載らなければ、もっと遅いSSD/ハードディスクへ行く必要がある。

4:消費電力、データを運ぶこと自体が非常に電力を食う。多くの場合、データを1回運ぶほうが計算するより高くつく。 大規模モデルの推論は止まることなく読み続ける:モデルの重み、KV cache、活性値の入出力トークン。もしHBMの帯域が足りなければ、GPUの計算力がどれだけ強くても処理をフルに活かせない。

じゃあ、そのフォン・ノイマンのボトルネックはどうやって解決するの?

完全に消せないから、できるのは緩和することだけだ。

1. キャッシュを追加して、CPU/GPUが毎回直接メモリにアクセスしないようにする。多段のキャッシュを追加する。

2. メモリ帯域を上げる。いま最も足りないのがHBMだという前提での方針はこうだ:メモリを積み上げてGPUのそばに置き、超広帯域のインターフェースで接続する。

3. 計算とメモリを近づける 例:GPU + HBM、CPU + HBM、3Dスタック、chipletの先進的なパッケージ化、CXLによるメモリ拡張。 本質はデータ搬送距離を短くすること。

4. データ量を減らす AIでよく使う量子化(FP8 / INT8 / FP4)、疎(スパース)化、モデル剪定、KV cache圧縮、GQA / MQA / MLA、FlashAttentionは、通路を広げるのではなく、運ぶ必要のあるデータを減らす。

5. アルゴリズムとソフトウェアを変える 例:データのプリフェッチ、バッチ処理、演算子の融合、データ配置を変えてキャッシュヒット率を高める、重複した読み書きを減らす。 多くの性能向上は、ハードが強くなったというより、ソフトによってデータの搬送回数を減らした結果だ。

6. 光インターコネクト / CPO は、チップ間やラック間のデータ搬送がボトルネックになるなら光を使う。

これらを見て、ついに分かったのではないだろうか。フォン・ノイマンのボトルネックは、単一の欠陥設計ではなく、現代コンピューティングの根本的な矛盾だ。計算はどんどん安くなるが、データ移動はますます高くなる。

昔は皆が主にCPUの周波数を競っていた。今は皆が競うのは: HBMキャッシュ、パッケージング、メモリ帯域、データセンターネットワーク、光インターコネクト、インメモリ計算、ソフトウェアのスケジューリング。だからAI時代には、HBM、DRAM、SSD、CPO、光モジュール、OCSがどれも重要になる。本質は、このボトルネックを解決することにある。#美股科技股反弹道指创新高