Heilige Scheiße, 2,3 TB Speicher pro Chip! Das ist kein gewöhnlicher HBM-Stack – hier reden wir von einer völlig anderen Speicherarchitektur. Zum Vergleich: Aktuelle High-End-GPUs kommen auf maximal etwa 192 GB HBM3. Wahrscheinlich handelt es sich um eine dieser Möglichkeiten:
1) HBM-Stacking der nächsten Generation mit extremer vertikaler Integration (etwa 24+ Schichten statt der derzeitigen 8–12)
2) Eine hybride DRAM-Flash-Architektur, die für eine enorme Kapazität etwas Latenz in Kauf nimmt
3) CXL-angebundenen Speichermodule, die technisch gesehen als „pro Chip“ zählen, sich aber nicht auf dem Die befinden
Die entscheidende Frage ist: Wie hoch ist die Bandbreite? Man kann Terabytes an Speicher haben, aber wenn man durch PCIe-Geschwindigkeiten ausgebremst wird, ist das fürs Training großer Modelle nutzlos. Wenn diese Lösung bei einer Kapazität von 2,3 TB auch nur annähernd die Bandbreite von 3+ TB/s von HBM3 erreicht, wäre das ein echter Gamechanger für Inferenzdienste und Mixture-of-Experts-Modelle, die riesige Parametersätze im schnellen Speicher vorhalten müssen.
Damit könnten Modelle mit 405B+ Parametern endlich für die Inferenz in Echtzeit praktikabel werden, ohne das Modell auf mehrere Knoten aufteilen zu müssen. Die Speicherwand ist gerade deutlich höher geworden.
1) HBM-Stacking der nächsten Generation mit extremer vertikaler Integration (etwa 24+ Schichten statt der derzeitigen 8–12)
2) Eine hybride DRAM-Flash-Architektur, die für eine enorme Kapazität etwas Latenz in Kauf nimmt
3) CXL-angebundenen Speichermodule, die technisch gesehen als „pro Chip“ zählen, sich aber nicht auf dem Die befinden
Die entscheidende Frage ist: Wie hoch ist die Bandbreite? Man kann Terabytes an Speicher haben, aber wenn man durch PCIe-Geschwindigkeiten ausgebremst wird, ist das fürs Training großer Modelle nutzlos. Wenn diese Lösung bei einer Kapazität von 2,3 TB auch nur annähernd die Bandbreite von 3+ TB/s von HBM3 erreicht, wäre das ein echter Gamechanger für Inferenzdienste und Mixture-of-Experts-Modelle, die riesige Parametersätze im schnellen Speicher vorhalten müssen.
Damit könnten Modelle mit 405B+ Parametern endlich für die Inferenz in Echtzeit praktikabel werden, ohne das Modell auf mehrere Knoten aufteilen zu müssen. Die Speicherwand ist gerade deutlich höher geworden.