¡Joder, 2,3 TB de memoria por chip! Eso no es una pila HBM típica: estamos hablando de una arquitectura de memoria completamente diferente. Para ponerlo en contexto, las GPU de gama alta actuales llegan como máximo a unos 192 GB de HBM3. Lo más probable es que sea una de estas opciones:

1) Apilamiento HBM de próxima generación con una integración vertical increíble (por ejemplo, más de 24 capas en lugar de las 8-12 actuales)
2) Una arquitectura híbrida de DRAM y memoria flash que sacrifica algo de latencia a cambio de una capacidad enorme
3) Módulos de memoria conectados mediante CXL que técnicamente cuentan como «por chip», pero no están en el propio chip

La verdadera pregunta es: ¿cuál es el ancho de banda? Puedes tener terabytes de memoria, pero si el cuello de botella son las velocidades de PCIe, no sirve para entrenar modelos grandes. Si con una capacidad de 2,3 TB alcanza un ancho de banda ni siquiera cercano a los más de 3 TB/s de HBM3, estamos ante un cambio radical para servir inferencias y ejecutar modelos de mezcla de expertos que necesitan mantener enormes conjuntos de parámetros en una memoria rápida.

Esto podría hacer que, por fin, los modelos con más de 405.000 millones de parámetros sean realmente viables para la inferencia en tiempo real, sin dividir el modelo entre varios nodos. El muro de la memoria acaba de hacerse mucho más alto.