Las últimas notas de Morgan Stanley señalan que la escasez de memoria para IA podría atravesar todo el ciclo, pero Nvidia no se quedará esperando la expansión de capacidad: se dice que lanzará una versión con menor configuración para la plataforma Rubin, recortando HBM4 de 288 GB a 192 GB y LPDDR5 de 54 TB a 28 TB. La demanda no desaparece; en cambio, se traslada a NAND, DRAM y a interconexiones de alta velocidad. El mercado de CXL podría alcanzar los 6.000 millones de dólares en 2030. (Antecedente: ¡Goldman sube la apuesta con el “caballero del precio”! Precio objetivo a 116.000 yenes, recomendación de compra: la IA provoca escasez de NAND hasta 2028) (Información de contexto: Yangtze Memory amplía capacidad en cerca de 25% y presume que dominará NAND en 2027; se comenta que en el 4T saldrá a cotización IPO para recaudar munición) Cuando todos persiguen la cantidad de GPUs, el analista de semiconductores de Morgan Stanley Joseph Moore lanza en su informe más reciente una advertencia contraintuitiva: el verdadero cuello de botella de la carrera de IA se ha movido hacia la memoria, y la solución de Nvidia es… “reducir la configuración”. El informe revela que la configuración HBM4 de la plataforma Rubin podría ajustarse de 288 GB a 192 GB, y la LPDDR5 a nivel de rack recortarse de 54 TB a 28 TB: esto no es una señal de que la demanda haya tocado techo, sino el inicio de que toda la industria de la IA tenga que rediseñar la arquitectura de sus sistemas por la presión de una oferta insuficiente. TL;DR: La escasez de memoria para IA podría extenderse durante todo el ciclo. Morgan Stanley cree que el tamaño de los modelos, la longitud de contexto y la concurrencia de inferencia seguirán creciendo, absorbiendo continuamente la nueva oferta de almacenamiento. Nvidia comienza a ofrecer una solución de “menor configuración” para Rubin. Puede que se reduzca la capacidad de parte de HBM y LPDDR5, pero la demanda no desaparece: se transfiere hacia NAND, DRAM e interconexiones de alta velocidad. La arquitectura de inferencia de IA se está reestructurando: la separación entre Prefill y Decode podría mejorar la utilización del hardware y crear oportunidades para soluciones tecnológicas como Cerebras y la de Nvidia Groq. CXL podría convertirse en un nuevo punto de crecimiento. Morgan Stanley estima que el tamaño del mercado de semiconductores relacionado podría rondar los 6.000 millones de dólares en 2030; Astera Labs y Marvell serían posibles beneficiarios. La clave de las acciones de almacenamiento es la duración del ciclo, no el tamaño del repunte de precios a corto plazo. Morgan Stanley mantiene la postura de “comprar más” sobre Micron y SanDisk (UFS/SSD: aquí “閃迪”); el riesgo principal es que se desaceleren las inversiones en IA y la construcción de centros de datos. A continuación, la compilación del artículo original: La infraestructura de IA enfrenta un problema cada vez más espinoso: la capacidad de cómputo puede ampliarse rápidamente añadiendo GPUs, pero la oferta de memoria no puede seguir el mismo ritmo. Morgan Stanley considera que, durante un tiempo, la demanda de IA seguirá absorbiendo grandes cantidades de nueva oferta de memoria. Aunque la severidad de las escaseces varíe entre distintos periodos, la expansión de la capacidad de DRAM difícilmente eliminará con rapidez el desfase entre oferta y demanda. Tras entrevistas con múltiples operadores de cómputo, Morgan Stanley encontró que el tema de cómo evitar el cuello de botella de la memoria se está volviendo cada vez más importante. El CEO de Nvidia, Huang Renxun, también habló de la necesidad de un diseño de coordinación entre cómputo, red y sistema de almacenamiento para aliviar las restricciones de suministro. Los analistas sostienen que no es una alerta sobre un debilitamiento de la demanda de almacenamiento, sino una realidad a la que toda la industria de IA tiene que enfrentarse: cuando la memoria no puede suministrarse según lo planeado, las empresas deben encontrar una nueva arquitectura de sistema para que el hardware existente siga respaldando el crecimiento de la IA. La respuesta más intuitiva es reducir la especificación de memoria incorporada en un solo servidor o en una sola GPU. Nvidia Rubin “recorta” de hecho: HBM4 cae a 192 GB. Morgan Stanley indica que la escasez de oferta de DRAM y NAND y el aumento de precios están obligando a que la cadena de la industria de IA replantee la configuración de productos. Para los fabricantes de chips, en lugar de insistir en las especificaciones originales y provocar que los sistemas no se entreguen a tiempo según el plan, es mejor ofrecer versiones con diferentes capacidades de memoria para que los clientes elijan según su necesidad real. El informe de investigación prevé que Nvidia podría ofrecer a la plataforma Rubin varias configuraciones de memoria más bajas. En cuanto a memoria a nivel de rack, la LPDDR5 que Rubin planeaba inicialmente era de unas 54 TB, pero algunas configuraciones nuevas podrían bajarse a 28 TB; esto se traduce en que la capacidad de los módulos de memoria SOCAMM2 pasaría de 192 GB a 96 GB. En lo referente a HBM, Rubin originalmente planeaba equipar 288 GB de HBM4 por GPU, usando un diseño de apilamiento de 8 conjuntos y 12 capas; Morgan Stanley prevé que Nvidia podría aumentar la versión con 192 GB de HBM4, reduciendo el número de capas de apilamiento a 8. Para Rubin Ultra, el informe considera que, al ajustarlo a una solución de chips de doble cómputo, 512 GB es un mejor punto de comparación; en el futuro podría haber opciones de capacidad distintas entre 192 GB y 384 GB. Todo esto corresponde a la valoración de Morgan Stanley sobre la configuración de productos al momento de la publicación del informe, y no implica que Nvidia haya confirmado oficialmente todas las especificaciones. Si se observa desde el costo, la estrategia tiene bastante sentido. Reducir la cantidad de capas de apilamiento de HBM reduce la capacidad y, si se mantienen el número de interfaces y la tasa de velocidad de los pines, teóricamente el ancho de banda no necesariamente baja al mismo ritmo. Pero capacidad y ancho de banda resuelven dos problemas distintos. Para aplicaciones con modelos más pequeños y contextos más cortos, reducir la capacidad podría tener efectos limitados; sin embargo, a medida que los modelos crecen y las tareas de inferencia se vuelven más complejas, una capacidad insuficiente de memoria podría provocar que más datos necesiten transferirse entre distintos niveles de almacenamiento, aumentando la latencia o la utilización de las GPUs. Lo más importante: reducir HBM no hace que los datos que la IA ya necesitaba desaparezcan; solo hace que esos datos busquen una nueva ubicación de almacenamiento. Por ejemplo, cuando la capacidad HBM de una GPU es insuficiente, parte de los datos podría tener que guardarse en memoria principal; cuando se reduce la capacidad de LPDDR5 a nivel de rack, parte de las necesidades de KV Cache (caché de clave-valor) podría trasladarse a memoria flash NAND. KV Cache es la caché usada durante la inferencia de modelos grandes para almacenar información de cálculos históricos. A medida que el contexto es más largo y aumentan las solicitudes en simultáneo, también crece su demanda de capacidad. La demanda de memoria no desaparece; solo se mueve a otros niveles. Morgan Stanley señala que, mientras Nvidia reduce parte de la configuración de LPDDR5, la cadena industrial ya ha observado demanda adicional proveniente de NAND. Además, una menor capacidad HBM podría incrementar la transferencia de datos entre GPUs, poniendo más presión sobre la red de interconexión de alta velocidad. La demanda no desaparece: los datos se canalizan hacia NAND y chips de interconexión. Esto significa que la estrategia de “menor configuración” de Nvidia podría aliviar temporalmente la restricción de suministro de DRAM, pero al mismo tiempo elevaría la demanda de NAND, de chips de interconexión y de clústeres de GPUs a mayor escala. Hay factores estructurales a largo plazo detrás de este desplazamiento de presión. Según los datos históricos de Epoch AI citados en el informe, en la era de los grandes modelos de lenguaje, el tamaño de parámetros de vanguardia ha mostrado una tendencia de crecimiento de aproximadamente el doble cada seis meses. Las ventanas de contexto también han experimentado una expansión rápida. Al mismo tiempo, más aplicaciones de IA se han movido desde preguntas y respuestas simples hacia tareas de programación, inferencia compleja y agentes que ejecutan durante mucho tiempo, elevando aún más el uso de memoria. Morgan Stanley considera que el tamaño del modelo, la longitud del contexto y la concurrencia de inferencia seguirán impulsando el crecimiento de la demanda de almacenamiento. Por lo tanto, reducir la configuración de ciertos productos probablemente sea una solución de transición en periodos de tensión de oferta, más que una señal de que la demanda de memoria para IA vaya a caer a largo plazo. Si reducir la configuración de memoria es una medida de respuesta a corto plazo, cambiar la forma de calcular la inferencia de IA podría traer cambios más profundos en la industria. Morgan Stanley pone el foco en la segunda vía… “¿Por qué la escasez de memoria para IA termina haciendo que Nvidia reduzca la configuración? MS: el cuello de botella enviará los datos a NAND y a chips de interconexión”. Este artículo se publicó primero en BlockTempo (BlockTempo de Dynamic Zone, el medio blockchain más influyente).
