Estos días, se ha celebrado la conferencia Hot Chips 2026, aclamada como el barómetro de la industria de los semiconductores. NVIDIA, Micron, SK hynix y otros fabricantes clave presentaron ponencias técnicas, centradas en la evolución de próxima generación de la infraestructura de cómputo para la IA. En los últimos años, cada empresa competía en densidad de transistores y rendimiento pico; sin embargo, la conferencia de este año muestra que los principales cuellos de botella del cómputo para IA han pasado de los núcleos de cómputo a la eficiencia del traslado de datos y a la arquitectura de los sistemas de almacenamiento. La memoria está pasando de ser un simple contenedor de datos a convertirse en un componente del sistema. HBM es el motor central de este ciclo súper de almacenamiento, pero también se enfrenta a limitaciones físicas. Micron reveló que, con la misma capacidad, el tamaño del dado (wafer) para HBM3E es de aproximadamente 3 veces el de la memoria DDR5 tradicional, debido a sus enormes canales de datos en paralelo, TSV y redes de alimentación. En un encapsulado típico de GPU, los chips de memoria ocupan alrededor del 90% del área de silicio a nivel de encapsulado en el sistema. El enorme consumo de capacidad de producción de obleas que implica HBM dificulta que la industria responda rápidamente a los choques de demanda, lo que impulsa precios elevados y añade un “muro de costos” además del “muro de rendimiento” en el movimiento de datos para los sistemas de IA. SK hynix también señaló que, a medida que HBM avanza hacia 16 capas e incluso 20 capas, la refrigeración y el encapsulado se acercan a los límites físicos, por lo que el paso a la unión híbrida (hybrid bonding) es una tendencia inevitable.

Ante el cuello de botella, los fabricantes de almacenamiento comienzan a extenderse hacia el cómputo lógico. Samsung propuso una ruta clara en tres etapas, con el objetivo de convertir la base (die) de HBM en una plataforma de IA inteligente. Primera etapa: HBM personalizado (cHBM). Se transfiere el controlador de memoria a la base de HBM fabricada con un proceso lógico avanzado, y se sustituye la interfaz tradicional HBM PHY por un interfaz dedicado entre chips (D2D), lo que permite recuperar entre 5% y 10% del área de silicio para que XPU lo reutilice, convirtiéndolo en una mejora de rendimiento de sistema de 10% a 20%. Segunda etapa: HBM avanzado (AHBM). En el área ociosa de la base se integran unidades de procesamiento, descargando el mecanismo de atención, que consume muchísimo ancho de banda en la inferencia de modelos de gran escala, hacia la ejecución cercana a la memoria. Tercera etapa: apilamiento 3D de HBM (zHBM). Se abandona la capa intermedia de 2.5D y se apila verticalmente el HBM justo encima del XPU. Según datos de Samsung, en comparación con el HBM4E estándar, el consumo de energía de I/O del zHBM es de solo ~0.5 pJ/bit; con ello, el consumo total de energía de DRAM disminuye alrededor de 70%, el ancho de banda aumenta más de 2.3 veces, y en un módulo único se puede ahorrar hasta 100 W, cediendo aproximadamente el 8.3% del margen de consumo al acelerador. Lograrlo requiere uniones híbridas de cobre de oblea a oblea y con un paso inferior a 6 micras, además de exigir un diseño profundamente cooperado desde el principio entre la lógica de DRAM y el SoC.

En el extremo de inferencia, la expansión de la demanda de capacidad impulsa la tendencia a la estratificación del almacenamiento. Ante contextos largos y grandes cachés KV, usar únicamente HBM resulta inasumible en costos. En la industria se propone la memoria flash de alta banda ancha (HBF) como capacidad, que es más de diez veces la de HBM. Aunque el ancho de banda por GB es solo 1/25 del de HBM, en escenarios como la carga en un solo sistema de modelos con billones de parámetros, lotes pequeños o atención dispersa, se muestra una excelente relación costo-eficiencia como una segunda capa de memoria de alta capacidad. El aumento de la demanda de IA de discos mecánicos provoca escasez de suministro, y los hipercentros de datos de gran escala empiezan a desplegar de forma más amplia SSD QLC de bajo costo entre SSD TLC y HDD: esto mejora el rendimiento del sistema y, a la vez, impulsa los envíos de NAND.

Para el mercado, la señal que libera Hot Chips no son meramente señales de corto plazo de algunos trimestres, sino una guía de las tendencias estratégicas de los próximos 3-5 años. Puede observarse el valor a largo plazo de la cadena de la industria desde tres dimensiones. Primero, los fabricantes de almacenamiento: a medida que HBM avanza hacia una personalización e incluso se integra verticalmente con chips de cómputo (zHBM), Samsung, SK hynix y otras empresas se están transformando, pasando de ser solo “vendedores de memoria”, a convertirse en co-diseñadores de plataformas de computación inteligente. Así, se involucran profundamente en la definición de la arquitectura de los aceleradores de nueva generación, obteniendo mayor capacidad de fijación de precios y una diferenciación difícil de sustituir. Segundo, el embalaje avanzado y los materiales de equipos clave: la evolución desde microbultos hacia uniones híbridas, y de 2.5D a apilamiento 3D en pilas WoW, traerá incrementos enormes de capex. Esto abre espacio para equipos de grabado TSV de la cadena upstream, máquinas de uniones híbridas, equipos de prueba y materiales de interfaz térmica de alto rendimiento; los proveedores nacionales de equipos/materiales que puedan validarse en paralelo se beneficiarán de primas por escasez. Tercero, el hardware de IA de uso general: en el futuro no existirá un hardware de IA de talla única. En el extremo de entrenamiento se dependerá de zHBM, orientado a alta densidad de integración con alta capacidad de banda; en el extremo de inferencia surgirán sistemas heterogéneos y estratificados basados principalmente en HBF, LPDDR de alta capacidad y SSD QLC empresarial. En la era de la integración profunda entre cómputo y memoria, cuanto más cerca esté el componente de los datos, mayor será el valor comercial que crea.