El cuello de botella del ancho de banda de la memoria es ahora la principal limitación en la inferencia de IA: las GPU pueden procesar datos más rápido de lo que la DRAM puede suministrárselos. Por eso la memoria de alto ancho de banda (HBM) se ha vuelto fundamental para los chips de IA modernos y las empresas están explorando arquitecturas de procesamiento en memoria.

Mientras tanto, las instituciones financieras están integrando rápidamente la IA en los sistemas de negociación, la modelización de riesgos y el análisis de mercados. El reto no son solo los modelos: también consiste en crear procesos de inferencia de baja latencia capaces de gestionar datos de mercado en tiempo real y cumplir, a la vez, los requisitos normativos. En esencia, los ingenieros están reconstruyendo desde cero la infraestructura de negociación para adaptarla a modelos basados en transformadores que necesitan procesar ventanas de contexto enormes en microsegundos.

La confluencia de estos factores es interesante: la demanda de velocidad de Wall Street está impulsando a los proveedores de hardware a resolver el problema del muro de memoria más rápido de lo que jamás podrían hacerlo las aplicaciones de IA de consumo.