Los últimos informes de resultados de Microsoft y de su filial de computación en la nube de Amazon envían un mismo mensaje: las CPU basadas en Arm se han convertido en la infraestructura básica central para la IA de agentes.
Las dos recientes conferencias de resultados de Microsoft y Amazon han confirmado una tendencia: los chips personalizados basados en la arquitectura Arm, que antes eran simples pruebas tecnológicas, se han convertido en un pilar fundamental de la infraestructura cloud a escala masiva.
El CEO de Microsoft, Satya Nadella, resume esta transformación de la arquitectura con una frase: “Cuando se ejecutan cargas de agentes, la CPU es tan importante como la GPU”. A continuación, aportó pruebas contundentes: Microsoft prevé que, para finales de julio, los racks con Azure Cobalt 200 se desplegarán en más de 25 centros de datos en todo el mundo.
A solo un día de diferencia, Amazon dio a conocer que el tamaño de ingresos anualizados de su negocio de chips (incluyendo Graviton, Trainium y Nitro) ya superó los 25.000 millones de dólares, con un crecimiento interanual de tres dígitos. Los compromisos de compra de los clientes para Graviton, en comparación con el trimestre anterior, se acercan a un aumento de casi tres veces, y la velocidad de adopción de Graviton5 también ronda el doble de la de Graviton4.
Aunque los productos son diferentes y las plataformas cloud también lo son, la dirección converge: los principales proveedores cloud hiperescala del mundo están transformando las CPU basadas en Arm en el núcleo de la infraestructura de IA y las están optimizando para las necesidades de carga de trabajo de cada uno y sus objetivos de eficiencia económica.
Los agentes necesitan más que cómputo de modelos
El estándar para medir la primera ola de la IA generativa es el tamaño del modelo, la capacidad de suministro de aceleradores de IA y la habilidad para generar tokens. En cambio, el funcionamiento de la IA de agentes es más complejo: los agentes necesitan recuperar datos, llamar herramientas, ejecutar código, aplicar estrategias y verificar los resultados; se trata de un espectro más amplio de tareas.
Las GPU todavía asumen la gran mayoría del entrenamiento de modelos y de la generación de tokens en la inferencia, mientras que la CPU se encarga de diversas tareas alrededor de la ejecución de los modelos, como el enrutamiento de solicitudes, el preprocesamiento de datos, la orquestación de herramientas, la gestión de memoria y almacenamiento, y garantiza que miles de tareas concurrentes de interacción puedan seguir funcionando de forma estable y continua.
Nadella dijo en la conferencia de resultados que la cartera de productos de máquinas virtuales (VM) basada en Azure Cobalt ya soporta los servicios propios de Microsoft, así como cargas de trabajo de clientes como Adobe, Arm, Elastic, OpenAI, Sprinklr y TomTom, lo que indica que ya se ha aplicado en entornos reales de producción.
Amazon Web Services confirma la misma tendencia desde otro ángulo. Graviton5 está diseñado específicamente para cargas de trabajo de IA para agentes y se optimiza para escenarios como inferencia en tiempo real, generación de código y orquestación de múltiples pasos. En comparación con las instancias M8g que usan Graviton4, las instancias M9g basadas en Graviton5 logran hasta un 25% más de rendimiento de cómputo y hasta un 35% más de velocidad en inferencia de aprendizaje automático.
Dos proveedores cloud hiperescala, rutas diferentes hacia la escalabilidad
El éxito de Cobalt y Graviton demuestra que la arquitectura Arm permite que los proveedores cloud hiperescala diseñen chips a medida para satisfacer los requisitos de su propia infraestructura a gran escala, al tiempo que comparten la misma arquitectura y el mismo software. Esto ayuda a acelerar el proceso de comercialización y a lograr retornos comerciales. Microsoft publicó Cobalt 200 en noviembre de 2025 y, en junio de 2026, abrió el acceso preliminar para el lanzamiento del producto de máquinas virtuales. En menos de dos meses, las soluciones de bastidor con ese chip ya se habían desplegado en más de 25 centros de datos en todo el mundo, con un progreso muy rápido.
Cobalt 200 está construido sobre Arm Neoverse CSS V3 y es el segundo CPU de nube con arquitectura Arm de Microsoft: frente al producto de la generación anterior, el rendimiento puede aumentar hasta un 50%, se amplía hasta 128 vCPU y está diseñado para cargas de trabajo nativas de la nube, intensivas en datos y de agentes inteligentes.
Amazon Web Services ya ha lanzado la quinta generación de productos Graviton. Las instancias M9g y M9gd con Graviton5 ya entraron oficialmente en uso comercial en junio de este año, con un rendimiento de cómputo hasta un 25% superior al de Graviton4. Amazon Web Services indica que, para la línea completa de productos Graviton, su relación precio-rendimiento es un 30% a 40% mayor que la de instancias comparables.
Lo verdaderamente digno de atención es la tasa de adopción de los clientes de los productos Graviton: entre los 1000 clientes de EC2 principales de Amazon Web Services, el 98% usa Graviton, y más de 120.000 clientes construyen servicios basados en Graviton. Por tercer año consecutivo, más de la mitad de la nueva capacidad de CPU añadida por Amazon Web Services adopta Graviton.
Eficiencia para liberar cómputo; el cómputo crea ingresos
Microsoft vincula directamente la eficiencia de la infraestructura con el crecimiento del desempeño. En la misma temporada, los ingresos de Azure crecieron un 43% interanual, mientras que la demanda del mercado sigue superando la capacidad de suministro existente. El director financiero de Microsoft, Amy Hood, señaló que las mejoras continuas en la eficiencia operativa de la infraestructura de CPU y GPU, así como el aumento de la capacidad de ampliación de infraestructura y la rapidez para habilitarla, liberan más recursos de cómputo disponibles. Además, casi todo el cómputo adicional se consume rápidamente por la demanda del mercado después de ponerse en línea y se transforma en ingresos.
Para los hipercentros de datos a gran escala, el significado de la mejora de la eficiencia de la CPU va mucho más allá de reducir el gasto en electricidad. Cuando la demanda del mercado supera la oferta, una infraestructura más eficiente puede liberar más capacidad de cómputo con el mismo tamaño de bastidor y el mismo presupuesto de energía; y esa capacidad, en última instancia, se convierte en ingresos.
Microsoft no ha revelado el porcentaje de contribución específico de Cobalt 200 a la mejora de la eficiencia, pero la lógica que hay detrás ya está bastante clara: el rendimiento, la utilización de recursos y la eficiencia energética no solo son palancas para liberar más capacidad de cómputo, sino también palancas para impulsar el crecimiento del negocio.
Amazon Web Services proporciona otro dato de respaldo: el ingreso anualizado de 25.000 millones de dólares cubre todo el negocio de chips, no solo Graviton. Sin embargo, el rápido crecimiento de los compromisos de compra y la adopción acelerada de Graviton5 indican que la línea de productos de CPU a medida se está convirtiendo en un pilar importante de este enorme negocio de chips que crece a gran velocidad. Además, su ventaja notable en relación precio-rendimiento ofrece motivos sólidos para que los clientes migren más cargas de trabajo a la plataforma Graviton.
La presión a la que se enfrenta la industria sigue aumentando. Los datos de la Agencia Internacional de la Energía (IEA) muestran que el consumo eléctrico de los centros de datos destinados a la IA creció un 50% en 2025. Un informe estadístico de la firma de investigación Dell'Oro Group indica que, en el primer trimestre de 2026, las inversiones de capital de los centros de datos de Amazon, Google, Meta y Microsoft crecieron un 78% interanual. En comparación con un año atrás, hoy cada vatio de energía y cada bastidor se vuelven más importantes. La eficiencia energética de la CPU ya no es un indicador secundario en parámetros técnicos, sino la herramienta clave con la que los proveedores cloud hiperescala liberan cómputo limitado, aumentan la utilización de la infraestructura existente y obtienen mayores retornos.
Al mismo tiempo, la demanda del mercado está superando el ámbito único de las GPU. IDC estima que el gasto global en infraestructura de IA en 2026 alcanzará 497.000 millones de dólares, con un crecimiento de aproximadamente 56%. Además, la demanda ya no se limita a sistemas de GPU, sino que también incluye plataformas de orquestación, canalizaciones de datos y clústeres de inferencia basados en CPU, entre otros ámbitos.
El mercado cloud a hiperescala transmite más señales positivas para Arm
Microsoft y Amazon Web Services son los casos más seguidos en este momento, pero solo forman parte de una migración de arquitectura más amplia.
Axion, lanzado por Google Cloud, es una serie de productos de CPU personalizados basados en la arquitectura Arm. Axion no solo sirve como CPU general para respaldar su infraestructura de nube, sino que también cumple el papel de CPU de nodo principal de IA en el sistema TPU de la generación más reciente: se encarga de proporcionar servicios de orquestación, red e infraestructura para respaldar el funcionamiento estable de sistemas masivos de IA.
NVIDIA también tomó la misma decisión arquitectónica en su propuesta de «fábrica de IA». Vera es la CPU basada en Arm más reciente de NVIDIA y servirá como base de cómputo para los próximos sistemas de IA como Rubin. En estos despliegues a nivel de bastidor, la CPU coordina los recursos de memoria, red y aceleradores.
En conjunto, Microsoft Cobalt, Amazon Graviton, Google Axion y NVIDIA Vera apuntan a la misma conclusión: a medida que la infraestructura de IA avanza desde la fase de inferencia de modelos hacia la de ejecución de agentes autónomos, las CPU basadas en la arquitectura Arm se están convirtiendo gradualmente en la base de cómputo general para los modernos centros de datos de IA, asumiendo funciones clave como la orquestación de recursos y la coordinación de sistemas.