Anoche el sector tecnológico de EE. UU. se recuperó. Nvidia puso fin a siete jornadas consecutivas de caídas y cerró con una subida de más del 2%. Lumentum y Coherent avanzaron más de 6% y 4%, respectivamente; Micron y SK hynix subieron alrededor de 2,5% en ambos casos. El catalizador principal fue que OpenAI dio a conocer las pruebas de rendimiento de su primer chip de inferencia diseñado por sí mismo, Jalapeno (pimiento picante). En varios indicadores superó a la plataforma Nvidia GB300. El chip fue desarrollado conjuntamente por OpenAI y Broadcom, utiliza el proceso N3P y monta memoria HBM4 (con una capacidad de hasta 216 GiB), con un ancho de banda de 15,4 TB/s. Su enfoque principal es la inferencia. El mercado había supuesto previamente que se trataba de un chip privado hecho solo para el modelo GPT, pero en realidad es un chip de inferencia de uso muy general y con una arquitectura completamente abierta. En esta ocasión, comparó principalmente con la GB300 usando, como modelos de código abierto y más pequeños de OpenAI, GPT-OSS 120B, además de modelos de terceros como DeepSeek y Kimi. Los resultados mostraron que tiene ventajas en dos rubros: la carga de trabajo de IA por unidad de consumo energético y la velocidad de respuesta.

Los resultados de la prueba ponen en evidencia el cambio de reglas entre entrenamiento e inferencia. Antes, los chips se valoraban por su rendimiento pico absoluto (FLOPS); ese es el foco de la fase de entrenamiento y también el terreno fuerte de NVIDIA. Pero la realidad a la que se enfrenta OpenAI es que el cuello de botella en el centro de datos no es que no se consigan chips, sino que no hay suficiente electricidad: construir subestaciones, tirar de la red eléctrica y montar sistemas de refrigeración lleva años, por lo que el indicador económico más crítico es cuántos Tokens se pueden “expulsar” por cada megavatio de energía. Jalapeno aborda precisamente este punto doloroso: la potencia nominal por chip es de solo 700W (incluso por debajo de 550W en pruebas con alta carga), mientras que los chips equivalentes de NVIDIA suelen rondar los 900W o incluso más de un kilovatio. Con ello, en el rendimiento del pico, su procesamiento por vatio es de 1,5 a 1,9 veces el de GB200/GB300, lo que permite a OpenAI atender simultáneamente a más usuarios en las mismas condiciones de sala de computación y presupuesto eléctrico, y reducir el costo de cada consulta. Cabe señalar que no se compara con la última generación de Vera Rubin.

En términos de arquitectura, Jalapeno utiliza un diseño de colaboración entre hardware y software: despliega directamente dentro del propio chip un HBM4 de alto ancho de banda y hace que los núcleos de cómputo prioricen el acceso a la memoria local, evitando la alta latencia y el consumo energético que supone mover datos entre chips; además, no adopta la arquitectura popular actual de Prefill/Decode separadas, sino que enlaza toda la potencia de cálculo y, mediante una gestión dinámica del software, responde a las variaciones del tráfico en escenarios reales. Al probar Kimi K2.5, su rendimiento por vatio en el pico mejora aproximadamente 1,5 veces y la latencia de extremo a extremo se reduce 3,4 veces. De principio a cinta de producción, OpenAI tardó solo 9 meses: la clave está en usar IA para fabricar chips y luego dejar que la IA escriba el código de los controladores. En algunos mecanismos de atención complejos y módulos MoE, el código generado automáticamente por IA es más rápido que el escrito a mano por expertos en al menos 1,5 veces. El equipo, incluso sin contar con núcleos ya existentes, completó en menos de dos semanas una optimización de alto nivel de modelos de terceros, lo que demuestra que, ante capacidades de IA llevadas al extremo, el “muro” del ecosistema CUDA de NVIDIA no es infranqueable.

En términos objetivos, a corto plazo NVIDIA no se verá realmente desafiada: el responsable de chips de OpenAI ha dejado claro que a corto plazo no abandonarán a los proveedores actuales y ha dicho que “NVIDIA sigue siendo un muy buen socio”. Para NVIDIA, el poder de fijación de precios en inferencia podría aflojarse, pero las barreras en entrenamiento siguen firmes. Además, comparar Jalapeno con GB300 no es del todo justo; el rival real debería ser la próxima generación Rubin, que también emplea HBM4. Sin embargo, como uno de los mayores clientes de NVIDIA, OpenAI cuenta con chips de inferencia propios, lo que implica que en futuras negociaciones de compra de capacidad de cómputo tendrá más poder de negociación. Para AMD, la presión no solo proviene del cómputo máximo en picos, sino también de la velocidad de iteración del ecosistema de software y de la adaptación de modelos. La tendencia de la industria es cada vez más clara: cuando el desarrollo de algoritmos de software alcanza cierto tamaño, las empresas de IA integran el hardware hacia abajo para buscar la máxima eficiencia económica por unidad. Google (TPU), Amazon (Inferentia), las startups e incluso ahora OpenAI, que se ha metido directamente en el juego, están atacando a NVIDIA en dimensiones como costos, eficiencia energética y escenarios específicos. Y la “certidumbre” del upstream de foundry (fabricación por encargo) y de los “vendedores de agua” de interconexión sigue siendo alta.