Lo realmente impresionante de Nvidia esta vez no es solo que la GPU sea más rápida
Nvidia ha vuelto a empujar un paso más allá la infraestructura para IA: los agentes de IA ya empiezan a escribir para sí mismos “aceleradores” destinados a la IA.
Según lo divulgado por NVIDIA Labs, el agente de diseño de kernels KDAgent ya puede optimizar de forma autónoma el operador Kimi Delta Attention de Moonshot AI. En las pruebas con B300 y 8.192 tokens, frente al baseline oficial FlashKDA, la versión TIRx logra una aceleración geométrica media de aproximadamente 2,96×, CAKE-PTX de aproximadamente 2,94× y CuTe-DSL de aproximadamente 2,85×; además, el error relativo final con 8K tokens se redujo drásticamente del 3,45% a 0,22% y 0,29%.
Lo que de verdad merece atención aquí no es solo “casi 3 veces más rápido”, sino el hecho de que la IA está pasando de llamar herramientas a optimizar sus propias herramientas.
Antes, las mejoras de rendimiento de GPU dependían más de la tecnología de fabricación de chips, de las actualizaciones de arquitectura y de la optimización manual con CUDA; ahora, el propio modelo empieza a participar en el diseño de kernels a nivel de base. Si esta capacidad madura, en el futuro la velocidad de iteración de las aplicaciones de IA podría dejar de estar completamente supeditada al ciclo de optimización de ingenieros humanos.
Además, Kimi es solo un caso. Nvidia ya ha estado invirtiendo de manera continua en Kimi, Blackwell, la optimización de inferencia y la infraestructura de IA agentic. Incluso, de forma oficial, se recalca la importancia de métricas como tokens/s, tokens/W y cost/token.
Esto significa que la competencia en la cadena de la industria de la IA se está desplazando de “quién tiene más GPU” hacia “quién puede exprimir más potencia de cómputo de la misma GPU”.
Para el mercado, esta noticia tiene dos niveles de impacto: a corto plazo, beneficia la utilización de GPU, la eficiencia de inferencia de IA y el ecosistema de optimización de software; a mediano y largo plazo, podría seguir reduciendo el costo por token, haciendo viable la comercialización de agentes de IA más complejos y con contextos más largos.
Así que lo realmente digno de observar quizá no sea que Kimi haya sido 2,96× más rápido en esta ocasión, sino hasta qué punto, si la IA empieza a optimizar por sí misma los operadores a bajo nivel, todavía se podrá liberar más potencia efectiva de GPU.
Esta podría ser la otra lógica oculta por la cual la demanda de cómputo de IA continúa creciendo.
Nvidia ha vuelto a empujar un paso más allá la infraestructura para IA: los agentes de IA ya empiezan a escribir para sí mismos “aceleradores” destinados a la IA.
Según lo divulgado por NVIDIA Labs, el agente de diseño de kernels KDAgent ya puede optimizar de forma autónoma el operador Kimi Delta Attention de Moonshot AI. En las pruebas con B300 y 8.192 tokens, frente al baseline oficial FlashKDA, la versión TIRx logra una aceleración geométrica media de aproximadamente 2,96×, CAKE-PTX de aproximadamente 2,94× y CuTe-DSL de aproximadamente 2,85×; además, el error relativo final con 8K tokens se redujo drásticamente del 3,45% a 0,22% y 0,29%.
Lo que de verdad merece atención aquí no es solo “casi 3 veces más rápido”, sino el hecho de que la IA está pasando de llamar herramientas a optimizar sus propias herramientas.
Antes, las mejoras de rendimiento de GPU dependían más de la tecnología de fabricación de chips, de las actualizaciones de arquitectura y de la optimización manual con CUDA; ahora, el propio modelo empieza a participar en el diseño de kernels a nivel de base. Si esta capacidad madura, en el futuro la velocidad de iteración de las aplicaciones de IA podría dejar de estar completamente supeditada al ciclo de optimización de ingenieros humanos.
Además, Kimi es solo un caso. Nvidia ya ha estado invirtiendo de manera continua en Kimi, Blackwell, la optimización de inferencia y la infraestructura de IA agentic. Incluso, de forma oficial, se recalca la importancia de métricas como tokens/s, tokens/W y cost/token.
Esto significa que la competencia en la cadena de la industria de la IA se está desplazando de “quién tiene más GPU” hacia “quién puede exprimir más potencia de cómputo de la misma GPU”.
Para el mercado, esta noticia tiene dos niveles de impacto: a corto plazo, beneficia la utilización de GPU, la eficiencia de inferencia de IA y el ecosistema de optimización de software; a mediano y largo plazo, podría seguir reduciendo el costo por token, haciendo viable la comercialización de agentes de IA más complejos y con contextos más largos.
Así que lo realmente digno de observar quizá no sea que Kimi haya sido 2,96× más rápido en esta ocasión, sino hasta qué punto, si la IA empieza a optimizar por sí misma los operadores a bajo nivel, todavía se podrá liberar más potencia efectiva de GPU.
Esta podría ser la otra lógica oculta por la cual la demanda de cómputo de IA continúa creciendo.