O que a NVIDIA fez desta vez é realmente impressionante: não é só que as GPUs ficaram mais rápidas
Desta vez, a NVIDIA avançou mais uma etapa na infraestrutura de IA: agentes de IA começaram a escrever “aceleradores” para si mesmos.
De acordo com a NVIDIA Labs, o agente de design de kernels KDAgent já consegue otimizar de forma autônoma o operador Kimi Delta Attention do Moonshot AI. Nos testes com B300 e 8192 tokens, em comparação com a base oficial FlashKDA, a versão TIRx obteve aceleração geométrica média de cerca de 2,96x, CAKE-PTX de cerca de 2,94x e CuTe-DSL de cerca de 2,85x; ao mesmo tempo, o erro relativo do estado final com 8K tokens caiu de 3,45% para 0,22% e 0,29%.
O ponto que realmente merece atenção não é apenas “ficou mais rápido em quase 3x”, mas o fato de a IA estar passando de chamar ferramentas para otimizar ferramentas por conta própria.
Antes, os ganhos de desempenho de GPU dependiam mais do avanço de processos de fabricação, de atualizações de arquitetura e de otimizações em CUDA feitas por humanos; agora, o próprio modelo começa a participar do design de kernels na camada mais baixa. Se essa capacidade amadurecer ainda mais, a velocidade de iteração das aplicações de IA talvez deixe de ficar totalmente limitada ao ciclo de otimização de engenheiros humanos.
E Kimi é apenas um caso. A NVIDIA já vem investindo continuamente em Kimi, Blackwell, otimização de inferência e infraestrutura de Agentic AI; e a própria empresa também vem destacando a importância de métricas como tokens/s, tokens/W e cost/token.
Isso significa que a competição na cadeia de IA está saindo de “quem tem mais GPUs” e se expandindo gradualmente para “quem consegue extrair mais poder de computação do mesmo GPU”.
Para o mercado, essa notícia tem dois impactos: no curto prazo, melhora da utilização de GPUs, eficiência da inferência de IA e do ecossistema de otimização de software; no médio e longo prazo, pode ainda reduzir o custo por token, dando condições comerciais para agentes de IA mais complexos e com contextos mais longos.
Portanto, o que talvez mereça atenção de verdade não seja apenas que a Kimi ficou 2,96x mais rápida desta vez, mas sim quanto poder de computação efetivo das GPUs ainda pode ser liberado se a IA começar a otimizar os operadores de base por conta própria.
Essa pode ser a lógica oculta por trás do crescimento contínuo da demanda por computação de IA.
Desta vez, a NVIDIA avançou mais uma etapa na infraestrutura de IA: agentes de IA começaram a escrever “aceleradores” para si mesmos.
De acordo com a NVIDIA Labs, o agente de design de kernels KDAgent já consegue otimizar de forma autônoma o operador Kimi Delta Attention do Moonshot AI. Nos testes com B300 e 8192 tokens, em comparação com a base oficial FlashKDA, a versão TIRx obteve aceleração geométrica média de cerca de 2,96x, CAKE-PTX de cerca de 2,94x e CuTe-DSL de cerca de 2,85x; ao mesmo tempo, o erro relativo do estado final com 8K tokens caiu de 3,45% para 0,22% e 0,29%.
O ponto que realmente merece atenção não é apenas “ficou mais rápido em quase 3x”, mas o fato de a IA estar passando de chamar ferramentas para otimizar ferramentas por conta própria.
Antes, os ganhos de desempenho de GPU dependiam mais do avanço de processos de fabricação, de atualizações de arquitetura e de otimizações em CUDA feitas por humanos; agora, o próprio modelo começa a participar do design de kernels na camada mais baixa. Se essa capacidade amadurecer ainda mais, a velocidade de iteração das aplicações de IA talvez deixe de ficar totalmente limitada ao ciclo de otimização de engenheiros humanos.
E Kimi é apenas um caso. A NVIDIA já vem investindo continuamente em Kimi, Blackwell, otimização de inferência e infraestrutura de Agentic AI; e a própria empresa também vem destacando a importância de métricas como tokens/s, tokens/W e cost/token.
Isso significa que a competição na cadeia de IA está saindo de “quem tem mais GPUs” e se expandindo gradualmente para “quem consegue extrair mais poder de computação do mesmo GPU”.
Para o mercado, essa notícia tem dois impactos: no curto prazo, melhora da utilização de GPUs, eficiência da inferência de IA e do ecossistema de otimização de software; no médio e longo prazo, pode ainda reduzir o custo por token, dando condições comerciais para agentes de IA mais complexos e com contextos mais longos.
Portanto, o que talvez mereça atenção de verdade não seja apenas que a Kimi ficou 2,96x mais rápida desta vez, mas sim quanto poder de computação efetivo das GPUs ainda pode ser liberado se a IA começar a otimizar os operadores de base por conta própria.
Essa pode ser a lógica oculta por trás do crescimento contínuo da demanda por computação de IA.