O mais recente relatório de pesquisa do Morgan Stanley aponta que a escassez de memória para IA pode persistir durante todo o ciclo, mas a Nvidia não ficará esperando a expansão da capacidade — segundo informações, a empresa lançará uma versão com especificações reduzidas da plataforma Rubin, cortando a HBM4 de 288 GB para 192 GB e a LPDDR5 de 54 TB para 28 TB. A demanda não desapareceu; está migrando para NAND, DRAM e interconexões de alta velocidade. O mercado de CXL pode chegar a US$ 6 bilhões em 2030. (Contexto: Goldman Sachs eleva preço-alvo da Kioxia para 116 mil ienes e recomenda compra: a IA provocará escassez de NAND até 2028) (Informações adicionais: a YMTC planeja ampliar a capacidade em quase 25% e afirma que dominará o mercado de NAND em 2027; há rumores de que fará um IPO no quarto trimestre para levantar recursos) Enquanto todos perseguem números cada vez maiores de GPUs, Joseph Moore, analista de semicondutores do Morgan Stanley, lançou um alerta contraintuitivo em seu relatório mais recente: o verdadeiro gargalo da corrida da IA passou a ser a memória, e a solução da Nvidia seria justamente «reduzir as especificações». O relatório revela que a configuração de HBM4 da plataforma Rubin pode ser reduzida de 288 GB para 192 GB, e a LPDDR5 em nível de rack, de 54 TB para 28 TB — isso não é um sinal de que a demanda chegou ao pico, mas o início de uma reformulação da arquitetura de sistemas em todo o setor de IA, forçada pela escassez de oferta. TL;DR: A escassez de memória para IA pode persistir durante todo o ciclo. O Morgan Stanley acredita que o crescimento contínuo do tamanho dos modelos, da extensão do contexto e do número de inferências simultâneas absorverá continuamente a nova oferta de armazenamento. A Nvidia começa a oferecer opções com «especificações reduzidas» para Rubin. A capacidade de parte da HBM e da LPDDR5 pode ser reduzida, mas a demanda não desapareceu: está migrando para NAND, DRAM e interconexões de alta velocidade. A arquitetura de inferência de IA está sendo reformulada. A separação entre Prefill e Decode pode melhorar a utilização do hardware e abrir espaço para soluções tecnológicas de empresas como Cerebras e Nvidia Groq. O CXL pode se tornar um novo motor de crescimento. O Morgan Stanley estima que o mercado de semicondutores relacionado alcance cerca de US$ 6 bilhões em 2030, e Astera Labs e Marvell estão entre as possíveis beneficiárias. Para as ações de armazenamento, o fator decisivo é a duração do ciclo, não a magnitude dos aumentos de preços no curto prazo. O Morgan Stanley mantém recomendação de overweight para Micron e Sandisk; os principais riscos são a desaceleração dos investimentos em IA e da construção de data centers. A seguir, a tradução do artigo original: A infraestrutura de IA enfrenta um problema cada vez mais difícil: a capacidade computacional pode ser ampliada rapidamente com a compra de mais GPUs, mas a oferta de memória não consegue acompanhar o ritmo. O Morgan Stanley acredita que, por algum tempo, a demanda por IA continuará absorvendo grandes volumes da nova oferta de memória. Mesmo que o grau de escassez varie ao longo do tempo, a expansão da capacidade de DRAM dificilmente eliminará rapidamente o desequilíbrio entre oferta e demanda. Após conversar com várias empresas de computação, o Morgan Stanley constatou que contornar o gargalo da memória se tornou um tema cada vez mais importante. O CEO da Nvidia, Jensen Huang, também falou da necessidade de aliviar as restrições de oferta por meio do codesign de sistemas de computação, rede e armazenamento. Os analistas acreditam que isso não é um alerta de enfraquecimento da demanda por armazenamento, mas uma realidade que todo o setor de IA precisa enfrentar: quando a memória não pode ser fornecida conforme o planejado, as empresas precisam encontrar novas arquiteturas de sistemas para que o hardware existente continue dando suporte ao crescimento da IA. A resposta mais intuitiva é reduzir as especificações de memória integrada a cada servidor ou GPU. A Nvidia Rubin também terá «especificações reduzidas»: HBM4 cortada para 192 GB O Morgan Stanley aponta que a oferta restrita e a alta dos preços de DRAM e NAND estão levando a cadeia de suprimentos de IA a reconsiderar as configurações dos produtos. Para os fabricantes de chips, em vez de insistir nas especificações originais e correr o risco de não entregar os sistemas conforme o planejado, é melhor oferecer versões com diferentes capacidades de memória, permitindo que os clientes escolham de acordo com suas necessidades reais. O relatório prevê que a Nvidia poderá oferecer várias configurações com menos memória para a plataforma Rubin. No que diz respeito à memória em nível de rack, a capacidade de LPDDR5 inicialmente planejada para Rubin era de cerca de 54 TB, mas algumas novas configurações podem reduzi-la para 28 TB. Isso corresponde a uma redução da capacidade dos módulos de memória SOCAMM2 de 192 GB para 96 GB. No caso da HBM, previa-se que cada GPU Rubin viesse equipada com 288 GB de HBM4, usando oito pilhas de 12 camadas. O Morgan Stanley prevê que a Nvidia possa acrescentar uma versão equipada com 192 GB de HBM4, reduzindo o número de camadas empilhadas para oito. Para a Rubin Ultra, o relatório considera que 512 GB é uma base de comparação mais adequada após a mudança para uma configuração com dois chiplets de computação. No futuro, poderão surgir opções com capacidades variadas, de aproximadamente 192 GB a 384 GB. Essas são avaliações do Morgan Stanley sobre as configurações dos produtos até a data de publicação do relatório; nem todas as especificações foram confirmadas oficialmente pela Nvidia. Do ponto de vista dos custos, essa estratégia faz bastante sentido. Reduzir o número de camadas empilhadas de HBM diminui a capacidade e, se o número de interfaces e a velocidade dos pinos permanecerem iguais, a largura de banda teórica não necessariamente cairá na mesma proporção. Mas capacidade e largura de banda resolvem problemas diferentes. Em aplicações com modelos menores e contextos mais curtos, a redução da capacidade pode ter impacto limitado. Porém, à medida que os modelos crescem e as tarefas de inferência ficam mais complexas, a falta de memória pode exigir que mais dados sejam transferidos entre diferentes níveis de armazenamento, aumentando a latência ou a utilização das GPUs. Mais importante, reduzir a HBM não faz desaparecer os dados que a IA precisa processar; apenas leva esses dados a procurar outros locais para serem armazenados. Por exemplo, quando a capacidade de HBM da GPU é insuficiente, parte dos dados pode precisar ser armazenada na memória principal. Quando a capacidade de LPDDR5 em nível de rack diminui, parte da demanda por KV Cache (cache de chave-valor) também pode migrar para a memória flash NAND. KV Cache é um cache usado para armazenar informações de cálculos anteriores durante a inferência de grandes modelos. Sua necessidade de capacidade aumenta à medida que o contexto fica mais longo e cresce o número de solicitações executadas simultaneamente. A demanda por memória não desapareceu; apenas migra para outros níveis. O Morgan Stanley observa que, ao mesmo tempo que a Nvidia reduz algumas configurações de LPDDR5, a cadeia de suprimentos já observa um aumento da demanda por NAND. A redução da capacidade de HBM também pode aumentar a transferência de dados entre GPUs, pressionando ainda mais as redes de interconexão de alta velocidade. A demanda não desapareceu: os dados estão sendo direcionados para NAND e chips de interconexão Isso significa que a estratégia da Nvidia de reduzir as especificações pode aliviar temporariamente as restrições de oferta de DRAM, mas, ao mesmo tempo, aumentar a demanda por NAND, chips de interconexão e clusters de GPUs maiores. Há fatores estruturais de longo prazo por trás dessa transferência de pressão. De acordo com dados históricos da Epoch AI citados no relatório, durante a era dos grandes modelos de linguagem, o número de parâmetros dos modelos de ponta cresceu a uma taxa que chegou a dobrar aproximadamente a cada seis meses. As janelas de contexto também se expandiram rapidamente. Além disso, mais aplicações de IA estão deixando para trás perguntas e respostas simples e passando a realizar programação, raciocínio complexo e tarefas de agentes executadas por longos períodos, o que eleva ainda mais o uso de memória. O Morgan Stanley acredita que o tamanho dos modelos, a extensão do contexto e o número de inferências simultâneas continuarão impulsionando o crescimento da demanda por armazenamento. Portanto, a redução das especificações de alguns produtos tende a ser uma solução temporária durante períodos de oferta restrita, e não um sinal de queda prolongada na demanda por memória para IA. Se reduzir as configurações de memória é uma resposta de curto prazo, mudar a forma como a inferência de IA é computada pode trazer transformações mais profundas para o setor. O Morgan Stanley está atento a uma segunda via... «Por que a escassez de memória para IA leva a Nvidia a reduzir as especificações? Morgan Stanley: o gargalo direcionará os dados para NAND e chips de interconexão» foi publicado originalmente no BlockTempo (Dongqu — o veículo de notícias sobre blockchain mais influente).
