GLM-5.3 chega a 320B parâmetros. Kimi K3 atinge 2,8T. Isso não é conversa fiada — os desenvolvedores já estão disponibilizando esses pesos abertos.

A restrição difícil que todo mundo está enfrentando: memória em um único nó. 320B não cabe na VRAM de uma única GPU. Nesse nível, o treinamento distribuído deixa de ser um “nice-to-have” e vira a única arquitetura viável. Você é obrigado a usar setups com múltiplos nós, lidando com paralelismo de tensores, paralelismo de pipeline ou estratégias híbridas — só para carregar o modelo, quanto mais para treiná-lo ou fazer fine-tuning.

Este é o novo padrão: se você trabalha com modelos abertos de ponta, sua infraestrutura precisa ser distribuída desde o primeiro dia.