GLM-5.2 oferece aos modelos de codificação de peso aberto uma verdadeira janela de contexto de 1M-token. A parte difícil é servir essa janela completa no hardware que muitas equipes já utilizam em produção: Hopper.

Quantizamos o GLM-5.2-FP8 em W4AFP8 e validamos em um único nó 8×H200 com SGLang. O ponto de verificação reduz o peso da memória de 755 GB para 368 GB, liberando 387 GB de HBM para o cache KV de 1M-token e espaço de manobra em tempo de execução.

Por que isso importa

O GLM-5.2 já resolveu o lado do modelo de longo contexto: atenção esparsa, IndexShare, decodificação especulativa MTP, uso de ferramentas, raciocínio e uma janela de 1.048.576 tokens. A implantação ainda tem um segundo problema. Uma janela de 1M-token precisa de espaço para os pesos do modelo, cache KV, gráficos CUDA, buffers de tempo de execução e sobrecarga de serviço.

O ponto de verificação oficial FP8 é a linha de base geral de serviço correta. No Hopper, essa linha de base deixa muito menos folga de memória uma vez que você avança em direção à janela de contexto completa. W4AFP8 muda o orçamento de memória sem alterar a família do modelo, tokenizer, formato da API ou comportamento do GLM-5.2.