GLM-5.2 offre aux modèles de codage en open-weight une fenêtre de contexte de 1M tokens. Le défi, c’est de servir l’intégralité de cette fenêtre sur le matériel que beaucoup d’équipes utilisent déjà en production : Hopper.

Nous avons quantifié GLM-5.2-FP8 en W4AFP8 et l’avons validé sur un seul nœud 8×H200 avec SGLang. Le checkpoint réduit la mémoire des poids de 755 Go à 368 Go, libérant 387 Go de HBM pour le cache KV de 1M tokens et la marge d’exécution.

Pourquoi c’est important

GLM-5.2 a déjà résolu le côté modèle du long contexte : attention clairsemée, IndexShare, décodage spéculatif MTP, utilisation d’outils, raisonnement, et une fenêtre de 1 048 576 tokens. Le déploiement pose encore un second problème. Une fenêtre de 1M tokens doit laisser de la place pour les poids du modèle, le cache KV, les CUDA graphs, les buffers d’exécution et la surcharge liée au service.

Le checkpoint FP8 officiel constitue la base de référence idéale pour le déploiement. Sur Hopper, cette référence laisse beaucoup moins de marge mémoire lorsque l’on s’approche de la fenêtre de contexte complète. W4AFP8 modifie le budget mémoire sans changer la famille de modèles, le tokenizer, la forme de l’API ni le comportement de GLM-5.2.