GLM-5.2 предоставляет модели с открытым весом реальное окно контекста в 1M-токен. Сложная часть заключается в том, чтобы обслужить это полное окно на оборудовании, которое многие команды уже используют в производстве: Hopper.

Мы квантизировали GLM-5.2-FP8 в W4AFP8 и проверили его на одном узле 8×H200 с SGLang. Контрольная точка сокращает вес памяти с 755 ГБ до 368 ГБ, освобождая 387 ГБ HBM для кэша KV на 1M-токен и времени выполнения.

Почему это важно

GLM-5.2 уже решил модельную сторону длинного контекста: разреженное внимание, IndexShare, MTP спекулятивное декодирование, использование инструментов, логическое мышление и окно в 1,048,576 токенов. Развертывание все еще имеет вторую проблему. Окно в 1M-токен нуждается в месте для весов модели, кэша KV, графиков CUDA, буферов времени выполнения и накладных расходов на обслуживание.

Официальная контрольная точка FP8 - это правильная общая базовая линия обслуживания. На Hopper эта базовая линия оставляет гораздо меньше памяти, когда вы продвигаетесь к полному окну контекста. W4AFP8 меняет бюджет памяти, не меняя семейство моделей, токенизатор, форму API или поведение GLM-5.2.