GLM-5.2 memberikan model pengkodean open-weight dengan konteks window 1M-token yang nyata. Bagian sulitnya adalah menyajikan seluruh window itu pada perangkat keras yang banyak digunakan tim dalam produksi: Hopper.
Kami telah mengkuantisasi GLM-5.2-FP8 menjadi W4AFP8 dan mengvalidasinya pada satu node 8×H200 dengan SGLang. Titik pemeriksaan memangkas memori berat dari 755 GB menjadi 368 GB, membebaskan 387 GB HBM untuk cache KV 1M-token dan ruang kerja runtime.
Mengapa ini penting
GLM-5.2 sudah menyelesaikan sisi model dari konteks panjang: perhatian yang jarang, IndexShare, dekoding spekulatif MTP, penggunaan alat, penalaran, dan window 1.048.576-token. Penyebaran masih memiliki masalah kedua. Sebuah window 1M-token membutuhkan ruang untuk bobot model, cache KV, grafik CUDA, buffer runtime, dan overhead penyajian.
Titik pemeriksaan FP8 resmi adalah baseline penyajian umum yang tepat. Di Hopper, baseline itu meninggalkan lebih sedikit ruang memori setelah Anda mendorong menuju window konteks penuh. W4AFP8 mengubah anggaran memori tanpa mengubah keluarga model, tokenizer, bentuk API, atau perilaku GLM-5.2.
Kami telah mengkuantisasi GLM-5.2-FP8 menjadi W4AFP8 dan mengvalidasinya pada satu node 8×H200 dengan SGLang. Titik pemeriksaan memangkas memori berat dari 755 GB menjadi 368 GB, membebaskan 387 GB HBM untuk cache KV 1M-token dan ruang kerja runtime.
Mengapa ini penting
GLM-5.2 sudah menyelesaikan sisi model dari konteks panjang: perhatian yang jarang, IndexShare, dekoding spekulatif MTP, penggunaan alat, penalaran, dan window 1.048.576-token. Penyebaran masih memiliki masalah kedua. Sebuah window 1M-token membutuhkan ruang untuk bobot model, cache KV, grafik CUDA, buffer runtime, dan overhead penyajian.
Titik pemeriksaan FP8 resmi adalah baseline penyajian umum yang tepat. Di Hopper, baseline itu meninggalkan lebih sedikit ruang memori setelah Anda mendorong menuju window konteks penuh. W4AFP8 mengubah anggaran memori tanpa mengubah keluarga model, tokenizer, bentuk API, atau perilaku GLM-5.2.
