GLM-5.2 توفر نماذج ترميز ذات وزن مفتوح بسياق حقيقي يتكون من 1M توكن. الجزء الصعب هو تقديم هذه النافذة الكاملة على الأجهزة التي تعمل بها العديد من الفرق بالفعل في الإنتاج: هوبر.

لقد قمنا بتكميم GLM-5.2-FP8 إلى W4AFP8 وأكدنا ذلك على عقدة واحدة 8×H200 مع SGLang. النقطة المرجعية تقلل الذاكرة المستخدمة من 755 جيجابايت إلى 368 جيجابايت، مما يوفر 387 جيجابايت من HBM لمخزن KV الخاص بـ 1M توكن وحرية التشغيل.

لماذا هذا مهم

لقد حلت GLM-5.2 بالفعل جانب النموذج في السياق الطويل: الانتباه المتناثر، IndexShare، فك التشفير الاستباقي MTP، استخدام الأدوات، المنطق، ونافذة تتكون من 1,048,576 توكن. لا يزال النشر لديه مشكلة ثانية. تحتاج نافذة 1M توكن إلى مساحة لوزن النموذج، مخزن KV، رسوم CUDA، وسائد التشغيل، والعبء الزائد في الخدمة.

النقطة المرجعية الرسمية FP8 هي القاعدة العامة الصحيحة للخدمة. على هوبر، تترك هذه القاعدة مساحة أقل بكثير للذاكرة بمجرد أن تدفع نحو النافذة الكاملة للسياق. تغير W4AFP8 ميزانية الذاكرة دون تغيير عائلة النموذج، أو موحد الرموز، أو شكل API، أو سلوك GLM-5.2.