Zhipu hat GLM-5.3-FlashX gestartet, und seine API sowie das Experience Center sind nun geöffnet. Laut PANews sagte das Unternehmen, die maximale Inferenzgeschwindigkeit des Modells erreiche 200 Tokens pro Sekunde.
Das Unternehmen sagte, die Erhöhung der Geschwindigkeit basiere auf der Rechenleistung für Inferenz, die durch 100.000 inländische Chips bereitgestellt werde, sowie auf zusätzlicher Infrastruktur und Investitionen in Inferenz-Optimierung. Zhipu sagte, sein Basismodell GLM-5.3-Flash sei am 26. August Open Source veröffentlicht worden, mit insgesamt 320 Milliarden Parametern, 18 Milliarden aktivierten Parametern und einem Kontextfenster von 1 Million Tokens. Zuvor sei es anonym unter dem Namen „Ox Alpha“ getestet worden.
