Der GPU-Händler Tinygrad hat gepostet: Laut zuverlässigen Informationen kann das GLM-5.2-Modell auf zwei vernetzten Blackwell-Architektur-Tinyboxen eine Inferenzgeschwindigkeit von 120 Tokens pro Sekunde erreichen. Diese Konfiguration kostet 150.000 US-Dollar; wahlweise mit zwei Standard-Tinyboxen oder mit einer einzelnen Tinybox Pro – in beiden Fällen sind die oben genannten Leistungswerte erreichbar. Tinygrad vermarktet das als Verkaufsargument und setzt auf den Weg der privaten Bereitstellung mit dem Slogan „Einmal kaufen, niemals Cloud-Gebühren zahlen“, direkt als Gegenstück zu den nutzungsabhängig abgerechneten Cloud-Inferenzdiensten. Derzeit ist diese Meldung noch nicht offiziell von GLM bestätigt, und Tinygrad hat zudem keine weiteren technischen Details offengelegt.---------------------------------Klicken Sie auf den Link zur Originalquelle unten und treten Sie dem Insights Beating · Feishu AI News-Kanal bei. 7×24 Stunden lang ohne Unterbrechung überwachen wir globale AI-Hotspots und -Nachrichten.