Le vendeur de GPU Tinygrad a déclaré que, selon des sources fiables, le modèle GLM 5.2 peut atteindre une vitesse d'inférence de 120 tokens par seconde sur deux tinyboxes Blackwell connectées. Cette configuration est au prix de 150 000 dollars, avec une option pour deux tinyboxes standard ou une tinybox Pro, toutes deux capables d'atteindre les performances mentionnées. Tinygrad utilise cela comme argument de vente, en se positionnant sur le créneau de « achat unique, jamais de frais cloud » pour le déploiement privé, en concurrence directe avec les services d'inférence cloud à la demande. Actuellement, cette information n'a pas encore été confirmée par l'équipe de GLM, et Tinygrad n'a pas divulgué plus de détails techniques.---------------------------------Cliquez sur le lien ci-dessous pour accéder au texte original et rejoindre le canal d'actualités Beating · Feishu AI, surveillant en continu les actualités et les points chauds de l'IA dans le monde 24/7.