El vendedor de GPU, Tinygrad, publicó que, según fuentes confiables, el modelo GLM 5.2 puede lograr una velocidad de inferencia de 120 tokens por segundo en dos tinybox conectadas con arquitectura Blackwell. Esta configuración tiene un precio de 150,000 dólares y se puede optar por dos tinybox estándar o una tinybox Pro, ambas alcanzando el rendimiento mencionado. Tinygrad utiliza esto como su punto de venta, enfocándose en la ruta de implementación privatizada de "compra única, nunca pagues tarifas de nube", compitiendo directamente con los servicios de inferencia en la nube de pago por uso. Hasta ahora, esta información no ha sido confirmada oficialmente por GLM, y Tinygrad no ha revelado más detalles técnicos.--------------------------------- Haz clic en el enlace original a continuación para unirte al canal de noticias AI de Beating · Feishu, monitoreando 24/7 los puntos calientes y noticias de AI a nivel mundial.