O vendedor de GPU Tinygrad publicou que, segundo fontes confiáveis, o modelo GLM 5.2 pode alcançar uma velocidade de inferência de 120 tokens por segundo em duas tinyboxes Blackwell conectadas. Essa configuração tem um preço de 150 mil dólares, podendo escolher entre duas tinyboxes padrão ou uma tinybox Pro, ambas alcançando esse desempenho. Tinygrad utiliza isso como um ponto de venda, focando na abordagem de "compra única, nunca pague por taxas de nuvem", diretamente competindo com serviços de inferência em nuvem que cobram por demanda. Até o momento, essa informação não foi confirmada oficialmente pela GLM, e a Tinygrad também não divulgou mais detalhes técnicos.---------------------------------Clique no link original abaixo e junte-se ao canal de notícias Beating · Feishu AI, monitorando 24 horas por dia, 7 dias por semana, os principais pontos e notícias sobre IA no mundo.