Xiaomi MiMo bringt UltraSpeed Inferenzmodus: Einzelne Nodes knacken 1000 Tokens/s

Das Xiaomi MiMo-Team hat in Zusammenarbeit mit dem AI-Compiler-Optimierungssystem TileRT den MiMo-V2.5-Pro-UltraSpeed Inferenzmodus vorgestellt. Auf einem Standard-GPU-Nodes mit 8 Karten wurde es geschafft, ein MoE-Modell mit 1 Billion Parametern mit über 1000 Tokens/s zu generieren, wobei Spitzenwerte von etwa 1200 Tokens/s erreicht wurden. Dies markiert den ersten Durchbruch der 1T Modell-Generierungsgeschwindigkeit auf 1000 Tokens, ohne spezialisierte Chips nur mit gängiger Hardware.

Warum das wichtig ist: Dieser Durchbruch bedeutet, dass die Kosten für die Inferenz großer Modelle erheblich gesenkt werden, da MoE-Modelle auf dem Niveau von Billionen Parametern in der Lage sind, Echtzeit-Inferenz auf normalen GPU-Servern durchzuführen und die Umsetzung von KI-Anwendungen zu beschleunigen.

#小米 #MiMo #AI #推理 #Großes Modell