🚨 $KIMI REDUCE 2.78T PARÁMETROS A 8GB DE RAM — ¡SIN GPU! 💥
🔍 Este experimento open-source desafía cada suposición sobre el escalado de la inferencia. Un proyecto puro en C99 de 176KB ejecuta el conjunto de pesos de 1.56TB de Kimi K3 con solo 8GB de memoria, transmitiendo los pesos de expertos desde el almacenamiento NVMe bajo demanda. 💡
La magia es la activación dispersa MoE — solo 16 de 896 expertos están activos por capa. Así que el desarrollador intercambia el ancho de banda del almacenamiento flash por RAM, tratando el disco como una extensión lenta de la memoria. 📊 El costo es brutal: un token cada 32.7 segundos. No está listo para producción, pero es un plano estructural para infraestructura de inferencia de ultra-bajo costo.
La señal más grande es la dirección. 📉 A medida que los cuellos de botella del hardware obligan a crear ingeniería ingeniosa, la eficiencia se convierte en la próxima narrativa. ¿Estamos construyendo la plomería para la próxima ola de IA descentralizada? 💬
⚠️ No es asesoramiento financiero. Gestiona siempre tu riesgo. 🛡️
🏷️
#KIMI #AI #MoE #OpenSource #Crypto 💡 🔥