Mensaje de BlockBeats: el 8 de agosto, un desarrollador ha publicado recientemente de código abierto el proyecto kimi-k3-in-c, que intenta hacer que el modelo Kimi K3 de 2,78 billones de parámetros funcione en dispositivos con solo 8 GB de memoria. Este proyecto tiene únicamente 176 KB, está escrito íntegramente en C99 y no depende de GPU, CUDA, PyTorch ni BLAS; solo con CPU puede completar la inferencia del modelo.


Este plan aprovecha las características de la arquitectura MoE (mezcla de expertos) de Kimi K3. Aunque el tamaño total de los parámetros del modelo alcanza 2,78 T, dentro de cada capa, de entre los 896 expertos solo se activan 16; por lo tanto, los desarrolladores no cargaron en memoria todo el peso del modelo, de aproximadamente 1,56 TB, sino que almacenaron la mayor parte de los pesos de los expertos en un disco duro NVMe y los leen en tiempo real según las necesidades de inferencia. Además, algunas capas densas (dense trunk) también adoptan una carga en streaming capa por capa.


Sin embargo, el esquema todavía presenta limitaciones de rendimiento evidentes. En el modo de 8GB de memoria, generar un token por el modelo tarda aproximadamente 32,7 segundos, y además requiere un almacenamiento ultrarrápido de casi 1,7TB para funcionar.


Los desarrolladores afirman que, por ahora, este esquema se parece más a una exploración experimental en la dirección de la optimización de infraestructuras para la inferencia de modelos grandes, y no tiene valor práctico para uso en producción. Sin embargo, mediante el método de «carga en streaming desde el disco + activación dispersa (MoE)», ofrece una nueva idea para ejecutar en el futuro modelos de escala extremadamente grande a bajo costo.