BlockBeats 消息,8 月 8 日,有开发者近日开源项目 kimi-k3-in-c,尝试让拥有 2.78 万亿参数的 Kimi K3 模型在仅 8GB 内存的设备上运行。该项目仅 176KB,采用纯 C99 编写,不依赖 GPU、CUDA、PyTorch 或 BLAS,仅通过 CPU 即可完成模型推理。


该方案利用 Kimi K3 的 MoE(混合专家)架构特性。虽然模型总参数规模达到 2.78T,但每层 896 个专家中仅激活 16 个,因此开发者没有将完整约 1.56TB 模型权重加载进内存,而是将大部分专家权重存储在 NVMe 硬盘中,根据推理需求实时读取;同时,部分密集层(dense trunk)也采用逐层流式加载方式。


不过,该方案目前仍存在明显性能限制。在 8GB 内存模式下,模型生成一个 token 大约需要 32.7 秒,同时需要接近 1.7TB 高速存储空间支持。


开发者表示,这一方案目前更像是对大模型推理基础设施优化方向的一次实验探索,并不具备实际生产使用价值,但其通过「硬盘流式加载+MoE 稀疏激活」的方式,为未来低成本运行超大规模模型提供了一种新思路。